AI 本地部署入门:零基础三步跑起大模型,完全免费

用了很久的 ChatGPT,你有没有过这样的想法:能不能在自己电脑上跑一个 AI,不用联网、不用注册、完全免费?答案是肯定的。2024 年以来,一批开源工具让本地部署大模型变得像安装微信一样简单。这篇文章,从零开始,带你三步跑起来。
为什么要在本地部署 AI
本地部署意味着 AI 模型完全运行在你的电脑上,不经过任何第三方服务器。相比云端 AI 服务,本地部署有几个不可替代的优势:
- 完全免费——不用注册账号,不用充值,不用买会员,跑多少次都不花钱
- 数据隐私——你的输入和输出都在自己机器上,不上传任何云端,聊什么都不泄露
- 不受限——不用怕内容审核、不用怕限流,想问什么就问什么
- 离线可用——断网也能用,出差坐飞机、去没网的地方都不影响
唯一的代价是:你需要一台性能尚可的电脑。8GB 显卡起步,能跑 7B 级别的模型;16GB 显卡可以跑更大的模型。如果没有独立显卡,CPU 也能跑,只是速度慢一些。
下面先看一下主流工具怎么选:
第一步:选一个部署工具
对于零基础用户,推荐从 Ollama 或 LM Studio 开始。两者各有侧重:
- Ollama——命令行工具,一条命令下载模型、一条命令开始对话。功能简洁,适合喜欢极简操作的人
- LM Studio——图形界面,点鼠标下载、点鼠标开始对话。完全不需要敲命令,适合对命令行有畏惧感的人
两者的底层能力几乎一样,选哪个都行。如果你连命令行也不想碰,直接选 LM Studio。
安装 Ollama
- 打开 ollama.com,点击下载按钮
- 根据你的操作系统选择 Windows / macOS / Linux 版本
- 下载后双击安装,一路点击"下一步"即可
- 安装完成后,打开终端(Windows 用 PowerShell,macOS 用 Terminal)
- 输入
ollama --version,看到版本号就说明安装成功
安装 LM Studio 的方式几乎一样:去 lmstudio.ai 下载,双击安装,打开应用即可。
第二步:下载模型
模型就是 AI 的大脑。不同的模型擅长不同的事,有的擅长写代码,有的擅长翻译,有的擅长通用对话。对于新手,推荐从 Qwen2.5 或 Llama 3 开始,这两个模型质量好、社区活跃、文档丰富。
用 Ollama 下载模型,只需要一条命令:
ollama pull qwen2.5
这条命令会自动联网下载 Qwen2.5 模型。模型大小约 4GB,根据网络情况需要几分钟到几十分钟。下载完成后没有任何提示,命令行直接回到输入状态,说明已完成。
想用其他模型,把 qwen2.5 换成对应的名称即可,比如:
ollama pull llama3.2——Meta 的通用对话模型ollama pull deepseek-r1——深度思考模型,擅长数学和逻辑推理ollama pull codellama——代码专用模型
如果用 LM Studio,打开应用后在搜索框输入模型名,点击下载,等待完成即可。整个过程和在网上下载软件没有区别。
第三步:开始对话
模型下载完成后,就可以开始使用了。
用 Ollama,一条命令启动对话:
ollama run qwen2.5
命令执行后,终端会出现一个输入提示符。输入你的问题,回车发送,模型会直接在终端中输出回答。想结束对话,输入 /bye 或按 Ctrl+C。
如果觉得命令行不够好用,这里有两个进阶方案:
- LM Studio 自带聊天界面——模型下载后,切换到 Chat 标签页,选择一个模型,直接开始对话
- Open WebUI——一个网页版界面,看起来几乎和 ChatGPT 一模一样,支持上传文件、多轮对话、对话历史管理
整体流程非常简单,如下图所示:
选多大模型:7B、13B、70B 怎么选
模型名称后面通常跟着一个数字,比如 qwen2.5:7b、qwen2.5:14b。这个数字代表模型的参数量,直接影响能力和资源消耗。
- 7B 模型——最小,占用内存少,响应快,8GB 显卡就能跑。适合日常聊天、简单写作、翻译。新手从这里开始
- 13B / 14B 模型——能力更强,写作质量更高,推理更准确。需要 16GB 显卡。推荐给有一定基础的用户
- 70B 模型——能力接近云端顶级模型,但需要 48GB 以上显存,消费级显卡难以运行。一般用户不需要
对于大多数新手,7B 模型完全够用。如果你用 16GB 显卡,可以试试 14B,体验会有明显提升。
常见问题
问:我电脑没有独立显卡能跑吗?
可以。Ollama 和 LM Studio 都支持 CPU 运行。速度会比 GPU 慢很多——GPU 可能是每秒几十个 token,CPU 可能每秒几个 token。但对于日常对话来说,完全可以接受。
问:下载模型很慢怎么办?
模型文件通常 2-8GB,下载速度取决于你的网络。如果默认镜像很慢,可以在 Ollama 中设置国内镜像源。在终端输入:
ollama serve --host 0.0.0.0:11434
然后在 Ollama 设置中将模型仓库地址改为国内镜像。LM Studio 则可以在设置中更改下载源。
问:模型跑着跑着卡死了?
大概率是内存不够。如果你运行的是 14B 模型,但只有 8GB 显存,系统会自动用内存补充,速度会急剧下降甚至卡死。解决办法:换一个更小的模型,比如从 14B 降到 7B。
问:能同时跑多个模型吗?
可以,但不建议。多个模型同时加载会占用大量显存和内存。需要切换模型时,用 ollama run 模型名 即可,系统会自动管理加载和卸载。
装完之后能做什么
模型跑起来后,你能做的事情比你想象的多:
- 日常对话——和聊天机器人一样,问问题、查资料、头脑风暴
- 写文章写代码——让模型帮你起草邮件、写报告、生成代码片段
- 翻译——本地翻译,敏感内容不上传云端
- 接客户端——Ollama 会启动一个本地 API 服务,你可以用 Chatbox、Open WebUI 等客户端连接它,获得更舒适的使用体验
- 挂载本地文件——让模型阅读你本地的文档、笔记、代码,基于你的资料回答
总结
本地部署 AI 的核心优势就是四个字:完全免费。不需要注册、不需要充值、不需要担心隐私。
整个部署流程总结起来就是三件事:
- 下载安装 Ollama 或 LM Studio
- 用一条命令下载一个模型
- 用一条命令开始对话
10 分钟,从安装到能用。如果你还在为 ChatGPT 的月费犹豫,本地部署可能是最好的替代方案。
Related Articles
AI 帮你做购物决策:从比价到避坑的完整实操指南
买手机、买耳机、买电脑,AI 真的能帮你选对吗?本文用五个实操步骤,手把手教你让 AI 完成价格对比、参数解析、口碑筛选和避坑提醒,小白也能 10 分钟搞定购物决策。
TutorialsAI 语音输入与语音转文字:零基础 5 分钟上手,解放双手的写作新方式
打字太慢?说话比打字快 3 倍。这篇文章手把手教你用 AI 语音输入工具,从选择工具、开始录音到转文字、编辑导出,五大步骤、六大场景,让你从此"说话即写作"。
TutorialsAI Client Setup Guide: From API Key to Your First Call — Even Beginners Can Do It
Want to use AI without writing code yourself? This article walks you through configuring an AI client step by step—from registering and getting an API Key, to installing and configuring the Cherry Studio desktop client, to your first successful AI call. Every step includes detailed instructions and common troubleshooting answers.
Comments are not yet available, stay tuned