在本地跑一个大模型,从0到能用
为什么要在本地跑模型?
ChatGPT、Claude、Gemini 这些在线服务已经很强了,但总有一些场景让你想把模型放在自己机器上:
- 隐私数据:公司内部文档、个人日记、未公开代码,不想上传云端。
- 网络不稳定:出差、校园网、偏远地区,在线服务可能随时掉线。
- 成本控制:高频调用时,本地显存一次性投入,长期更划算。
- 折腾的乐趣:毕竟,能在自己电脑上跑一个 70B 的模型,本身就挺酷的。
当然,本地部署也有代价:显存、电源、散热、调参。它不是万能解,而是特定场景下的一个可选项。
选型:Ollama vs LM Studio
如果你刚入门,建议从这两个工具开始。
| 工具 | 优点 | 缺点 | 适合人群 |
|---|---|---|---|
| Ollama | 命令行极简,一条命令拉模型;生态插件多 | 界面较弱,主要面向开发者 | 喜欢终端、想快速集成到工作流 |
| LM Studio | 图形界面友好,内置聊天、模型搜索 | 相对重,部分功能付费 | 不想折腾命令行的普通用户 |
我自己的路径是:先用 LM Studio 验证模型能不能跑,再用 Ollama 常驻服务,配合 Obsidian/Cursor 做日常调用。
快速开始:用 Ollama 跑 Qwen3
以目前性价比很高的 Qwen3 为例,8B 版本在 16G 显存上能流畅运行。
1. 安装 Ollama
macOS / Linux:
curl -fsSL https://ollama.com/install.sh | sh
Windows 直接去官网下载安装包即可。
2. 拉取并运行模型
ollama pull qwen3:8b
ollama run qwen3:8b
第一次会下载约 5GB 的模型文件,之后就可以直接对话了。
3. 用 API 调用
Ollama 默认监听 11434 端口,兼容 OpenAI 风格的 API:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3:8b",
"messages": [{"role": "user", "content": "帮我写一段 Python 快速排序"}]
}'
这意味着你可以把它接到 ChatGPT-Next-Web、OpenWebUI、Cherry Studio 等客户端里,获得接近 ChatGPT 的体验。
几点实际经验
-
显存不够,量化来凑
同样的 8B 模型,q4_K_M量化后体积和显存占用能少一半,质量损失通常不明显。别一味追求 fp16。 -
上下文长度要量力而行
本地模型不是服务器,上下文拉到 32K 以上,显存占用和生成速度都会显著恶化。日常写代码、查资料,8K 通常够用。 -
别把本地模型当万能大脑
8B 级别的模型在逻辑推理、数学、长上下文方面仍有明显短板。适合场景:文档摘要、代码补全、格式转换、头脑风暴;不适合:复杂数学证明、跨多份长文档的严谨分析。 -
善用系统提示词
给模型一个明确的角色和输出格式,能显著提升可用性。比如:你是一名资深后端工程师。回答要简洁,优先给出可运行的代码示例,并说明关键注意事项。
写在最后
本地大模型已经不是「极客玩具」了。随着 Qwen、Llama、Gemma 等开源模型越来越小、越来越强,普通笔记本也能跑出有实用价值的模型。
如果你的数据敏感、调用频繁,或者只是想少依赖一点云端服务,不妨花一会功夫搭一套本地环境。大概率你会发现:很多简单任务,本地模型已经够用了。