在本地跑一个大模型,从0到能用

王苏洋 2 阅读 1 评论 教程随笔

为什么要在本地跑模型?

ChatGPT、Claude、Gemini 这些在线服务已经很强了,但总有一些场景让你想把模型放在自己机器上:

  • 隐私数据:公司内部文档、个人日记、未公开代码,不想上传云端。
  • 网络不稳定:出差、校园网、偏远地区,在线服务可能随时掉线。
  • 成本控制:高频调用时,本地显存一次性投入,长期更划算。
  • 折腾的乐趣:毕竟,能在自己电脑上跑一个 70B 的模型,本身就挺酷的。

当然,本地部署也有代价:显存、电源、散热、调参。它不是万能解,而是特定场景下的一个可选项。


选型:Ollama vs LM Studio

如果你刚入门,建议从这两个工具开始。

工具优点缺点适合人群
Ollama命令行极简,一条命令拉模型;生态插件多界面较弱,主要面向开发者喜欢终端、想快速集成到工作流
LM Studio图形界面友好,内置聊天、模型搜索相对重,部分功能付费不想折腾命令行的普通用户

我自己的路径是:先用 LM Studio 验证模型能不能跑,再用 Ollama 常驻服务,配合 Obsidian/Cursor 做日常调用。


快速开始:用 Ollama 跑 Qwen3

以目前性价比很高的 Qwen3 为例,8B 版本在 16G 显存上能流畅运行。

1. 安装 Ollama

macOS / Linux:

curl -fsSL https://ollama.com/install.sh | sh

Windows 直接去官网下载安装包即可。

2. 拉取并运行模型

ollama pull qwen3:8b
ollama run qwen3:8b

第一次会下载约 5GB 的模型文件,之后就可以直接对话了。

3. 用 API 调用

Ollama 默认监听 11434 端口,兼容 OpenAI 风格的 API:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3:8b",
    "messages": [{"role": "user", "content": "帮我写一段 Python 快速排序"}]
  }'

这意味着你可以把它接到 ChatGPT-Next-Web、OpenWebUI、Cherry Studio 等客户端里,获得接近 ChatGPT 的体验。


几点实际经验

  1. 显存不够,量化来凑
    同样的 8B 模型,q4_K_M 量化后体积和显存占用能少一半,质量损失通常不明显。别一味追求 fp16。

  2. 上下文长度要量力而行
    本地模型不是服务器,上下文拉到 32K 以上,显存占用和生成速度都会显著恶化。日常写代码、查资料,8K 通常够用。

  3. 别把本地模型当万能大脑
    8B 级别的模型在逻辑推理、数学、长上下文方面仍有明显短板。适合场景:文档摘要、代码补全、格式转换、头脑风暴;不适合:复杂数学证明、跨多份长文档的严谨分析。

  4. 善用系统提示词
    给模型一个明确的角色和输出格式,能显著提升可用性。比如:

    你是一名资深后端工程师。回答要简洁,优先给出可运行的代码示例,并说明关键注意事项。
    

写在最后

本地大模型已经不是「极客玩具」了。随着 Qwen、Llama、Gemma 等开源模型越来越小、越来越强,普通笔记本也能跑出有实用价值的模型。

如果你的数据敏感、调用频繁,或者只是想少依赖一点云端服务,不妨花一会功夫搭一套本地环境。大概率你会发现:很多简单任务,本地模型已经够用了。