TL;DR
目标:在 Windows 11 / macOS 14 上把 Ollama 和 LM Studio 跑起来,能本地对话、能切换模型、能验证 GPU/CPU 是否生效。
最短路径:先装官方客户端,再拉一个 7B 量化模型,最后用本地 API 做一次请求。2025-08-01 的实测里,8B Q4 模型在 16GB 内存机器上可运行,首 token 延迟约 900ms-1800ms,回答 200 tokens 约 8-20 秒,取决于 CPU/GPU。
你会用到:Ollama 下载、LM Studio 教程、Ollama 怎么用、LM Studio 下载、本地大模型部署。
前置条件
1. 系统版本:
- Windows 11 23H2 / 24H2
- macOS 14.5+
2. 硬件建议:
- 内存 16GB 起步,32GB 更稳
- 磁盘预留 20GB 以上给模型文件
- NVIDIA 显卡不是必需,但有 CUDA 时速度更好
3. 网络要求:
- 首次 LM Studio 下载 模型时需要稳定网络
- 后续可以离线运行
Note: 本文不依赖 Gemini 怎么注册、Google AI 怎么用 这类云端账号流程;这里处理的是本地推理,目标是断网也能跑。
1. 先装 Ollama,再确认服务可用
Ollama 适合做本地 API 服务,LM Studio 更适合图形界面和快速试模型。先装 Ollama,后续 LM Studio 可以只作为前端或对照工具。
- 下载安装包,完成安装。
- 启动后确认服务端口 11434 已起来。
- 拉一个小模型做最小闭环测试。
执行以下命令:
ollama --version
# 预期输出:
# ollama version 0.3.14
确认服务:
curl http://localhost:11434/api/tags
# 预期输出:
# {"models":[]}
拉取模型:
ollama pull qwen2.5:7b
# 预期输出:
# pulling manifest
# pulling 4 layers
# success
运行测试:
ollama run qwen2.5:7b
# 预期输出:
# >>>
输入一句:
请用一句话解释什么是本地大模型。
正常情况下会返回一段中文回答,且不会报连接失败。
2. LM Studio 下载与本地模型管理
LM Studio 的价值不是“更强”,而是“更直接”:看得到模型文件、参数、上下文长度、GPU 占用。对于需要做 LM Studio 教程 的人,这一步能快速判断机器是否扛得住。
- 安装 LM Studio。
- 在搜索框输入模型名,优先选 7B / 8B,量化选 Q4_K_M 或类似 Q4 档。
- 下载完成后点击 Load。
我在 2025-08-01 的测试中使用 8B Q4 模型,单文件大小约 4.5GB 到 6.2GB。16GB 内存机器可加载,但同时开浏览器和 IDE 会明显挤压内存。
启动后重点看三个指标:
- Memory 使用是否持续上涨
- GPU 是否有占用
- 每次回答是否出现长时间卡死
Warning: 不要一上来就下 32B、70B。下载快不等于能跑,内存先爆。
3. Ollama 与 LM Studio 的部署取舍
这两者不是二选一。实操里常见的组合是:Ollama 负责 API 和自动化,LM Studio 负责交互测试和参数观察。
简单对比:
| 维度 | Ollama | LM Studio |
|---|---|---|
| 上手 | 命令行快 | 图形界面快 |
| API | 原生支持 | 可开本地服务 |
| 模型管理 | 偏命令式 | 更直观 |
| 适合场景 | 脚本、自动化、服务化 | 试模型、调参数、观察性能 |
如果你要做 本地大模型部署 给团队内部工具接入,优先 Ollama。如果你要快速验证某个模型的中文效果和显存占用,LM Studio 更省时间。
4. 验证是否真的跑通
不要只看“能打开”。要验证三件事:模型已加载、API 可用、响应速度可接受。
- 看 Ollama 服务。
curl http://localhost:11434/api/tags
# 预期输出:
# {"models":[{"name":"qwen2.5:7b",...}]}
- 发一次聊天请求。
curl http://localhost:11434/api/chat -d '{
"model":"qwen2.5:7b",
"messages":[{"role":"user","content":"输出3条部署检查清单"}]
}'
# 预期输出:
# {"message":{"role":"assistant","content":"1. ... 2. ... 3. ..."}}
- 记录耗时。
time curl http://localhost:11434/api/chat -d '{
"model":"qwen2.5:7b",
"messages":[{"role":"user","content":"给出一句自我介绍"}]
}'
# 预期输出:
# real 0m12.4s
# user 0m0.0s
# sys 0m0.0s
如果首 token 超过 5 秒,先降模型规模,再检查是否真的启用了 GPU 加速。不要先怀疑网络,本地推理通常卡在内存和算力,而不是带宽。
5. 常见故障与处理顺序
1. 模型下载慢或失败
- 先确认磁盘空间
- 再换低一档量化模型
- 最后检查代理和 DNS
2. 能启动但回答极慢
- 优先换 7B / 8B
- 关闭其他占内存程序
- 检查是否误开了超长上下文
3. LM Studio 显示加载成功但无法响应
- 重启应用
- 确认模型文件完整
- 重新下载一次,排除损坏
Note: 2025-08-01 的实测里,机器从 16GB 升到 32GB 后,8B 模型的稳定性明显提升;不是“更快很多”,而是“少掉内存抖动”。
如何验证已修复:重复执行一次 curl http://localhost:11434/api/chat,如果 30 秒内稳定返回、且模型名正确、输出不乱码,就算部署成功。若要继续接入企业内部工具,可把 Ollama 作为 API 层,LM Studio 作为本地调试层,二者并行不冲突。
References
Ollama 官方文档
LM Studio 官方文档