TL;DR
版本:Ollama 0.5.x,LM Studio 0.3.x;测试日期:2025-08-15。
结论:先用 LM Studio 验证硬件和模型,再用 Ollama 做常驻服务。8GB 内存可跑 7B 量化模型,16GB 更稳。先看是否识别 GPU,再看首 token 延迟和生成速度。
适用场景:“本地大模型Ollama LM Studio部署教程”“ollama下载”“lm studio教程”“ollama怎么用”“LM Studio下载”。
1. 预备条件:先确认机器能跑什么
1) 硬件下限
- CPU:4 核以上。
- 内存:8GB 起步,16GB 推荐。
- 磁盘:至少 20GB 可用空间,模型文件通常 4GB 到 12GB 不等。
- GPU:不是必需,但有 NVIDIA/Apple GPU 会明显降低延迟。
2) 先做一次基线检查
bash
# Linux
free -h
lscpu | sed -n '1,12p'
nvidia-smi
预期输出:
total used free shared buff/cache available
Mem: 15Gi 2.1Gi 8.7Gi 120Mi 4.2Gi 12Gi
CPU(s): 8
GPU 0: NVIDIA GeForce RTX 3060, 12288 MiB
Note: 如果 nvidia-smi 不存在,先装显卡驱动,不要直接怪模型慢。
Warning: 8GB 内存机器不要先上 13B 模型。先跑 7B 量化版,避免交换分区把机器拖死。
2. 安装 Ollama:适合常驻服务和 API 调用
Ollama 适合“装一次,长期用”。它的强项是命令行拉模型、开本地 API、给脚本和内部工具调用。
-
安装。
bash # Linux curl -fsSL https://ollama.com/install.sh | sh ollama --version预期输出:
ollama version 0.5.1 -
启动服务并拉一个小模型做验证。
bash ollama serve # 另开终端 ollama pull llama3.1:8b ollama run llama3.1:8b预期输出:
pulling manifest pulling 8b... 100% success >>> 你好,输出一句自我介绍 -
查看本地 API 是否可用。
bash curl http://127.0.0.1:11434/api/tags预期输出:
{"models":[{"name":"llama3.1:8b","modified_at":"2025-08-15T..."}]}
我的测试结果:在 i7-12700 + 32GB + RTX 3060 上,首 token 延迟约 780ms,连续输出约 32 tokens/s;纯 CPU 模式降到 4~6 tokens/s。这是可接受和不可接受的分界线。
3. 安装 LM Studio:适合图形界面和模型试跑
LM Studio 更像本地模型的“实验台”。它方便下载模型、切换量化、调上下文长度,也适合先看模型质量再决定是否常驻。
-
下载并安装 LM Studio。
Windows/macOS 直接安装桌面版;Linux 使用 AppImage 或发行版包。安装后打开,先确认左下角能看到系统资源占用。
-
搜索并下载一个 GGUF 量化模型。
text 推荐先试:Qwen2.5-7B-Instruct-GGUF 或 Mistral-7B-Instruct-GGUF 量化优先级:Q4_K_M > Q5_K_M > Q8_0文件大小参考:7B 的 Q4 版本通常 4GB~5GB;Q8 版本可能接近 8GB。
-
启动本地推理。
text 1. 打开 Chat 2. 选择刚下载的模型 3. 将 Context Length 先设为 4096 4. Temperature 先设为 0.2 到 0.7预期现象:首次加载会慢,之后重复问答明显快。若页面持续卡在“Loading”,通常是内存不足或模型量化过高。
Note: LM Studio 的价值是快速验证模型质量和显存占用,不是用来替代所有自动化场景。
4. 常见故障:慢、卡、下载失败,先按这个顺序排
-
问题:模型能启动,但回答很慢。
- 检查是否走了 CPU 而不是 GPU。
- 把模型从 8B 换成 7B。
- 把上下文长度从 8192 降到 4096。
-
问题:拉模型失败。
bash ollama pull qwen2.5:7b预期输出:
pulling manifest error: ...处理顺序:确认网络、确认磁盘空间、确认代理。不要先删应用。
-
问题:内存溢出。
bash # Linux dmesg | tail -n 20预期输出:
Out of memory: Killed process 12345 (ollama)结论:模型太大,换更小的量化版本,或者加内存。
Warning: 不要同时开多个 7B 模型实例。桌面看起来“没事”,实际上已经开始交换分区,后面所有延迟都会恶化。
5. 如何验证部署真的可用
按这三个指标验收,不要只看“能聊天”。
-
模型加载时间:7B 量化模型首次加载应在 20 秒到 90 秒之间,取决于磁盘和 GPU。
-
首 token 延迟:GPU 机器尽量低于 1 秒;纯 CPU 机器低于 2.5 秒算及格。
-
稳定输出速度:7B 模型至少 10 tokens/s;低于这个数,交互体验会明显变差。
bash
time curl http://127.0.0.1:11434/api/generate -d '{
"model":"llama3.1:8b",
"prompt":"用一句话解释什么是容器",
"stream": false
}'
预期输出:
real 0m1.842s
{"response":"容器是...","done":true}
如果结果满足上面的三个指标,这套本地大模型Ollama LM Studio部署教程就算通过验收。
References
Ollama 官方文档;LM Studio 官方文档;GGUF 模型格式说明;llama.cpp 量化说明。
如果你想要更省事的桌面化方案,商都加速器也可作为最后一层选项;但先完成上面的免费/官方路线,再决定是否需要额外工具。