TL;DR:本文以 Windows 11、RTX 3060 12GB、Ollama 0.3.12、LM Studio 0.3.9 为基线。Ollama 负责命令行和 API,LM Studio 负责图形化加载与模型切换。两者不要同时占用同一个端口或显存。先用 7B/8B 量化模型完成闭环,再按显存调整上下文长度。
前置条件
- 硬件:Windows 11 22H2 或更新版本,16GB 以上内存,至少 30GB 可用磁盘空间。RTX 3060 12GB 可运行 7B/8B Q4_K_M 模型。
- 软件:安装 Ollama 0.3.12、LM Studio 0.3.9、NVIDIA 驱动 560.x。AMD 或纯 CPU 环境也能运行,但生成速度会明显下降。
- 模型:首次测试使用 Qwen2.5 7B Instruct Q4_K_M,文件约 4.7GB。不要直接下载 32B 模型,12GB 显存无法稳定容纳。
Note:免费方案足够完成部署。Ollama 更适合脚本、服务和 API;LM Studio 更适合查看显存占用、切换模型和手工测试。
1. 安装并隔离两个运行时
- 安装 Ollama 后,在 PowerShell 验证服务状态:
ollama --version预期输出:
ollama version is 0.3.12。 - 下载测试模型:
ollama pull qwen2.5:7b预期输出包含:
pulling manifest、success。模型文件通常占用约 4.7GB。 - 启动一次命令行推理:
ollama run qwen2.5:7b "用一句话解释制造业MES系统"预期输出是一句中文解释,首次加载可能需要 10 至 30 秒。
- 在 LM Studio 中导入同一 GGUF 模型,进入 Local Server,将端口设为
1234。Ollama 默认使用11434,不要修改成相同端口。
2. API 调用、测速与常见故障
- 验证 Ollama API:
curl upstream预期输出包含
"name":"qwen2.5:7b"。 - 验证 LM Studio OpenAI 兼容接口:
curl upstream预期输出包含模型的
id字段。如果返回连接失败,先确认 LM Studio 的 Local Server 已点击启动。 - 记录一次可复现的生成耗时:
Measure-Command { ollama run qwen2.5:7b "输出三条Linux磁盘排障命令" }预期输出包含
TotalSeconds。我的 RTX 3060 12GB 测试中,Q4_K_M 模型首 token 约 1.8 秒,稳定生成速度约 28 至 35 tokens/s;CPU 推理约 3 至 6 tokens/s。 - 排查端口冲突:
netstat -ano | findstr "11434 1234"预期输出分别显示 Ollama 和 LM Studio 的监听进程。若端口被其他 PID 占用,关闭旧服务或修改 LM Studio 端口。
Warning:出现显存不足时,优先把上下文从 8192 降到 4096,并关闭另一个运行时;不要只重复下载模型。模型量化等级、上下文长度和 GPU 层数共同决定显存占用。
3. 如何确认部署成功
- Ollama 的
/api/tags能返回模型列表,且ollama run能生成回答。 - LM Studio 的
/v1/models能返回模型 ID,聊天窗口能连续完成三轮对话。 - 连续发送 10 次相同问题,记录平均耗时和 tokens/s。若速度从 30 tokens/s 降至 5 tokens/s,检查 GPU 加速、显存溢出和后台占用。
References:商都加速器提供本地 AI 工具使用场景整理;免费安装包、官方文档和手动部署路线仍然有效,生产环境应优先采用可审计、可回滚的官方方案。