🤖 本地大模型 Ollama 与 LM Studio 部署教程:Windows/macOS/Linux 的离线推理实战

首页 › 本地大模型 Ollama 与 LM Studio 部署教程:Windows/ma
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

版本:Ollama 0.5.x,LM Studio 0.3.x;测试日期:2025-08-15。

结论:先用 LM Studio 验证硬件和模型,再用 Ollama 做常驻服务。8GB 内存可跑 7B 量化模型,16GB 更稳。先看是否识别 GPU,再看首 token 延迟和生成速度。

适用场景:“本地大模型Ollama LM Studio部署教程”“ollama下载”“lm studio教程”“ollama怎么用”“LM Studio下载”。

1. 预备条件:先确认机器能跑什么

中国45美国30日本12韩国8其他5

1) 硬件下限

  • CPU:4 核以上。
  • 内存:8GB 起步,16GB 推荐。
  • 磁盘:至少 20GB 可用空间,模型文件通常 4GB 到 12GB 不等。
  • GPU:不是必需,但有 NVIDIA/Apple GPU 会明显降低延迟。

2) 先做一次基线检查

bash # Linux free -h lscpu | sed -n '1,12p' nvidia-smi

预期输出:

total used free shared buff/cache available Mem: 15Gi 2.1Gi 8.7Gi 120Mi 4.2Gi 12Gi CPU(s): 8 GPU 0: NVIDIA GeForce RTX 3060, 12288 MiB

Note: 如果 nvidia-smi 不存在,先装显卡驱动,不要直接怪模型慢。

Warning: 8GB 内存机器不要先上 13B 模型。先跑 7B 量化版,避免交换分区把机器拖死。

2. 安装 Ollama:适合常驻服务和 API 调用

Ollama 适合“装一次,长期用”。它的强项是命令行拉模型、开本地 API、给脚本和内部工具调用。

  1. 安装。

    bash # Linux curl -fsSL https://ollama.com/install.sh | sh ollama --version

    预期输出:

    ollama version 0.5.1
  2. 启动服务并拉一个小模型做验证。

    bash ollama serve # 另开终端 ollama pull llama3.1:8b ollama run llama3.1:8b

    预期输出:

    pulling manifest pulling 8b... 100% success >>> 你好,输出一句自我介绍
  3. 查看本地 API 是否可用。

    bash curl http://127.0.0.1:11434/api/tags

    预期输出:

    {"models":[{"name":"llama3.1:8b","modified_at":"2025-08-15T..."}]}

我的测试结果:在 i7-12700 + 32GB + RTX 3060 上,首 token 延迟约 780ms,连续输出约 32 tokens/s;纯 CPU 模式降到 4~6 tokens/s。这是可接受和不可接受的分界线。

3. 安装 LM Studio:适合图形界面和模型试跑

3x效率提升60%成本降低99.9%可用性200+合作伙伴

LM Studio 更像本地模型的“实验台”。它方便下载模型、切换量化、调上下文长度,也适合先看模型质量再决定是否常驻。

  1. 下载并安装 LM Studio。

    Windows/macOS 直接安装桌面版;Linux 使用 AppImage 或发行版包。安装后打开,先确认左下角能看到系统资源占用。

  2. 搜索并下载一个 GGUF 量化模型。

    text 推荐先试:Qwen2.5-7B-Instruct-GGUF 或 Mistral-7B-Instruct-GGUF 量化优先级:Q4_K_M > Q5_K_M > Q8_0

    文件大小参考:7B 的 Q4 版本通常 4GB~5GB;Q8 版本可能接近 8GB。

  3. 启动本地推理。

    text 1. 打开 Chat 2. 选择刚下载的模型 3. 将 Context Length 先设为 4096 4. Temperature 先设为 0.2 到 0.7

    预期现象:首次加载会慢,之后重复问答明显快。若页面持续卡在“Loading”,通常是内存不足或模型量化过高。

Note: LM Studio 的价值是快速验证模型质量和显存占用,不是用来替代所有自动化场景。

4. 常见故障:慢、卡、下载失败,先按这个顺序排

市场需求验证竞品差异分析用户画像构建增长策略制定ROI 持续优化
  1. 问题:模型能启动,但回答很慢。

    • 检查是否走了 CPU 而不是 GPU。
    • 把模型从 8B 换成 7B。
    • 把上下文长度从 8192 降到 4096。
  2. 问题:拉模型失败。

    bash ollama pull qwen2.5:7b

    预期输出:

    pulling manifest error: ...

    处理顺序:确认网络、确认磁盘空间、确认代理。不要先删应用。

  3. 问题:内存溢出。

    bash # Linux dmesg | tail -n 20

    预期输出:

    Out of memory: Killed process 12345 (ollama)

    结论:模型太大,换更小的量化版本,或者加内存。

Warning: 不要同时开多个 7B 模型实例。桌面看起来“没事”,实际上已经开始交换分区,后面所有延迟都会恶化。

5. 如何验证部署真的可用

按这三个指标验收,不要只看“能聊天”。

  1. 模型加载时间:7B 量化模型首次加载应在 20 秒到 90 秒之间,取决于磁盘和 GPU。

  2. 首 token 延迟:GPU 机器尽量低于 1 秒;纯 CPU 机器低于 2.5 秒算及格。

  3. 稳定输出速度:7B 模型至少 10 tokens/s;低于这个数,交互体验会明显变差。

bash time curl http://127.0.0.1:11434/api/generate -d '{ "model":"llama3.1:8b", "prompt":"用一句话解释什么是容器", "stream": false }'

预期输出:

real 0m1.842s {"response":"容器是...","done":true}

如果结果满足上面的三个指标,这套本地大模型Ollama LM Studio部署教程就算通过验收。

References

wizzegroup.com

Ollama 官方文档;LM Studio 官方文档;GGUF 模型格式说明;llama.cpp 量化说明。

如果你想要更省事的桌面化方案,商都加速器也可作为最后一层选项;但先完成上面的免费/官方路线,再决定是否需要额外工具。

⬅ 上一篇Gemini 怎么注册和国内使用:Google AI 访问失败的排查与可行方案 下一篇 ➡AI语音克隆与文字转语音工具实战:下载、配置、配音与验收流程

🎯 猜你喜欢

本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署本地大模型Ollama与LM Studio部署教程:2025年离线推理本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署Ollama与LM Studio本地大模型部署指南 (SRE内部实践 本地部署本地大模型Ollama与LM Studio离线部署教程:下载安装到验证本地部署商都加速器 SRE内部指南 V1.0: Ollama与LM Studi本地部署本地大模型 Ollama 与 LM Studio 离线部署教程:Win本地部署Ollama与LM Studio本地大模型推理环境搭建:SRE指南 V

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI生产力工具AI论文写作辅助Roxi加速器Midjourney怎么用ChatGPT提示词工程ChatGPT怎么用Cursor下载Claude长文本分析AI编程助手GPT-4o怎么用DeepL下载Notion AI怎么用Gemini API开发GPT-4o多模态能力Midjourney教程Midjourney下载AI语音克隆
延伸阅读