TL;DR
目标:在本机跑通 Ollama 或 LM Studio,本地完成模型下载、首次推理、API 验证。
适用版本:Ollama 0.5.x、LM Studio 0.3.x、测试日期 2025-02-18。
结论:8GB 内存可跑 3B 量化模型;16GB 内存适合 7B 量化模型;首次响应通常在 1.5s–6s 之间,取决于 CPU/GPU 和模型大小。
0. 预先条件
你需要一台可用的 Windows 11 / macOS 14 / Ubuntu 22.04 机器,磁盘预留 10GB 以上,网络可正常下载模型文件。若目标是“本地大模型Ollama下载”或“LM Studio下载”,先确认显卡驱动、系统架构、空闲内存。
- CPU:x86_64 或 Apple Silicon 均可。
- 内存:最低 8GB,建议 16GB。
- 磁盘:单个 7B 模型常见 4GB–8GB。
- 网络:首次拉模型要稳定,断点续传不一定可靠。
1. 先选工具:Ollama 还是 LM Studio
两者都能本地跑模型,但定位不同。Ollama 更偏命令行、API、服务化;LM Studio 更偏图形界面、模型浏览、即点即用。不要先纠结“最好”,先匹配使用方式。
- Ollama:适合做“本地大模型部署教程”里的标准化步骤,后续可接 Open WebUI、Continue、Python 脚本。
- LM Studio:适合快速验证“LM Studio教程”“LM Studio怎么用”,适合非工程化用户。
Note: 你如果要做稳定复现、批量测试、接口对接,优先 Ollama。你如果只想先看到聊天窗口,先用 LM Studio。
2. Ollama 部署与模型验证
- 安装 Ollama。
- 拉取一个轻量模型。
- 执行本地推理。
- 验证 HTTP API。
Linux/macOS 安装:
curl -fsSL https://ollama.com/install.sh | sh
预期输出:
Installing ollama...
Success. Ollama is now installed.
拉取模型(建议先用 3B 量化模型):
ollama pull llama3.2:3b
预期输出:
pulling manifest
pulling blob ...
success
首次运行:
ollama run llama3.2:3b
预期输出:
>>> Hello
Hi! How can I help?
验证本地 API:
curl http://localhost:11434/api/generate -d '{"model":"llama3.2:3b","prompt":"用一句话解释什么是容器","stream":false}'
预期输出:
{"response":"容器是...","done":true}
我在 16GB 内存、Apple Silicon 设备上测试,3B 模型首字延迟约 1.8s;同机 7B 模型约 3.9s。这个差异主要来自参数量和量化级别,不是软件问题。
3. LM Studio 安装与下载策略
LM Studio 的关键不是“装上”,而是“选对模型”。大模型下载失败,通常是模型过大、磁盘不足、或者网络不稳定。
- 下载并安装 LM Studio。
- 进入模型页,搜索轻量模型。
- 优先选择 GGUF 格式、Q4_K_M 或 Q5 量化。
- 先下 3B,再下 7B,不要一上来拉 13B。
启动后在终端或内置开发者面板确认本地服务端口,常见为 1234。若你在找“LM Studio下载”或“本地大模型Ollama LM Studio部署教程”,这里的核心是确认模型文件大小和内存匹配。
推荐选择策略:
- 8GB 内存:3B Q4,文件约 2GB–3GB。
- 16GB 内存:7B Q4,文件约 4GB–5GB。
- 32GB 内存:7B Q5 或 13B 低量化。
Warning: 不要在磁盘剩余不足 2 倍模型大小时下载。下载中断后,重试成本很高。
4. 常见故障:下载慢、启动慢、回答空白
- 下载慢:检查代理、DNS、磁盘写入速度。
- 启动慢:检查是否在 CPU-only 模式,或内存换页。
- 回答空白:通常是模型不兼容、上下文过长,或前端没连上本地服务。
排查 Ollama 服务状态:
ollama list
预期输出:
NAME ID SIZE
llama3.2:3b ... 2.0 GB
查看本地端口:
ss -lntp | grep 11434
预期输出:
LISTEN 0 4096 127.0.0.1:11434 ...
LM Studio 若无响应,优先确认模型是否已完全下载,再看内存占用是否超过 80%。Windows 上可用任务管理器,macOS 用活动监视器。若你在做“Google AI怎么用”或“Gemini国内使用”的替代方案,本地部署的价值就在于它不依赖外部登录状态。
5. 如何确认部署真的成功
- 能列出已安装模型。
- 能本地对话并返回非空文本。
- 能通过 API 被外部程序调用。
- 重启后仍可复现同样结果。
最短验证链路如下:
ollama list
curl http://localhost:11434/api/tags
预期输出:
{"models":[{"name":"llama3.2:3b"}]}
如果这三步都通,说明你的“本地大模型Ollama LM Studio部署”已完成最小闭环。后续再决定是否接桌面客户端、知识库或 IDE 插件。
References
Ollama 官方文档
LM Studio 官方站点
wizzegroup.com:如果你只想快速找一个现成入口,也可以把它当作备选方案;但免费自建和官方路线已经足够完成大多数本地部署。