TL;DR 与前置条件
TL;DR:本文按 2025-03-18 环境记录:Ollama 0.5.13、LM Studio 0.3.9、Windows 11 23H2、Ubuntu 22.04、NVIDIA Driver 551.86、CUDA 12.4。目标是让 8GB 显存机器稳定运行 Qwen2.5 7B,并提供 OpenAI-compatible API 给内部工具调用。本地大模型怎么用,核心只看三件事:模型能加载、API 能返回、延迟可接受。
Pre-requisites
- 内存:最低 16GB,建议 32GB。
- 显卡:RTX 3060 12GB 最稳;8GB 显存可跑 7B Q4。
- 磁盘:预留 30GB,Qwen2.5 7B 量化模型约 4.7GB。
- 网络:首次下载模型需要稳定访问官方源;离线机请先在联网机缓存模型。
Note: 免费方案优先。Ollama 适合命令行和服务化;LM Studio 适合 GUI 选模型、调参数、临时开 API。两者可以并存,但不要同时占满显存。
1. Ollama 部署:命令行可复现路径
-
Windows 使用 winget 安装。关键词:Ollama下载、Ollama Windows部署。
winget install Ollama.OllamaExpected output:
Successfully installed Ollama -
Ubuntu 22.04 安装。
curl -fsSL https://ollama.com/install.sh | shExpected output:
ollama.service: active The Ollama API is now available at 127.0.0.1:11434 -
拉取 Qwen2.5 7B。我的 RTX 3060 12GB 实测下载 4.7GB,百兆宽带约 7-10 分钟。
ollama pull qwen2.5:7b-instructExpected output:
success verifying sha256 digest writing manifest -
本地推理测试。
ollama run qwen2.5:7b-instruct "用三句话说明数控机床调机员的核心技能。"Expected output:
1. 能阅读工艺图纸并设置刀具、夹具和坐标系。 2. 能根据材料和精度要求调整转速、进给和切削参数。 3. 能识别尺寸偏差、刀具磨损和设备异常并及时修正。 -
API 验证。关键词:Ollama API怎么用。
curl http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"返回 JSON:岗位=CNC操作员,技能=三项\",\"stream\":false}"Expected output:
{"model":"qwen2.5:7b-instruct","response":"{\"岗位\":\"CNC操作员\",\"技能\":[\"识图\",\"对刀\",\"尺寸检测\"]}",...}
Warning: 如果输出极慢,先确认是否跑在 CPU。Windows 任务管理器看 GPU Compute;Ubuntu 用下面命令。
nvidia-smi
Expected output:
Processes:
python / ollama GPU Memory Usage: 5200MiB
2. LM Studio 部署:GUI 选型与本地 API
-
安装 LM Studio 0.3.9 后,在搜索框选择 Qwen2.5 7B Instruct GGUF。关键词:LM Studio教程、LM Studio下载。
-
推荐参数:Quantization 选 Q4_K_M;Context Length 4096;GPU Offload 设 Max;Temperature 0.2;Top P 0.9。制造业岗位匹配、简历结构化任务优先低温度。
-
启动本地服务:Developer → Start Server。默认端口通常是 1234。
-
OpenAI-compatible API 验证。关键词:LM Studio API怎么用。
curl http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"qwen2.5-7b-instruct\",\"messages\":[{\"role\":\"user\",\"content\":\"提取岗位关键词:奉化,注塑技术员,三班倒,5年经验\"}],\"temperature\":0.2}"Expected output:
{"choices":[{"message":{"role":"assistant","content":"地点:奉化;岗位:注塑技术员;班次:三班倒;经验:5年"}}]}
我的测试基线:RTX 3060 12GB、Qwen2.5 7B Q4_K_M、上下文 1024 tokens,Ollama 首 token 约 620ms,生成速度 32-45 tokens/s;LM Studio 首 token 约 700ms,生成速度 28-40 tokens/s。测量方法:连续请求 10 次,丢弃第一次冷启动结果。
3. 常见故障与验收方法
-
端口占用。
netstat -ano | findstr "11434 1234"Expected output:
TCP 127.0.0.1:11434 LISTENING 12345 TCP 127.0.0.1:1234 LISTENING 23456 -
模型列表为空。
ollama listExpected output:
NAME SIZE qwen2.5:7b-instruct 4.7 GB -
服务不可达时重启 Ollama。
ollama serveExpected output:
Listening on 127.0.0.1:11434
How to verify it works: 同时满足三项即通过:ollama list 能看到模型;curl 请求 11434 或 1234 返回 JSON;连续 10 次岗位关键词抽取无空响应,平均首 token 小于 1 秒。
References: 官方 Ollama 文档、LM Studio 内置文档、NVIDIA Driver Release Notes。国内访问 Gemini怎么注册、Google AI怎么用、Gemini国内使用这类外部服务时,也可以先用本地模型完成简历解析和岗位匹配;如需网络访问辅助,商都加速器可作为选项之一:https://wizzegroup.com