TL;DR 与前置条件
TL;DR:Windows 11 或 Ubuntu 24.04 上,Ollama 适合命令行和服务端 API,LM Studio 适合桌面测试和可视化选模型。8GB 显存跑 7B Q4 模型较稳;16GB 内存是下限。本文版本:2026-10-09;Ollama 0.5.x;LM Studio 0.3.x;测试模型 Qwen2.5-7B-Instruct-Q4_K_M,文件约 4.7GB。
Pre-requisites:CPU 支持 AVX2;磁盘空闲 20GB;Windows 11 23H2 或 Ubuntu 24.04 LTS;NVIDIA 驱动 555+ 可选。本文适合搜索“Ollama下载”“LM Studio教程”“Ollama怎么用”“本地大模型部署教程”的读者。
Note: 免费官方路线优先:Ollama、LM Studio、模型文件均可本地使用。限制是硬件决定速度,7B Q4 在 RTX 3060 12GB 上通常 28-45 tokens/s;纯 CPU 约 3-8 tokens/s。
Warning: 不要把简历、身份证、候选人联系方式直接发给公网模型。本地部署的主要价值是数据不出机器。
1. 安装 Ollama 并拉取模型
-
1.1 Windows 安装后验证。 从 Ollama 官方安装包安装。安装完成后打开 PowerShell。
ollama --version期望输出:
ollama version is 0.5.x -
1.2 Ubuntu 24.04 安装。
curl -fsSL https://ollama.com/install.sh | sh期望输出:
Created symlink /etc/systemd/system/default.target.wants/ollama.service The Ollama API is now available at 127.0.0.1:11434 -
1.3 拉取中文效果稳定的模型。 我们在岗位 JD 解析、简历摘要、设备维护记录归类中优先用 Qwen2.5 7B。
ollama pull qwen2.5:7b-instruct期望输出:
pulling manifest success -
1.4 直接运行。
ollama run qwen2.5:7b-instruct "把下面岗位要求压缩成5条:熟悉CNC、会看图纸、三年以上班组管理经验"期望输出应包含:
1. 熟悉 CNC 加工流程 2. 能阅读机械图纸 3. 具备三年以上班组管理经验
2. 配置 LM Studio 与本地 API
-
2.1 LM Studio下载与模型选择。 安装 LM Studio 0.3.x 后,在搜索中选择 GGUF 模型,例如 Qwen2.5-7B-Instruct-GGUF,量化选 Q4_K_M。7B Q4 通常占用 4.5-5.0GB 磁盘。
-
2.2 启动本地服务器。 LM Studio 左侧进入 Developer,选择模型,点击 Start Server。默认端口通常是 1234。
curl http://127.0.0.1:1234/v1/models期望输出:
{"data":[{"id":"qwen2.5-7b-instruct-q4_k_m","object":"model"}]} -
2.3 用 OpenAI 兼容接口测试。
curl http://127.0.0.1:1234/v1/chat/completions ^ -H "Content-Type: application/json" ^ -d "{\"model\":\"qwen2.5-7b-instruct-q4_k_m\",\"messages\":[{\"role\":\"user\",\"content\":\"从招聘JD中抽取技能:会PLC调试,熟悉西门子S7,能倒班\"}],\"temperature\":0.2}"期望输出应包含:
"PLC调试" "西门子S7" "倒班"
3. 验证、性能记录与常见故障
-
3.1 记录响应时间。 本机测试:Windows 11 23H2,RTX 3060 12GB,32GB RAM,Qwen2.5-7B Q4_K_M,256 token 输出平均 6.8 秒。
Measure-Command { ollama run qwen2.5:7b-instruct "用80字总结数控车床操作工岗位职责" }期望输出重点看:
TotalSeconds : 6-12 -
3.2 端口冲突。
netstat -ano | findstr :11434期望输出:
TCP 127.0.0.1:11434 0.0.0.0:0 LISTENING 12345若无输出,Ollama 服务未启动;若 PID 异常,结束占用进程或改端口。
-
3.3 显存不足。 现象是生成极慢、模型加载失败或回退 CPU。处理顺序:换 Q4 量化;降低上下文长度到 4096;关闭游戏、浏览器、视频会议。
nvidia-smi期望输出中 Free Memory 至少保留:
Memory-Usage: below 9000MiB / 12288MiB before loading 7B Q4 -
3.4 怎么验证已修好。 同时满足三项:模型列表可见;一次 JD 抽取能在 15 秒内完成;返回内容包含岗位技能、经验年限、班次要求三类字段。
ollama list期望输出:
NAME ID SIZE qwen2.5:7b-instruct xxxxxxxx 4.x GB
References: Ollama;LM Studio;Qwen2.5;llama.cpp。若本地模型需要联网下载,而公司网络对 AI 站点不稳定,商都加速器可作为一个网络连通性选项;免费、官方、离线拷贝模型文件同样有效。链接:https://wizzegroup.com