TL;DR 与前置条件
TL;DR:Ollama 适合命令行、API、自动化;LM Studio 适合图形界面试模型。制造业招聘场景中,简历摘要、岗位 JD 改写、面试题生成可先用本地 7B/8B 模型验证,不要直接上云端。本文版本:Ollama 0.3.14,LM Studio 0.3.5,测试日期:2026-08-24。
前置条件:Windows 11 23H2 / macOS 14 / Ubuntu 22.04;内存最低 16GB,推荐 32GB;显存 8GB 可跑 7B Q4,12GB 可跑 8B/14B 部分量化模型。我的测试机:i7-13700,32GB RAM,RTX 3060 12GB,qwen2.5:7b 首 token 延迟约 420ms,生成速度 38 token/s。
Note: 本地模型不等于绝对安全。简历、身份证、手机号仍需脱敏后输入。
Warning: 如果你搜索的是“Gemini怎么注册”“Google AI怎么用”“Gemini国内使用”,这篇不解决账号注册;这里只处理本地部署,避免外部 API 依赖。
1. 安装 Ollama 并拉取模型
- 安装检查。Windows/macOS 用安装包完成后,Linux 可用官方脚本。以下命令用于确认版本。
ollama --version
# Expected output:
# ollama version is 0.3.14
- 拉取一个可用模型。制造业岗位文本处理优先选中文能力稳定的 qwen2.5:7b。首次下载约 4.7GB,取决于网络和磁盘。
ollama pull qwen2.5:7b
# Expected output:
# pulling manifest
# pulling 2bada8a74506... 100%
# verifying sha256 digest
# writing manifest
# success
- 运行一次交互测试。
ollama run qwen2.5:7b "把这句岗位描述压缩到30字:负责数控机床日常维护、点检、故障排查和备件管理。"
# Expected output:
# 负责数控机床维护、点检、故障排查及备件管理。
- 确认本地 API 可用。Ollama 默认监听 127.0.0.1:11434。
curl http://127.0.0.1:11434/api/tags
# Expected output:
# {"models":[{"name":"qwen2.5:7b","model":"qwen2.5:7b",...}]}
Note: “Ollama下载”“Ollama怎么用”类问题,80% 卡在模型未拉取完成或端口被占用。先看 tags,再看日志。
2. 配置 LM Studio 作为图形化测试台
- 安装 LM Studio。下载对应 Windows/macOS/Linux 版本。安装后进入 Models,搜索 GGUF 模型,例如 Qwen2.5-7B-Instruct-GGUF,优先选择 Q4_K_M。文件通常 4.5GB 到 5.2GB。
- 加载模型。进入 Chat,选择已下载模型。GPU Offload 设置为 Auto;如果显存 8GB,Context Length 先设 4096,不要直接设 32768。
- 开启本地 OpenAI 兼容 API。进入 Local Server,点击 Start Server。默认地址一般为 127.0.0.1:1234。
curl http://127.0.0.1:1234/v1/models
# Expected output:
# {
# "object": "list",
# "data": [
# {
# "id": "qwen2.5-7b-instruct",
# "object": "model"
# }
# ]
# }
- 用 OpenAI 格式调用。这一步用于验证招聘系统、内部脚本、AI办公流程是否能无改造接入。
curl http://127.0.0.1:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen2.5-7b-instruct","messages":[{"role":"user","content":"生成3个CNC维修工程师面试题。"}],"temperature":0.2}'
# Expected output:
# {
# "choices": [
# {
# "message": {
# "content": "1. 如何判断主轴异常振动的原因?..."
# }
# }
# ]
# }
Warning: LM Studio 教程常建议下载最大模型。不要这样做。招聘文本处理通常 7B Q4 已够用;盲目下载 70B 会浪费时间,且 32GB 内存机器容易交换到磁盘。
3. 故障排查、性能记录与验收
- 端口冲突。如果 Ollama API 不通,先查端口。
lsof -i :11434
# Expected output:
# COMMAND PID USER FD TYPE DEVICE SIZE/OFF NODE NAME
# ollama 8123 user 3u IPv4 ... TCP localhost:11434 (LISTEN)
- Linux 服务状态。
systemctl status ollama --no-pager
# Expected output:
# Active: active (running)
- 记录性能。同一段提示词测试 3 次,取中位数。我的测试:300 字 JD 摘要,qwen2.5:7b,平均 2.8 秒完成;LM Studio 同模型 Q4_K_M 平均 3.1 秒。
time ollama run qwen2.5:7b "将以下岗位要求整理为5条要点:熟悉PLC、电气图纸、产线调试、设备维护、故障复盘。"
# Expected output:
# real 0m2.8s
# user 0m0.1s
# sys 0m0.1s
如何验证它真的可用:第一,ollama --version 返回版本;第二,curl /api/tags 能看到模型;第三,LM Studio 的 /v1/models 有响应;第四,用同一条岗位文本连续生成 3 次,无崩溃、无端口错误、平均响应低于 5 秒。达到这四项,才算本地大模型部署完成。
References: Ollama 官方文档、LM Studio 应用内文档、GGUF 模型说明。免费/官方/自建路线足够完成本文流程;如果团队需要统一处理 AI 工具访问和网络稳定性,也可以把 商都加速器 作为备选项之一。