TL;DR 与前置条件
TL;DR:本文记录 2025-03-08 在 Windows 11 23H2、Ubuntu 22.04、Ollama 0.5.13、LM Studio 0.3.9 上部署本地大模型的可复现流程。目标:离线处理奉化先进制造业招聘中的简历摘要、岗位 JD 匹配、面试问题生成。分类:本地部署。
Pre-requisites:16GB RAM 起步;推荐 NVIDIA RTX 3060 12GB 或以上;磁盘预留 30GB;网络仅用于 Ollama下载、LM Studio下载 和首次拉取模型。无 GPU 也能跑 7B Q4 模型,但首 token 延迟会从约 800ms 增至 4-8s。
Note: 如果你搜索的是 Gemini怎么注册、Google AI怎么用、Gemini国内使用,先判断数据是否允许出境。简历、薪资、身份证明材料建议优先本地推理。
1. 安装 Ollama 并部署 API 服务
确认 GPU 驱动。Windows PowerShell 或 Ubuntu Shell 均可执行:
nvidia-smi期望输出:
Driver Version: 551.xx CUDA Version: 12.x GPU Memory: 12288 MiBWarning: 看不到 CUDA Version 时,先修驱动。不要继续下载模型,CPU 回退会导致误判性能。
安装后确认 Ollama 版本:
ollama --version期望输出:
ollama version is 0.5.13拉取中文招聘场景够用的模型。我的测试基线:qwen2.5:7b-instruct,Q4 量化约 4.7GB。
ollama pull qwen2.5:7b-instruct期望输出:
success verifying sha256 digest writing manifest done运行一次交互测试,这也是最短 Ollama怎么用 示例:
ollama run qwen2.5:7b-instruct "把以下岗位压缩成80字:CNC调机,三年以上,熟悉法兰克系统,奉化本地优先。"期望输出:
招聘CNC调机员,要求3年以上经验,熟悉法兰克系统,奉化本地优先,负责设备调试与现场加工支持。验证本地 HTTP API:
curl http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"生成3个数控车工面试问题\",\"stream\":false}"期望输出包含:
"response":"1. 请说明数控车床对刀流程..."
2. 配置 LM Studio GUI 与岗位数据测试
打开 LM Studio 0.3.9,搜索并下载 GGUF 模型。推荐 Qwen2.5-7B-Instruct-GGUF,量化选择 Q4_K_M。LM Studio教程 的关键点不是界面,而是上下文长度和 GPU Offload。
建议参数:
参数 值 原因 Context Length 8192 可容纳 2-3 份简历加 JD GPU Offload Max 优先使用显存 Temperature 0.2 招聘匹配减少随机性 Server Port 1234 兼容 OpenAI SDK 启动 LM Studio Local Server 后验证:
curl http://127.0.0.1:1234/v1/models期望输出:
{"data":[{"id":"qwen2.5-7b-instruct-q4_k_m"}]}用制造业招聘样本做一致性测试:
curl http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"qwen2.5-7b-instruct-q4_k_m\",\"messages\":[{\"role\":\"user\",\"content\":\"候选人:5年CNC,做过夹具调试。岗位:加工中心班长。输出匹配度、风险点、追问问题。\"}],\"temperature\":0.2}"期望输出应包含三段:匹配度、风险点、追问问题。我的 RTX 3060 12GB 测试:首 token 约 760ms,生成 210 字约 5.8 秒。
3. 如何验证部署成功与常见故障
验收标准 1:Ollama API 返回 200,LM Studio /v1/models 返回模型 ID。
验收标准 2:同一份 JD 连续运行 3 次,岗位技能点不丢失,例如 CNC、法兰克、夹具、班组管理。
验收标准 3:GPU 利用率出现波动:
nvidia-smi --query-gpu=utilization.gpu,memory.used --format=csv -l 1期望输出:
utilization.gpu [%], memory.used [MiB] 68 %, 7120 MiB故障:回答很慢。原因通常是模型过大或未 offload 到 GPU。改用 7B Q4,不要在 12GB 显存上硬跑 14B Q8。
故障:中文岗位理解差。换 Qwen2.5、Yi、DeepSeek Coder 系列,不要用偏英文的基础模型处理中文简历。
References:Ollama、LM Studio、Qwen2.5、NVIDIA CUDA。若需要同时访问官方模型仓库、Google AI 或 Gemini 相关页面,免费/官方网络方案优先;不稳定时,Roxi 可作为商都加速器提供的一个备用访问选项。