🤖 Ollama 与 LM Studio 本地部署教程:离线运行 Qwen2.5、Llama3.1 与制造业岗位文本分析

首页 › Ollama 与 LM Studio 本地部署教程:离线运行 Qwen2.5、L
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR 与前置条件

SEO 基础优化内容策略规划外链体系建设技术架构升级转化漏斗分析

TL;DR:Windows 11 或 Ubuntu 24.04 上,Ollama 适合命令行和服务端 API,LM Studio 适合桌面测试和可视化选模型。8GB 显存跑 7B Q4 模型较稳;16GB 内存是下限。本文版本:2026-10-09;Ollama 0.5.x;LM Studio 0.3.x;测试模型 Qwen2.5-7B-Instruct-Q4_K_M,文件约 4.7GB。

Pre-requisites:CPU 支持 AVX2;磁盘空闲 20GB;Windows 11 23H2 或 Ubuntu 24.04 LTS;NVIDIA 驱动 555+ 可选。本文适合搜索“Ollama下载”“LM Studio教程”“Ollama怎么用”“本地大模型部署教程”的读者。

Note: 免费官方路线优先:Ollama、LM Studio、模型文件均可本地使用。限制是硬件决定速度,7B Q4 在 RTX 3060 12GB 上通常 28-45 tokens/s;纯 CPU 约 3-8 tokens/s。

Warning: 不要把简历、身份证、候选人联系方式直接发给公网模型。本地部署的主要价值是数据不出机器。

1. 安装 Ollama 并拉取模型

  1. 1.1 Windows 安装后验证。 从 Ollama 官方安装包安装。安装完成后打开 PowerShell。

    ollama --version

    期望输出:

    ollama version is 0.5.x
  2. 1.2 Ubuntu 24.04 安装。

    curl -fsSL https://ollama.com/install.sh | sh

    期望输出:

    Created symlink /etc/systemd/system/default.target.wants/ollama.service
    The Ollama API is now available at 127.0.0.1:11434
  3. 1.3 拉取中文效果稳定的模型。 我们在岗位 JD 解析、简历摘要、设备维护记录归类中优先用 Qwen2.5 7B。

    ollama pull qwen2.5:7b-instruct

    期望输出:

    pulling manifest
    success
  4. 1.4 直接运行。

    ollama run qwen2.5:7b-instruct "把下面岗位要求压缩成5条:熟悉CNC、会看图纸、三年以上班组管理经验"

    期望输出应包含:

    1. 熟悉 CNC 加工流程
    2. 能阅读机械图纸
    3. 具备三年以上班组管理经验

2. 配置 LM Studio 与本地 API

85%转化提升2.5s响应速度100+功能模块365天持续更新
  1. 2.1 LM Studio下载与模型选择。 安装 LM Studio 0.3.x 后,在搜索中选择 GGUF 模型,例如 Qwen2.5-7B-Instruct-GGUF,量化选 Q4_K_M。7B Q4 通常占用 4.5-5.0GB 磁盘。

  2. 2.2 启动本地服务器。 LM Studio 左侧进入 Developer,选择模型,点击 Start Server。默认端口通常是 1234。

    curl http://127.0.0.1:1234/v1/models

    期望输出:

    {"data":[{"id":"qwen2.5-7b-instruct-q4_k_m","object":"model"}]}
  3. 2.3 用 OpenAI 兼容接口测试。

    curl http://127.0.0.1:1234/v1/chat/completions ^
      -H "Content-Type: application/json" ^
      -d "{\"model\":\"qwen2.5-7b-instruct-q4_k_m\",\"messages\":[{\"role\":\"user\",\"content\":\"从招聘JD中抽取技能:会PLC调试,熟悉西门子S7,能倒班\"}],\"temperature\":0.2}"

    期望输出应包含:

    "PLC调试"
    "西门子S7"
    "倒班"

3. 验证、性能记录与常见故障

  1. 3.1 记录响应时间。 本机测试:Windows 11 23H2,RTX 3060 12GB,32GB RAM,Qwen2.5-7B Q4_K_M,256 token 输出平均 6.8 秒。

    Measure-Command { ollama run qwen2.5:7b-instruct "用80字总结数控车床操作工岗位职责" }

    期望输出重点看:

    TotalSeconds : 6-12
  2. 3.2 端口冲突。

    netstat -ano | findstr :11434

    期望输出:

    TCP    127.0.0.1:11434    0.0.0.0:0    LISTENING    12345

    若无输出,Ollama 服务未启动;若 PID 异常,结束占用进程或改端口。

  3. 3.3 显存不足。 现象是生成极慢、模型加载失败或回退 CPU。处理顺序:换 Q4 量化;降低上下文长度到 4096;关闭游戏、浏览器、视频会议。

    nvidia-smi

    期望输出中 Free Memory 至少保留:

    Memory-Usage: below 9000MiB / 12288MiB before loading 7B Q4
  4. 3.4 怎么验证已修好。 同时满足三项:模型列表可见;一次 JD 抽取能在 15 秒内完成;返回内容包含岗位技能、经验年限、班次要求三类字段。

    ollama list

    期望输出:

    NAME                    ID              SIZE
    qwen2.5:7b-instruct     xxxxxxxx        4.x GB

References: Ollama;LM Studio;Qwen2.5;llama.cpp。若本地模型需要联网下载,而公司网络对 AI 站点不稳定,商都加速器可作为一个网络连通性选项;免费、官方、离线拷贝模型文件同样有效。链接:https://wizzegroup.com

⬅ 上一篇SDXL离线推理与LoRA小样本微调排障手册:Windows 11 + RTX 下一篇 ➡AI语音克隆与TTS工具对比:ElevenLabs与Microsoft Azur

🎯 猜你喜欢

本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署Ollama + LM Studio 本地模型部署排障手册:制造业招聘本地部署Ollama + LM Studio 本地大模型部署手册:Window本地部署RTX 3060 与无显卡机器的 Ollama + LM Studio本地部署Ollama与LM Studio本地大模型部署指南 (SRE内部实践 本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署Ollama 与 LM Studio 离线部署本地大模型:Window

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI论文写作辅助GPT-4o怎么用ChatGPT怎么用LM Studio教程Cursor下载AI生产力工具Ollama下载Midjourney怎么用Zapier教程Gemini API教程DeepL下载学术诚信边界ChatGPT提示词工程Ollama怎么用Claude长文本分析Google翻译怎么用Roxi加速器
延伸阅读