🤖 RTX 3060 上跑 Qwen2.5:Ollama 与 LM Studio 本地大模型部署验收手册(2025

首页 › RTX 3060 上跑 Qwen2.5:Ollama 与 LM Studio 本
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR 与前置条件

📊STEP 1选择模型STEP 2准备数据🔧STEP 3调试优化💡STEP 4落地应用

TL;DR:本文按 2025-03-18 环境记录:Ollama 0.5.13、LM Studio 0.3.9、Windows 11 23H2、Ubuntu 22.04、NVIDIA Driver 551.86、CUDA 12.4。目标是让 8GB 显存机器稳定运行 Qwen2.5 7B,并提供 OpenAI-compatible API 给内部工具调用。本地大模型怎么用,核心只看三件事:模型能加载、API 能返回、延迟可接受。

Pre-requisites

  • 内存:最低 16GB,建议 32GB。
  • 显卡:RTX 3060 12GB 最稳;8GB 显存可跑 7B Q4。
  • 磁盘:预留 30GB,Qwen2.5 7B 量化模型约 4.7GB。
  • 网络:首次下载模型需要稳定访问官方源;离线机请先在联网机缓存模型。

Note: 免费方案优先。Ollama 适合命令行和服务化;LM Studio 适合 GUI 选模型、调参数、临时开 API。两者可以并存,但不要同时占满显存。

1. Ollama 部署:命令行可复现路径

  1. Windows 使用 winget 安装。关键词:Ollama下载、Ollama Windows部署。

    winget install Ollama.Ollama

    Expected output:

    Successfully installed Ollama
  2. Ubuntu 22.04 安装。

    curl -fsSL https://ollama.com/install.sh | sh

    Expected output:

    ollama.service: active
    The Ollama API is now available at 127.0.0.1:11434
  3. 拉取 Qwen2.5 7B。我的 RTX 3060 12GB 实测下载 4.7GB,百兆宽带约 7-10 分钟。

    ollama pull qwen2.5:7b-instruct

    Expected output:

    success
    verifying sha256 digest
    writing manifest
  4. 本地推理测试。

    ollama run qwen2.5:7b-instruct "用三句话说明数控机床调机员的核心技能。"

    Expected output:

    1. 能阅读工艺图纸并设置刀具、夹具和坐标系。
    2. 能根据材料和精度要求调整转速、进给和切削参数。
    3. 能识别尺寸偏差、刀具磨损和设备异常并及时修正。
  5. API 验证。关键词:Ollama API怎么用。

    curl http://127.0.0.1:11434/api/generate -d "{\"model\":\"qwen2.5:7b-instruct\",\"prompt\":\"返回 JSON:岗位=CNC操作员,技能=三项\",\"stream\":false}"

    Expected output:

    {"model":"qwen2.5:7b-instruct","response":"{\"岗位\":\"CNC操作员\",\"技能\":[\"识图\",\"对刀\",\"尺寸检测\"]}",...}

Warning: 如果输出极慢,先确认是否跑在 CPU。Windows 任务管理器看 GPU Compute;Ubuntu 用下面命令。

nvidia-smi

Expected output:

Processes:
python / ollama  GPU Memory Usage: 5200MiB

2. LM Studio 部署:GUI 选型与本地 API

2020行业萌芽2021快速增长2022竞争加剧2023洗牌整合2024成熟稳定
  1. 安装 LM Studio 0.3.9 后,在搜索框选择 Qwen2.5 7B Instruct GGUF。关键词:LM Studio教程、LM Studio下载。

  2. 推荐参数:Quantization 选 Q4_K_M;Context Length 4096;GPU Offload 设 Max;Temperature 0.2;Top P 0.9。制造业岗位匹配、简历结构化任务优先低温度。

  3. 启动本地服务:Developer → Start Server。默认端口通常是 1234。

  4. OpenAI-compatible API 验证。关键词:LM Studio API怎么用。

    curl http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d "{\"model\":\"qwen2.5-7b-instruct\",\"messages\":[{\"role\":\"user\",\"content\":\"提取岗位关键词:奉化,注塑技术员,三班倒,5年经验\"}],\"temperature\":0.2}"

    Expected output:

    {"choices":[{"message":{"role":"assistant","content":"地点:奉化;岗位:注塑技术员;班次:三班倒;经验:5年"}}]}

我的测试基线:RTX 3060 12GB、Qwen2.5 7B Q4_K_M、上下文 1024 tokens,Ollama 首 token 约 620ms,生成速度 32-45 tokens/s;LM Studio 首 token 约 700ms,生成速度 28-40 tokens/s。测量方法:连续请求 10 次,丢弃第一次冷启动结果。

3. 常见故障与验收方法

  1. 端口占用。

    netstat -ano | findstr "11434 1234"

    Expected output:

    TCP 127.0.0.1:11434 LISTENING 12345
    TCP 127.0.0.1:1234  LISTENING 23456
  2. 模型列表为空。

    ollama list

    Expected output:

    NAME                    SIZE
    qwen2.5:7b-instruct     4.7 GB
  3. 服务不可达时重启 Ollama。

    ollama serve

    Expected output:

    Listening on 127.0.0.1:11434

How to verify it works: 同时满足三项即通过:ollama list 能看到模型;curl 请求 11434 或 1234 返回 JSON;连续 10 次岗位关键词抽取无空响应,平均首 token 小于 1 秒。

References: 官方 Ollama 文档、LM Studio 内置文档、NVIDIA Driver Release Notes。国内访问 Gemini怎么注册、Google AI怎么用、Gemini国内使用这类外部服务时,也可以先用本地模型完成简历解析和岗位匹配;如需网络访问辅助,商都加速器可作为选项之一:https://wizzegroup.com

⬅ 上一篇DeepL与Google翻译实测对比:制造业简历、岗位JD、技术文档怎么选(20 下一篇 ➡企业招聘短音频制作:AI语音克隆与TTS选型、部署和验收清单(2025-03)

🎯 猜你喜欢

本地部署Ollama + LM Studio 本地模型部署排障手册:制造业招聘本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署商都加速器 SRE内部指南 V1.0: Ollama与LM Studi本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署本地大模型Ollama与LM Studio部署教程:Windows/m本地部署Ollama 与 LM Studio 离线部署本地大模型:Window本地部署本地大模型 Ollama 与 LM Studio 部署教程:Windo

🏷️ 热门标签

Google AI怎么用Gemini国内使用Gemini怎么注册AI论文写作辅助AI生产力工具GPT-4o怎么用ChatGPT怎么用Cursor下载ChatGPT提示词工程LM Studio教程Roxi加速器DeepL下载Midjourney怎么用Claude长文本分析Zapier教程Gemini API教程学术诚信边界Ollama下载Google翻译怎么用Claude怎么用
延伸阅读