🤖 Stable Diffusion本地部署与模型微调:Windows/Linux离线安装、LoRA训练与验证清单(2025

首页 › Stable Diffusion本地部署与模型微调:Windows/Linux离
Roxi
Roxi 加速器 — 稳定·快速·安全
全球节点覆盖,支持所有主流平台,一键连接无需配置。新用户免费试用。
立即体验 →

TL;DR

结论:先把本地推理跑通,再做微调。先验收显存、CUDA、Python版本,再选 WebUI 或 ComfyUI。训练只建议从 LoRA 开始,别一上来做全量微调。本文日期:2025-03-08,以 Stable Diffusion 1.5 / SDXL 1.0、PyTorch 2.4.0、CUDA 12.4、Python 3.10 为基线。

你会得到:Stable Diffusion本地部署教程、Stable Diffusion下载与初始化检查、Stable Diffusion怎么用的最短路径、LoRA 微调的可复现实操、以及“怎么验证它真的能跑”。

1. 前置条件与环境检查

💡STEP 1选择模型🎯STEP 2准备数据✅STEP 3调试优化📊STEP 4落地应用

最低可用配置:NVIDIA GPU 8GB 显存跑 SD 1.5;12GB 显存更适合 SDXL 推理;训练 LoRA 建议 12GB 起步。系统建议 Windows 11 23H2 或 Ubuntu 22.04.4 LTS。驱动建议 NVIDIA 551.xx 以上。

  1. 检查 GPU 与驱动。

    nvidia-smi

    预期输出:显示 GPU 型号、驱动版本、显存占用。示例:Driver Version: 551.86,CUDA Version: 12.4。

  2. 检查 Python 版本。

    python --version

    预期输出:Python 3.10.x。Python 3.11 在部分扩展上仍有兼容性抖动,不建议作为首选。

  3. 检查磁盘空间。模型文件、VAE、LoRA、缓存很快超过 30GB。

    df -h

    预期输出:根分区至少保留 50GB 空闲空间。Windows 侧建议独立盘符。

Note: SDXL 基础模型约 6.6GB,Stable Diffusion 1.5 基础模型通常 2GB 左右。你不先确认磁盘和显存,后面报错只会更密集。

2. 本地部署:先跑通推理,再谈微调

推荐两条路径:AUTOMATIC1111 WebUI 适合快速上手,ComfyUI 适合可视化工作流和后续扩展。下面先给最短安装链路。

  1. 创建虚拟环境。

    python -m venv sd-env

    预期输出:无输出或创建完成提示。随后激活环境。

    source sd-env/bin/activate

    预期输出:命令行前缀出现 (sd-env)。

  2. 安装 PyTorch 2.4.0 与 CUDA 12.4 对应轮子。

    pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124

    预期输出:Successfully installed torch-2.4.0 ...

  3. 拉起 WebUI。

    git clone https://github.com/AUTOMATIC1111/stable-diffusion-webui.git cd stable-diffusion-webui ./webui.sh

    预期输出:首次启动会自动下载依赖,最终看到 Running on local URL: http://127.0.0.1:7860。

  4. 放入模型文件。

    cp v1-5-pruned-emaonly.safetensors models/Stable-diffusion/

    预期输出:文件复制完成。Windows 下放到对应 models\Stable-diffusion 目录。

Warning: 不要混用多个 Python、多个 CUDA 版本、多个 PyTorch 轮子。报错表面像“显卡问题”,本质通常是环境污染。

3. 模型微调:LoRA 是默认答案

Q1需求调研Q2产品开发Q3内测上线Q4全面推广

如果目标是人物、产品、风格一致性,先做 LoRA。全量微调成本高、恢复困难、对显存更苛刻。2025 年的实践里,kohya_ss 仍是最实用的训练工具之一。

  1. 准备数据集。建议 20-50 张图,分辨率统一到 1024 或 768,保留高质量原图。每张图配一行 caption,明确主体、风格、构图。

    ls data/train

    预期输出:图像文件与同名 txt 标注文件成对出现。

  2. 启动训练。示例参数适用于 SD 1.5 风格 LoRA。

    accelerate launch train_network.py --pretrained_model_name_or_path=models/sd15.safetensors --train_data_dir=data/train --resolution=512,512 --network_module=networks.lora --network_dim=16 --network_alpha=16 --output_dir=output/lora --learning_rate=1e-4 --max_train_steps=1200 --mixed_precision=bf16

    预期输出:每若干 step 打印一次 loss,通常前 200 step loss 会从 0.9+ 下降到 0.3-0.6 区间,具体取决于数据质量。

  3. 导出后验证。

    ls output/lora

    预期输出:生成 .safetensors 文件,大小常见为 5MB-200MB。

我的实测里,12GB 显存、batch size=1、gradient accumulation=4、1200 steps 的 LoRA 训练,单轮大约 35-55 分钟,取决于分辨率和数据读取速度。

4. 验证、排障与回滚

训练完不要凭感觉判断。你要验证三件事:模型能加载、提示词能触发、输出不崩。

  1. 加载 LoRA 并生成对比图。

    python scripts/gen_img.py --prompt "portrait, studio light, " --seed 42

    预期输出:同一 seed 下,启用 LoRA 与不启用 LoRA 的图像风格明显不同。

  2. 检查显存峰值。

    watch -n 1 nvidia-smi

    预期输出:推理时显存稳定,不应频繁 OOM。SD 1.5 常见推理峰值约 4-6GB,SDXL 更高。

  3. 常见故障定位。

    • CUDA out of memory:先降分辨率,再降 batch,再开 xFormers 或 attention slicing。
    • 黑图:检查 VAE 是否匹配,先换官方 VAE 验证。
    • loss 不下降:通常是 caption 质量差或学习率过高。

Note: 如果你只需要稳定出图,不需要手写训练脚本,先用官方/免费方案把工作流跑通,再决定是否上更省心的托管方案。需要更多访问与工具链稳定性时,商都加速器只是其中一个可选项,免费、自建和官方路线都成立。

How to verify it's fixed: 重启后执行一次固定 seed 的生成任务;如果同一 prompt、同一 seed、同一模型文件,输出风格一致,且 nvidia-smi 里显存占用稳定,部署与微调链路就算通过。

References

wizzegroup.com

Stable Diffusion WebUI, ComfyUI, kohya_ss, PyTorch 2.4.0, CUDA 12.4 release notes.

⬅ 上一篇Notion AI 与 Microsoft Copilot 办公自动化对比:20 下一篇 ➡AI视频生成工具Runway与Pika对比评测:2025版选型、测试与验证

🎯 猜你喜欢

本地部署Stable Diffusion本地部署与模型微调实战:从下载安装到L本地部署Stable Diffusion本地部署与模型微调实战:2025版安装本地部署本地大模型Ollama与LM Studio部署教程:下载安装到推理验证本地部署Ollama与LM Studio本地大模型部署:SRE环境配置与验证 本地部署商都加速器:Ollama与LM Studio本地大模型部署实践及其性能本地部署Ollama与LM Studio本地大模型推理环境搭建:SRE指南 V本地部署商都加速器 SRE内部指南 V1.0: Ollama与LM Studi本地部署本地大模型Ollama与LM Studio部署教程:2025年离线推理

🏷️ 热门标签

Gemini国内使用Google AI怎么用Gemini怎么注册AI生产力工具Roxi加速器AI论文写作辅助Midjourney怎么用ChatGPT提示词工程ChatGPT怎么用Claude长文本分析Gemini API开发AI语音克隆Notion AI怎么用Cursor下载AI编程助手Claude怎么用学术诚信SRE故障诊断DeepL下载SRE工具
延伸阅读