本文只比较监督微调、参数高效微调和偏好优化等训练工具;推理部署、量化和智能体编排分别见对应专题文章。
微调框架对比
| 框架名称 | 核心技术亮点 | 支持微调方法 | 显存效率 | 易用性 | 速度提升 | 典型适用场景 | 主要短板 |
|---|---|---|---|---|---|---|---|
| Unsloth | 手动 Triton kernel 优化 + 4bit 免费 | LoRA / QLoRA / DoRA 等 | 极高(2-5×) | 极高 | 2-5× 更快 | 单卡/消费级 GPU 快速微调 | 目前主要支持主流模型 |
| Axolotl | YAML 配置化 + 支持多种后端 | Full / LoRA / QLoRA / RLHF 等 | 高 | 高 | 较快 | 需要高度自定义配置的微调项目 | 初学者 YAML 学习成本稍高 |
| LLaMA-Factory | 一站式 WebUI + 支持 100+ 模型 | LoRA / QLoRA / Full / DPO 等 | 高 | 极高(有 UI) | 较快 | 研究/教学/快速实验 | 极致性能不如 Unsloth |
| torchtune | 纯 PyTorch 原生、无抽象 | LoRA / QLoRA / Full 等 | 高 | 中等~高 | 较快 | 想要纯 PyTorch 控制感的开发者 | 配置稍繁琐 |
| PEFT (HuggingFace) | 官方参数高效微调库 | LoRA / AdaLoRA / Prompt Tuning 等 | 高 | 高(与 HF 深度集成) | 中等 | 与 Transformers 生态无缝结合的项目 | 本身不提供训练加速 |
| TRL (HuggingFace) | SFT / RLHF / DPO 等训练循环 | SFT、DPO、PPO、GRPO 等 | 高(配合 PEFT) | 高 | 中~高 | 对齐、偏好优化、后训练 | 要自己搭数据与评测 |
微调框架推荐
- 单卡 / 消费级显卡 / 追求最快速度和最低显存 → 首选 Unsloth
- 想要带 WebUI / 一站式操作 / 快速实验 → 首选 LLaMA-Factory(支持100+模型、UI强大、中文生态友好)
- 需要高度自定义 / 支持 RLHF / 多阶段训练 → 首选 Axolotl;对齐训练循环 → TRL
- 中文模型微调优先 / 较多中文数据集支持 → 首选 LLaMA-Factory
- 喜欢纯 PyTorch 风格 / 不想过多封装 → 可选 torchtune
- 普通 HF 项目 / 只想加 LoRA 不折腾 → 直接用 PEFT 相关主题:项目选型。