LLaMA-Factory大模型微调:100+模型,6GB显存起步

📅 2026/8/22 21:48:08
LLaMA-Factory大模型微调:100+模型,6GB显存起步
LLaMA-Factory大模型微调100模型6GB显存起步【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory你盯着训练日志loss 半天不动nvidia-smi里显存已经爬到 20GB 以上——微调一个 7B 大模型怎么就这么费劲这正是 LLaMA-Factory 要解决的问题一套开箱即用零代码的大模型微调框架统一支持 100 多个 LLM 和视觉语言模型VLMSFT、LoRA、DPO 等主流方法都能直接跑。看完这篇你能说清楚LoRA、QLoRA 和全参微调该怎么选、你的显卡离微调还差多少显存、以及怎么用三条命令跑通第一个模型。选对微调方法从 SFT 到 DPO 一条流水线先说覆盖面。src/llamafactory/extras/constants.py 维护着完整的模型清单README 列出的支持范围从 560M 的 BLOOM 到 671B 的 DeepSeek-3Llama 3、Qwen3、GLM-4.5、MiniCPM-V 等文本和多模态模型都有对应模板Template简单说就是每种模型对话时的输入输出格式约定系列规模范围说明BLOOM / Gemma270M ~ 27B轻量到中型Qwen2.5 / Qwen3 / Qwen3-VL0.5B ~ 235B文本与视觉语言Mixtral / DeepSeek 38x7B ~ 671BMoE 大模型新模型也不用苦等Qwen3、Gemma 3、GLM-4.1V 都是发布当天Day 0就加入支持Llama 3 系列次日上架。七种训练阶段五种微调方式训练阶段从 src/llamafactory/train/ 看每个阶段都有独立工作流阶段典型场景预训练 / SFT学领域知识、对齐对话奖励建模 / PPO强化学习对齐DPO / KTO / ORPO / SimPO基于偏好的低成本对齐微调方式则是全参数、冻结Freeze只训新增层、LoRA只训低秩小矩阵不碰原权重、QLoRA量化底座 LoRA和 OFT 五选一。examples/train_lora/qwen3_lora_sft.yaml 这类示例把每个参数都写在明面上照着改即可model_name_or_path: Qwen/Qwen3-4B-Instruct-2507 stage: sft finetuning_type: lora lora_rank: 8 dataset: identity,alpaca_en_demo template: qwen3_nothink bf16: true算清显存账QLoRA 让 7B 模型 6GB 起步选方法之前先算显存。README 的硬件需求表估算值方法7B14B70B全参数bf16/fp16120GB240GB1200GBLoRA / 冻结16-bit16GB32GB160GBQLoRA 4-bit约 6GB约 12GB约 48GBQLoRA 2-bit约 4GB约 8GB约 24GB两个锚点一张消费级显卡跑 7B QLoRA 没有压力70B 模型也能用 FSDP QLoRA 压进 2×24GB 双卡。数据侧不用从零造轮子data/ 目录自带 Alpaca、identity 等演示数据集多模态示例连图片、音频都备好了接入自己的数据只需在 data/dataset_info.json 里登记格式。把训练跑快FlashAttention-2 到 Unsloth 的加速栈 框架内置了一组即插即用的性能优化开关FlashAttention-2注意力机制Attention模型看全文时按相关度加权检索的那一步的显存优化实现flash_attn: fa2一行开启适合 RTX 4090、A100 这类卡。Unsloth长序列 LoRA 训练场景下官方记录的基准里相比 FlashAttention-2 快 117%显存还少用 50%Llama-2-7B 最长可到 56k 序列且 24GB 内完成。Liger Kernel把 RMSNorm、旋转位置编码RoPE等 Transformer 高频算子换成融合 CUDA 内核实现见 src/llamafactory/model/model_utils/liger_kernel.py。vLLM 推理后端训练完想压测吞吐infer_backend: vllm可让推理速度提升约 270%。部署与扩展一套配置走到底调优完成后同一套模型和模板可直接用于对话、评估和 OpenAI 风格 API 部署。框架本身是 ACL 2024 论文Unified Efficient Fine-Tuning of 100 Language Models的开源实现后续还会继续扩展分布式训练后端如 Megatron-core多机训练有现成的 examples/accelerate/ 和 examples/deepspeed/ 配置可抄。三步上手从克隆到出模型1️⃣ 克隆仓库并安装git clone https://gitcode.com/GitHub_Trending/ll/LlamaFactory cd LlamaFactory pip install -e .2️⃣ 改一份示例配置。打开 examples/train_lora/qwen3_lora_sft.yaml按上表把模型、数据集、显存档位改成自己的要求 Python ≥3.11。3️⃣ 启动训练跑完直接对话llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml llamafactory-cli chat examples/inference/qwen3_lora_sft.yaml 想不想敲命令llamafactory-cli webui直接给你一个图形界面训练、评估、推理都在浏览器里完成。卡住时先翻 docs/ 里的文档和项目 FAQ仍解决不了再到 issue 区提问社区微信群也常年在线。把微调一个 100 模型家族收敛成三条命令就是 LLaMA-Factory 想做的事。【免费下载链接】LlamaFactoryUnified Efficient Fine-Tuning of 100 LLMs VLMs (ACL 2024)项目地址: https://gitcode.com/GitHub_Trending/ll/LlamaFactory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考