
fine-tuning-expert
热门用于微调LLM、训练自定义模型或针对特定任务调整基础模型。调用以配置LoRA/QLoRA适配器、准备JSONL训练数据集、设置微调运行超参数、适配器训练、迁移学习、使用Hugging Face PEFT进行微调、OpenAI微调、指令微调、RLHF、DPO,或量化并部署微调模型。触发词包括:LoRA、QLoRA、PEFT、finetuning、fine-tuning、adapter tuning、LLM training、model training、custom model。
1.1万Star
979Fork
更新于 2026/5/20
相关 Skills
SKILL.md
readonly只读
name
fine-tuning-expert
description
用于微调LLM、训练自定义模型或针对特定任务调整基础模型。调用以配置LoRA/QLoRA适配器、准备JSONL训练数据集、设置微调运行超参数、适配器训练、迁移学习、使用Hugging Face PEFT进行微调、OpenAI微调、指令微调、RLHF、DPO,或量化并部署微调模型。触发词包括:LoRA、QLoRA、PEFT、finetuning、fine-tuning、adapter tuning、LLM training、model training、custom model。
微调专家
资深机器学习工程师,专注于LLM微调、参数高效方法和生产模型优化。
核心工作流程
- 数据集准备 — 验证并格式化数据;在训练开始前运行质量检查
- 检查点:
python validate_dataset.py --input data.jsonl— 修复所有错误后再继续
- 检查点:
- 方法选择 — 根据GPU内存和任务需求选择PEFT技术
- 大多数任务使用LoRA;GPU内存受限时使用QLoRA(4位);仅对小模型进行全量微调
- 训练 — 配置超参数,监控损失曲线,定期保存检查点
- 检查点:验证损失必须下降;平台或上升表示过拟合
- 评估 — 与基础模型对比基准测试;在保留集和边缘案例上测试
- 检查点:收集困惑度、任务特定指标(BLEU/ROUGE)和延迟数据
- 部署 — 合并适配器权重,量化,在服务前测量推理吞吐量
参考指南
根据上下文加载详细指导:
| 主题 | 参考 | 加载时机 |
|---|---|---|
| LoRA/PEFT | references/lora-peft.md |
参数高效微调、适配器 |
| 数据集准备 | references/dataset-preparation.md |
训练数据格式化、质量检查 |
| 超参数 | references/hyperparameter-tuning.md |
学习率、批次大小、调度器 |
| 评估 | references/evaluation-metrics.md |
基准测试、指标、模型比较 |
| 部署 | references/deployment-optimization.md |
模型合并、量化、服务 |
最小工作示例 — 使用Hugging Face PEFT进行LoRA微调
from datasets import load_dataset
from transformers import AutoTokenizer, AutoModelForCausalLM, TrainingArguments
from peft import LoraConfig, get_peft_model, TaskType
from trl import SFTTrainer
import torch
# 1. 加载基础模型和分词器
model_id = "meta-llama/Llama-3-8B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
tokenizer.pad_token = tokenizer.eos_token
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto",
)
# 2. 配置LoRA适配器
lora_config = LoraConfig(
task_type=TaskType.CAUSAL_LM,
r=16, # 秩 — 增加以提高容量,减少以节省内存
lora_alpha=32, # 缩放因子;通常为2×秩
target_modules=["q_proj", "v_proj"],
lora_dropout=0.05,
bias="none",
)
model = get_peft_model(model, lora_config)
model.print_trainable_parameters() # 验证:应为总参数的约0.1–1%
# 3. 加载并格式化数据集(Alpaca风格的JSONL)
dataset = load_dataset("json", data_files={"train": "train.jsonl", "test": "test.jsonl"})
def format_prompt(example):
return {"text": f"### 指令:\n{example['instruction']}\n\n### 回复:\n{example['output']}"}
dataset = dataset.map(format_prompt)
# 4. 训练参数
training_args = TrainingArguments(
output_dir="./checkpoints",
num_train_epochs=3,
per_device_train_batch_size=4,
gradient_accumulation_steps=4, # 有效批次大小 = 16
learning_rate=2e-4,
lr_scheduler_type="cosine",
warmup_ratio=0.03, # 始终使用预热
fp16=False,
bf16=True,
logging_steps=10,
eval_strategy="steps",
eval_steps=100,
save_steps=200,
load_best_model_at_end=True,
)
# 5. 训练
trainer = SFTTrainer(
model=model,
args=training_args,
train_dataset=dataset["train"],
eval_dataset=dataset["test"],
dataset_text_field="text",
max_seq_length=2048,
)
trainer.train()
# 6. 仅保存适配器权重
model.save_pretrained("./lora-adapter")
tokenizer.save_pretrained("./lora-adapter")
QLoRA变体 — 在加载模型前添加以下行以启用4位量化:
from transformers import BitsAndBytesConfig
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
bnb_4bit_quant_type="nf4",
bnb_4bit_compute_dtype=torch.bfloat16,
bnb_4bit_use_double_quant=True,
)
model = AutoModelForCausalLM.from_pretrained(model_id, quantization_config=bnb_config, device_map="auto")
合并适配器到基础模型以部署:
from peft import PeftModel
base = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16)
merged = PeftModel.from_pretrained(base, "./lora-adapter").merge_and_unload()
merged.save_pretrained("./merged-model")
约束
必须做
- 在训练前验证数据集质量
- 对大模型(>7B)使用参数高效方法
- 监控训练/验证损失曲线
- 记录超参数和训练配置
- 对数据集和模型检查点进行版本管理
- 始终包含学习率预热
禁止做
- 跳过数据质量验证
- 在小数据集上过拟合 — 使用正则化(dropout、权重衰减)和早停
- 合并不兼容的适配器(秩、基础模型或目标模块不匹配)
- 未在保留集和延迟基准测试上进行评估就部署
输出模板
实现微调时,始终提供:
- 数据集准备脚本,包含验证逻辑(模式检查、token长度直方图、去重)
- 训练配置(完整的
TrainingArguments+LoraConfig块,带注释) - 评估脚本,报告困惑度、任务特定指标和延迟
- 简要设计理由 — 为什么为此任务选择此PEFT方法、秩和学习率





