📄 SKILL.md

← Vault

name: fine-tuning-with-trl

description: Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

version: 1.0.0

author: Orchestra Research

license: MIT

dependencies: [trl, transformers, datasets, peft, accelerate, torch]

metadata:

hermes:

tags: [Post-Training, TRL, Reinforcement Learning, Fine-Tuning, SFT, DPO, PPO, GRPO, RLHF, Preference Alignment, HuggingFace]


TRL - Transformer Reinforcement Learning

Quick start

TRL provides post-training methods for aligning language models with human preferences.

Installation:

`bash

pip install trl transformers datasets peft accelerate

`

Supervised Fine-Tuning (instruction tuning):

`python

from trl import SFTTrainer

trainer = SFTTrainer(

model="Qwen/Qwen2.5-0.5B",

train_dataset=dataset, # Prompt-completion pairs

)

trainer.train()

`

DPO (align with preferences):

`python

from trl import DPOTrainer, DPOConfig

config = DPOConfig(output_dir="model-dpo", beta=0.1)

trainer = DPOTrainer(

model=model,

args=config,

train_dataset=preference_dataset, # chosen/rejected pairs

processing_class=tokenizer

)

trainer.train()

`

Common workflows

Workflow 1: Full RLHF pipeline (SFT → Reward Model → PPO)

Complete pipeline from base model to human-aligned model.

Copy this checklist:

`

RLHF Training: