📄 online-rl.md

← Vault

Online RL Methods

Guide to online reinforcement learning with PPO, GRPO, RLOO, and OnlineDPO.

Overview

Online RL generates completions during training and optimizes based on rewards.

PPO (Proximal Policy Optimization)

Classic RL algorithm for LLM alignment.

Basic Usage

`bash

python -m trl.scripts.ppo \

--model_name_or_path Qwen/Qwen2.5-0.5B-Instruct \

--reward_model_path reward-model \

--dataset_name trl-internal-testing/descriptiveness-sentiment-trl-style \

--output_dir model-ppo \

--learning_rate 3e-6 \

--per_device_train_batch_size 64 \

--total_episodes 10000 \

--num_ppo_epochs 4 \

--kl_coef 0.05

`

Key Parameters