改进的 GRPO 后训练大模型
在 DeepScaleR 数学数据上对比原始 GRPO 与改进方案,通过难度预测器筛选更合适的题目,并结合历史数据重用减少新采样量,维持训练 batch 的有效性。
数据集
- 训练集:DeepScaleR,共 10,240 条数学题
- 测试集:GSM8K、MATH500、Minerva Math、OlympiadBench
- 评价指标:四个 benchmark accuracy 的等权平均
模型
Qwen2.5-Math-1.5B Base
改进方案
保留 GRPO 的 group-relative advantage 训练思路;在 epoch 0 后使用 256 fresh prompts + 256 replay prompts,并用难度预测器优先选择目标成功率附近的样本。
结果
下方曲线显示,改进方案在训练步数和 wall-clock time 两个维度上整体更快提升,最终平均准确率约 37.7%,高于原始 GRPO 的约 36.45%。
核心参数
- GPU
- 4 x A100
- Total Steps
- 30
- Train Batch
- 512 prompts / step
- Rollout Num
- 8
- Max Prompt
- 1024 tokens
- Max Response
- 3072 tokens
- Learning Rate
- 1e-6
- PPO Mini-batch
- 64
- Micro Batch / GPU
- 4
- Fresh / Replay
- 256 + 256
- Replay Buffer
- 512
- ref_size
- 256