【Bug已解决】Bug: GRPO quickstart max_completion_length=256 default silently breaks training 解决方案
【Bug已解决】Bug: GRPO quickstart max_completion_length256 default silently breaks training 解决方案
一、现象长什么样
照着 GRPO 官方 quickstart 跑通了第一个例子,但训练几百步后你会发现:reward 曲线几乎不动,模型也学不会变长、变…
2026/7/22 2:56:35