清华团队再探 On-Policy Distillation:数据撑死,算法饿死
7 小时前

清华大学等多机构研究者对On-Policy Distillation(在线策略蒸馏,OPD)展开研究。他们将训练集缩减至仅1道题,发现模型在训练几百步后仍能持续提升性能,单题训练可恢复全量数据约70%以上的收益,且在数学、编程等多任务及不同模型上均表现出类似效果,对训练题性质不敏感。研究指出,OPD面临“数据撑死,算法饿死”的问题:在数据方面,一道题通过反复rollout可产生大量状态,1道题能覆盖全量状态空间的71.5%,16道不同语义的题即可达到与全量数据相当的效果,表明题目数量并非衡量有效监督量的合适标准,状态覆盖更为关键。在算法方面,模型吸收监督的速度随训练推进逐渐减缓,且训练集大小对吸收率影响极小,即使状态固定,模型仍需多次更新以消化监督。在多教师OPD(MOPD)设置下,每个领域16道语义不同的题即可达到全量MOPD的效果。极端实验表明,无明确任务内容的输入也能产生有效监督,关键在于能否使模型进入教师可提供有效监督的状态。此外,与RLVR相比,OPD训练涨幅更高,但二者天花板受不同因素限制。该研究为OPD数据筛选提供了新视角,即应关注题目能否引导模型访问未探索状态、教师是否有可教内容及学生吸收速度,这一状态视角也可能适用于其他on-policy训练范式。