AI 会做题,却未必能自进化:字节 Seed 等提出三项新基准
10 小时前

字节跳动Seed等机构研究者提出了Self-Developing Agents研究方向,旨在让AI能像人类一样,从模糊目标中自主学习并积累可复用能力,填补递归式自我改进的空白。为此,研究团队提出了ASPIRE、S³Gym和HarnessDev三项基准,分别用于评估Agent从模糊目标中学习的能力、从经验中学习的能力,以及Harness改进后的保留能力。实验结果表明,当前Agent已具备一定程度的自我训练、总结和修改能力,但仍面临挑战,如难以准确判断改进方向、筛选值得吸收的经验,以及评估改进效果。主要问题在于代理目标与真实目标的不匹配,以及对局部反馈和可见指标的过度拟合。未来,这类Agent的发展关键在于构建更可靠的目标形成、验证和保留机制,以沉淀出可泛化的稳定能力。