研究显示复杂 Harness Evolution 效果不如多跑几遍
9 小时前

AI2与华盛顿大学开展了一项关于Agent研究中热门方向Harness Evolution的实验,将其与简单的test-time scaling方法(如“多跑几遍”)在相同反馈和相近推理预算的条件下进行对比。实验结果表明,复杂的Harness Evolution方法并未稳定超越简单方法,且其进化出的Harness在新任务上的提升有限,部分收益更接近于任务特定适配,而非通用Agent架构的优化。研究还揭示,当前部分Harness Evolution的性能提升可能主要源于计算量的增加,而非Harness本身的优化。因此,未来评估Agent系统时,应以相近推理预算和外部反馈为标准,并探索更能体现Harness价值的任务基准。