DC娱乐网

Meta团队:给AI加“研究品味”,预算立省1/3 现在 AI 自动科研生成一个

Meta团队:给AI加“研究品味”,预算立省1/3
现在 AI 自动科研生成一个候选方案只需几分钟,评估验证却可能耗费数小时甚至数天 GPU 时间。“研究品味”——选择跑什么——开始成为科研 Agent 的关键能力。

Meta、牛津大学、UCL 团队提出 AI Research Preference Models(RPM,AI 研究偏好模型),解决科研 Agent 的实验预算分配问题:面对大量候选方向,哪些值得花算力验证,哪些应该尽早放弃?

RPM 不直接预测某个方案最终能拿多少分,而是做候选间的相对排序。Agent 一次生成多个方案,RPM 根据方案、代码和已有实验轨迹,从中挑出更值得继续执行的方向,再投入完整算力。作者发现,相比预测绝对实验结果,这种相对判断更加可靠。

团队设计了两种 RPM:
🌟第一种是纯推理版,不运行候选实验,仅根据方案、代码差异和历史实验记录进行排序。
🌟第二种是 Agentic RPM,正式训练前先在沙盒中做低成本的小规模试验,用几分钟验证方案潜力,再决定是否投入完整训练。

接入 AIRA-dojo 后,RPM 在 AIRS-Bench 上将平均归一化得分从 0.684 提升到 0.729。更明显的是实验效率:原始 Agent 需要 24 小时达到的成绩,加入 RPM 后大约 15 小时就能达到,使用不到原来 2/3 的执行预算。

团队还在两个任务上刷新此前最佳成绩:WinoGrande 达到 94.1%,SVAMP 达到 95.7%。

目前实验仍集中在 AIRA-dojo 和 AIRS-Bench,跨科研 Agent 框架、跨任务的泛化能力还需要继续验证。

这篇工作把“研究品味”变成了科研 Agent 可以显式优化的一环。当生成 Idea 已经足够便宜,自动科研接下来的难题是“该把算力花在哪里”:知道什么值得试,也知道什么应该尽早放弃。
感兴趣的同学可以自行下载pdf哦👇~
ai agent ai科研 科研 学术 人工智能 论文 meta 博士