Faraday:27B 的"AI 科学家来了,指挥 GPT 5.5 +codex干编程活,在论文相关内容复现类任务上打败了 Claude Opus 4.8 和 GPT-5.5 本身。
Inherent Labs 昨天放出的 Faraday,我认为是这半年AI2S最值得看的 AI for Science之一。
三个亮点:
1️⃣ 任务设计
给论文,不给图,让 agent 在限定算力内复现出来。论文只写成功路径不写失败路径,所以复现天然要求假设驱动的探索。arXiv 有多少论文就有多少任务,无限可扩展。
2️⃣ 小模型指挥大模型
解耦科研判断力和coding:自己不写代码,而是像人一样使用 GPT-5.5 Codex 当编程工具,训练时用的是 GPT-5.4-mini,测试时能泛化到指挥更强的 agent,。
3️⃣ 科研没有可验证奖励怎么做 RL?
自动生成 per-task rubric 的 judge,再加多次采样聚合和 turn-level 信用分配来降噪,这套方法论可以在很多场景用。
它和前几天的介绍的清华开源的openrsi(35B 在 MLE-Bench Lite 上逼近 GPT-5.6 Sol)解决的是同一类问题:小模型 + 会用工具 ≥ 前沿大模型,而且两家都选了"科研 / ML 工程"当战场。
还有,我上周聊过的Lilian Weng 那篇 harness 综述里,头号难题就是"评估器又弱又模糊——研究品味、新颖性、长期科学价值极难测量",她引的 PaperBench(最好约 21%,低于 ML 博士)正是这个问题的前身。
而Faraday 恰恰是冲着"训练品味"去的,它用 rubric 裁判来解决打分,正好对应 Weng 指出的那个瓶颈。 这个打分裁判路径方向对不对,还在探索阶段,谁好谁坏科研的过程中逐步会有答案,大家怎么看