全球最强模型Fable5.1发布这玩意纯纯考试怪。
Terminal-Bench-Science 和 AutomationBench 分数都翻倍了,然而你去对比 Opus 5,GDPval-AA v2 只领先 29 分,CursorBench 从 70.5% 提升到 73.4%.
llm-stats 的综合分上它输给 GPT-5.6 Sol,DeepSWE 甚至还是下降的。
缓存命中降价 25%,然而它跟 Kimi K3 有点像,复杂任务会疯狂开一堆 Agent,烧 Token 也快多了。
最终完成任务花的钱一点也没少甚至可能更多