Grok 4.6 在 AA-Briefcase 这个长视野智能体知识工作基准上,和 Claude Fable 5 并列冲到榜首,但跑一项任务的成本只要 4.42 美元,而 Claude Fable 5 是 22.30 美元,差不多是五分之一。Artificial Analysis 在 8 月 12 日把这个结果甩到 X 上,配了一句"令人印象深刻的发布"。
这个基准的特殊之处在于,测试集是私有的,模型没法靠"刷过原题"拿分。所以并列第一这个成绩,分量比一般跑分要高,更接近真实跑长链智能体任务时的表现。
成本这块的断层更值得掂量。同档水平下,Grok 4.6 一项任务 4.42 美元,Claude Opus 5 要 17.79 美元,连 Kimi K3 的 6.73 美元都比它贵出将近一半。如果一个智能体流程一天要跑几百上千次任务,这个价差直接决定是亏本还是能跑得动。
不过也别急着全切过去。AA-Briefcase 只测智能体知识工作这一类长视野任务,通用推理、代码生成、多模态这些它不覆盖。所以现在能说的判断是:在以工具调用、长流程执行为主的智能体工作流里,Grok 4.6 是目前性价比最强的选择之一,值得拿来压测自家真实任务。
你平时跑智能体流水线,挑模型时是能力优先还是成本优先?
