DC娱乐网

同样的模型,用不同的harness区别会有多大? Composio把自己之前的测

同样的模型,用不同的harness区别会有多大? Composio把自己之前的测试(网页链接 )完善了一下。都用Kimi K3模型+不同的harness测试完成同样的任务。这三张图分别是三个维度:任务成功率、平均费用(因为模型相同其实就是token数了)、任务完成时间(中位数)。

结论是Claude Code最费token(不是一般的费啊),Codex成功率最低其他几个各有优劣,差不太多。How I AI