DC娱乐网

DeepSeek Harness的邪修还没消化完,今天arXiv又甩出一篇《Prime Agent: A Self-Improving RLM Harness》。这名字起得挺狂,自改进,意思是agent干完活还能自己总结教训、优化工具链,下次干得更好。 说白了就是给模型配了个&

DeepSeek Harness的邪修还没消化完,今天arXiv又甩出一篇《Prime Agent: A Self-Improving RLM Harness》。这名字起得挺狂,自改进,意思是agent干完活还能自己总结教训、优化工具链,下次干得更好。
说白了就是给模型配了个"外挂大脑"——长任务跑不动?外部记忆和计算来凑。跟DeepSeek那套"极简模式邪修"异曲同工,都在证明一件事:模型权重是死的,Harness是活的。同一个模型,裸跑和套上好工具,成绩能差出20题(参考sentdex那组44 vs 64的对比)。
这背后的逻辑很扎心:大模型军备竞赛已经卷到"模型本身"之外了。谁的工具链、工作流、记忆管理更狠,谁就能让同样的参数发挥出翻倍的实力。普通用户还在比谁的模型参数大,圈内人已经在研究怎么给模型"加BUFF"了。
这合理吗?挺合理的。毕竟人类也不是光靠脑子赢的,工具才是第一生产力。
技术圈 开源 DeepSeek