DC娱乐网

腾讯新论文:给你的 Agent 代码配手册

这篇论文最近在 HF 上引发了不少讨论,其中有几个观点非常有意思,也切中了 Coding Agent 当前的真实痛点,正好分享给大家。

Coding Agent 真正棘手的地方,往往不是“不会写代码”,而是“不知道该改哪里”。Agent Harness 的一次行为变化,可能同时涉及提示词、状态管理、工具调用、异常分支和多个模块;传统代码搜索能找到关键词,却很难还原“用户描述的行为”与“实际实现位置”之间的映射。

腾讯 HY LLM Frontier 联合印第安纳大学等机构提出 Harness Handbook:不再按文件和函数组织代码知识,而是围绕“系统做什么”建立一份始终指向源码的行为手册。

核心设计包括:
🔷三层行为视图:从系统架构 L1、执行阶段 L2,逐步深入源码单元 L3;
🔷静态分析 + LLM 结构化:抽取调用图、状态读写和代码位置,再组织成行为地图;
🔷BGPD 渐进披露:Agent 先定位目标行为,再按需读取实现细节;
🔷自动同步:代码发生有效 diff 后更新手册,并重新验证源码锚点,避免文档过期。

团队在 Terminus-2 和 Codex 两个开源 Harness、共60个修改请求上测试。加入 Handbook 后,编辑计划胜率分别提升 18.9、10.0 个百分点,规划 token 同时减少 8.6% 和12.7%;文件与符号定位的 F1 提升 5.0—18.8 个百分点。

下一阶段 Coding Agent 的竞争,不只是模型能不能生成修改,还包括系统能否长期维护一份可靠的“行为—代码地图”。
推荐给做 Coding Agent、代码库理解、Agent Harness 和大型仓库自动维护的团队。

论文已经上传,需要的童鞋自取哦~ 👇🏻