[CL]《Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills》S Huang, P Cheng, H Liu, T Chen… [Qwen Large Model Application Team, Alibaba] (2026)
在 LLM 自我进化领域,如何平衡任务多样性与验证可靠性是一个悬而未决的难题。过去的方法受困于“环境束缚”或“无引导生成”的二律背反,本质原因是:强环境约束虽能提供精准反馈,却将学习局限在狭窄领域;而开放式生成虽拓宽了任务空间,却因缺乏结构化引导导致验证失效,产生的合成噪声会污染训练循环。
本文的核心洞见是:把“技能(Skills)”重新看作连接受限环境与开放生成的动态进化接口。由此,Skill-SP 框架通过“提议者、解决者、技能控制器”的协同演化,使技能库能够从执行反馈中自动提炼、更新和诱导新技能。这种以技能为锚点的动态路由机制,既为任务生成注入了结构化先验以确保可验证性,又通过不断扩张的技能边界维持了任务的开放性。
这项工作真正留下的遗产是证明了“技能”可以作为 LLM 自我进化的脚手架,实现从数据驱动向交互驱动范式的跳跃。它为后来者打开的新门是构建了一套可规模化的、能跨领域(如工具调用与逻辑推理)迁移的自主进化引擎,但尚未跨过的门槛是:在极度复杂的未知领域,如何摆脱对初始基础能力的依赖以完成从零到一的进化冷启动。
arxiv.org/abs/2607.22529 机器学习 人工智能 论文 AI创造营








