2025这⼀年跨度还挺⼤的,年初还在调ppo现在已经all in到agentic rl了。
年初的时候主要精⼒还是在传统rl上,做rlhf、reward modeling这些。那会⼉觉得把reward function 设计好policy⾃然就能学好,结果越做越发现这个思路有问题。很多复杂任务根本没法⽤单⼀的奖励函数描述清楚,⽽且⼈类反馈本⾝就很很主观。训了⼏个⽉模型虽然能跑但总感觉差点意思,就是那种技术上没问题但实际⽤起来很蠢的感觉开始做agentic rl之后发现坑⽐想象中多太多。最⼤的问题是action space变得很复杂,不再是简单的离散或者连续动作,⽽是要输出结构化的tool call、reasoning chain、甚⾄是code。传统的policynetwork根本扛不住,必须⽤llm做backbone。但llm做rl⼜有新的挑战,梯度太吵、训练太慢、对⻬
很难保证。
我现在的做法是混合⽅案。⽤llm做⾼层的planning和tool selection,但具体的执⾏还是⽤⼩模型或
者规则来做。这样既能利⽤llm的推理能⼒,⼜不会被它的低效拖累。关键是要设计好llm和传统rl组件
之间的接⼝,让两者能顺畅地配合起来,因为agent可能要执⾏很⻓的action sequence才能看到结果。我试过⽤trajectory-level reward但credit assignment特别难,最后⼀步成功了但前⾯哪些action是关键的根本不知道。现在在⽤hindsight experience需要的时候再retrieve出来。配合⼀个⼩的working memory存最近的⼏步交互,这样能处理⻓期依赖⼜不会超context limit。
传统rl训出的policy⼀般都很拉胯,环境稍微变⼀下就不⾏了。但agentic rl因为agent是在更抽象的层
⾯上做reasoning和planning,对环境变化的鲁棒性好很多。我在⼏个完全没⻅过的task上测试,agent虽然表现不如专⻔训练的但⾄少能给出合理的solution。感兴趣的可以和我交流,现在有打算做Agentic RL的下⼀个跨步⼯作
深度学习
