机器人现在已经不缺高光时刻了。格斗、跳舞、叠衣服,现场看起来都挺像那么回事。真正难的是,演示结束以后,它能不能继续学,能不能把仿真里练出来的能力带到真机上,再根据真实环境里的反馈持续调整。
最近圈里刚好有个新动静,指向的就是这件事。7月16日,RLinf发布v0.3版本,百度智能云当天就通过百度百舸完成适配,成为国内首家支持这一版本的云厂商。这个跟进速度多少有点抢跑的意思,但更值得关注的,是百度百舸瞄准了机器人持续进化背后的整条研发链路。
机器人从仿真训练走向真机,涉及数据采集、模型训练、推理部署、真实反馈和再次迭代。中间任何一个环节衔接不上,都会影响研发效率。百度百舸补上的,是这条链路背后的AI Infra能力,包括算力调度、训推加速、预制开发环境和全栈工具链,让前沿算法更容易从开源框架进入企业研发环境。
再看这次适配的RLinf,本身也值得多聊几句。RLinf由清华大学等联合研发,是目前具身智能领域比较领先的大规模强化学习开源框架之一,支持PPO、GRPO等主流算法。
v0.3还进一步扩展了VLA模型、世界模型、真机强化学习、人在环学习和多个主流仿真平台。开发者面对不同模型、机器人和仿真器时,不必反复配置环境、对接数据格式和重搭训练流程,可以在一套框架里完成训练、验证和迭代。
这也是RLinf走得比较靠前的地方。它关注的是能否先在仿真环境里训练,再进入真机执行,随后把真实数据送回训练和评测环节,形成行业常说的“渲训推一体化”。
RLinf、百度百舸二者结合以后,具身智能的研发流程就更完整了。
过去具身智能的讨论,更多围绕模型、硬件和单次演示展开。现在行业开始往更深的一层走,谁能把数据采集、仿真训练、模型推理和真机部署连起来,谁才更有机会提高机器人的研发效率和进化速度。
百度百舸和RLinf这次合作释放出的信号挺明确。具身智能的竞争,正在从单点能力,走向整套研发基础设施。


