DC娱乐网

「让机器人获得下一份智能,能否比之前更便宜?」 这是 WRC 202...

「让机器人获得下一份智能,能否比之前更便宜?」

这是 WRC 2026 期间,跨维智能创始人兼 CEO、香港中文大学(深圳)终身教授贾奎抛出的问题。如果机器人学第一项技能要花 100 单位成本,学到第 100 项还是要 100 单位,那它得到的只是更多定制项目,没有规模经济。物理 AI 要规模化,得让数据、模型和部署经验反复复用,让下一项能力的获取成本持续下降。
他给这套尺度起了个名字,叫 Physical Token 经济学。这里的 Token 不是大模型的计费单位,而是衡量可靠物理智能产出的尺度:至少核算人力、数据、算力三类投入,产出则是可验证、可重复、可部署的机器人能力,而不是一段演示视频或一次偶然成功。
围绕这条成本曲线,贾奎把泛化拆成两层。语义泛化解决的是「看到不同任务和场景,知道该怎么做」,主要来自人类长期活动积累的经验;物理泛化解决的是「条件细微变化后仍然能精准做出来」,要求系统理解动作与环境之间的物理因果。缺了前者,机器人可能懂任务但扛不住接触、摩擦、形变带来的成功率波动;缺了后者,机器人缺少对开放任务的语义理解。跨维智能的组合是低成本人类数据吸收语义经验,大规模合成数据覆盖物理变化,再聚合进模型。
模型架构上,跨维做的是 3D 对齐的世界模型。贾奎举了个双夹爪提锅的例子:VLA 模型能预测夹爪下一步怎么动,世界模型还要预测施力之后锅、夹爪和周围环境会发生什么变化。模型潜在空间的 token 定义在时空网格上,用来预测接下来极短时间内,机器人及环境按三维几何和物理规律如何演化。
数据方面,他主张第一视角人类数据路线:采集设备尽量无感,让人在自然使用双手时持续产生可学习数据,而不是长期依赖昂贵、低吞吐量的真机遥操作。对应地,Dexterity-BEV 把不同传感器输入和不同执行器输出,对齐到世界模型同一组时空节点上,避免模型把容量浪费在适配模态差异上。
贾奎还讲了一个效率点:精确的物理仿真只是第一关,生成式仿真才是规模化的前提。如果系统能根据一张真实场景图片加一段任务描述,自动生成几何正确、物理正确且可交互的环境,搭建新训练场景的边际成本就会大幅下降。
据贾奎现场介绍,跨维已用这套方式落地超过 1500 个模型,覆盖以柔性装配为代表的工业场景及部分商业场景,服务数百家客户。他给物理 AI 提的检验标准是:通用智能不应表现为演示任务数量的增加,而应表现为可靠智能产出的持续增长、新增能力成本的持续下降。对仍处早期的行业,这条成本曲线或许比任何单点指标都更接近规模化的本质。
完整版内容(含 3D 世界模型架构、Dexterity-BEV 详解、生成式仿真技术路线)详见 42 号电波公众号。