DC娱乐网

宇树UnifoLM-X2-1.0:让机器人打拳,它和ChatGPT的核心差异在哪

2026年9月7日晚,宇树科技放出一段38秒的视频。画面里,一台G1人形机器人戴着红色拳套,和人类拳手在擂台上对打。人类
2026年9月7日晚,宇树科技放出一段38秒的视频。画面里,一台G1人形机器人戴着红色拳套,和人类拳手在擂台上对打。人类出拳,它侧身闪开;人类起腿扫踢,它后撤一步稳住重心,然后找到空档单腿支撑、另一条腿扫向对手躯干。视频标注:全程实拍,无加速,无遥控,无预设脚本。
宇树科技发布人形机器人自主格斗相关博文
这是全球首次由世界模型实时驱动的全自主人形机器人格斗演示。驱动这台机器人的,就是宇树刚发布的UnifoLM-X2-1.0世界-动作大模型。
但“世界-动作大模型”这个名字,和“ChatGPT”放在一起,容易让人误以为它们是同一个物种。实际上,它们之间的差异,不比一个拳击手和一个语言学家之间的差异小。
它不是在“理解语言”,而是在“推演物理后果”要理解这个差异,先看G1在擂台上到底做了什么。
人类一拳从启动到命中,快则零点几秒。在这段时间里,机器人要做完四件事:看清对手的动作、评估威胁、决定怎么应对、把指令下发给全身关节。按传统的做法,这四步是串行的——相机采集、状态估计、规划求解、电机响应,每一步都在吃掉时间预算。
环环相加,拳头到了眼前,指令还在路上。
宇树的解法是把“反应”变成“预判”。UnifoLM-X2-1.0在内部运行了一个推演引擎:给定当前的观测状态和一组候选动作,它先算一遍每种动作接下来会导致什么结果——重心会不会偏移、对手会不会反击、碰撞之后受力怎么分布——然后挑一条最有利的轨迹交给身体执行。
六格画面展示实拍场景与模型预测结果
类比一下:你下棋的时候,不会等对手走完再想怎么应对。你会在脑子里预演:“如果我走这一步,他可能会走那几步,然后我再用这一步反击。”
UnifoLM-X2-1.0做的事情,本质上就是在物理世界里下棋,只是它的“棋盘”是擂台,它的“棋子”是全身关节,它的“对手”是一个会实时移动、会攻击的人类拳手。
ChatGPT不是这么工作的。你问它一个问题,它把你的话拆成一个个token,然后在它见过的所有文本里,找一个概率最高的token接在后面,如此往复,直到生成一个完整的回答。这个过程中,它唯一需要遵守的规则是语义逻辑——话要通顺,上下文要连贯,不能自相矛盾。
它没有身体,没有重量,不需要考虑重力,不需要担心一脚踢空之后会不会摔倒。
UnifoLM-X2-1.0的每一步推演,都必须遵守物理规律:重心不能偏出支撑面、关节扭矩不能超过上限、碰撞之后要能恢复平衡。推演的结果不是一段文字,是一组关节角度、力矩和运动轨迹,直接转化成电机指令,没有任何中间的文字翻译环节。
同一个模型,两套完全不同的“输入输出系统”你把ChatGPT和UnifoLM-X2-1.0放在一起对比,最能看出差异的地方是输入和输出。
ChatGPT吃的是文字。你打一段话,它把这段话切成令牌,然后逐个处理。输入是离散的、有边界的——你打完字、按下回车,它才开始工作。输出也是文字,生成完最后一个字,任务就结束了。这一轮对话和下一轮对话之间,没有物理上的连续性。
UnifoLM-X2-1.0吃的是连续物理信号。G1身上装着视觉相机和关节力矩传感器,它们同步采集对手的实时动作、自己每个关节的角度和受力情况,形成毫秒级的连续观测流。没有“输入结束”这个概念——物理世界不会停下来等你,对手的拳头不会等你打完字再挥过来。
输出也不是文字。模型推演完,直接生成一组关节动作序列:出拳、格挡、后撤、扫腿。这些指令下发到电机之后,机器人在碰撞瞬间收到的力矩反馈立刻进入下一轮感知-推演-决策循环,全程没有人工遥控,没有预设脚本。

把这个对比再简化为一个更直观的类比:ChatGPT像是你手机里的语言助手,你跟它聊完,它就回到待机状态,等你下一次召唤。
UnifoLM-X2-1.0像是你开车时的身体本能——你看到前车急刹,脚已经踩下去了,你不需要先把“前车刹车”翻译成文字,再分析“我应该减速”,再下达“踩刹车”的指令。你的眼睛、大脑、脚,在毫秒级别完成了一个闭环,中间没有语言介入。
这就是宇树创始人王兴兴说的“输入输出对齐”问题。他在2026年世界机器人大会上直言,机器人目前最大的瓶颈就是AI模型的输入和输出对齐程度不够,每输入输出一次都会产生偏差,导致全世界的模型真实成功率都比较差。
UnifoLM-X2-1.0这次演示,就是在尝试把这个对齐做到搏击场景下可用。
能打拳,不等于能干活但这段38秒的视频,也把UnifoLM-X2-1.0的边界暴露得很清楚。
它目前只验证了格斗这一个场景。换一个没有提前调试过的陌生环境,比如一个堆满杂物的客厅、一条光线不稳定的走廊,它的任务成功率会显著下降。每切换一个全新任务,都需要重新针对真机环境做适配,做不到像ChatGPT那样零样本跨领域通用。
工作人员通过体感设备操控人形机器人
英伟达机器人研究负责人Jim Fan曾明确指出,这类世界动作模型存在一个内生缺陷:视频预测如果出现“物理幻觉”——也就是模型推演的未来状态和真实物理世界之间出现像素级的偏差——这个偏差会直接转化成动作失败。
他展示过一个例子,某模型在解迷宫时,因为预测画面里“省略”了几何结构,导致机器人走错了路。
还有更根本的能力边界。UnifoLM-X2-1.0可以做物理对抗,但它做不了抽象逻辑推导,做不了跨语种文本生成,做不了数学猜想的证伪,做不了代码编写。这些纯符号领域的任务,恰恰是ChatGPT这类语言模型的主场。
反过来也一样——你把ChatGPT接到一台机器人身上,让它控制身体打拳,它连“重心”是什么都不知道,因为它只在文字里见过这个词,没有体验过倾斜身体时重力对关节的拉扯。
王兴兴自己对这个差距的判断很清醒。他给出了一个“具身智能ChatGPT时刻”的标准:当机器人能在80%的陌生环境中,仅通过语音或文字指令就完成约80%的日常任务,才算真正迈过了门槛。他预计这个节点快则2到3年,慢则5到10年。
人形机器人可通过语音指令完成指定任务
UnifoLM-X2-1.0这次演示的意义,不在于它已经能替代人类拳手,而在于它第一次把“世界模型驱动”这条路从纸面推到了擂台——它证明了,让机器人在脑子里推演物理后果、在毫秒内完成感知-决策-执行的闭环,在极限对抗场景下是可行的。
至于这条路能走多远,要看它能不能从擂台走到客厅,能不能从格斗泛化到折叠毛巾、收纳玩具、插花这些更接近日常的任务。用王兴兴的话说,真正的爆发时刻,还在未来1到2年里。