人形机器人最难的不是走路,而是端茶倒水?
人形机器人最尴尬的时刻,可能不是摔倒,而是站在桌边,面对一杯普通的水束手无策,它能跑、能跳、能翻跟头,真让它把杯子端到人面前,反倒容易出问题。
这不是段子,而是2026年人形机器人行业绕不开的一道坎。
今年5月,卡内基梅隆大学与博世人工智能中心推出HTD模型,试图让机器人在动作发生前,先“预判”手指下一秒会碰到什么、应该施加多大力量。结合强化学习训练的下半身控制器后,机器人在整理书籍、铲猫砂、端茶送水等五项真实任务中的成功率提升了90.9%。
这个数字很亮眼,却也暴露出另一个事实:在此之前,机器人处理这些生活动作时,成功率并不算高。
跑跳翻跟头为什么看起来容易?因为这些动作大多能在实验室里反复调试,地面平整,光线稳定,路线提前设定,机器人只要别摔倒,现场就能收获掌声。
端水则完全不同,杯子摆放的位置会变,水量会变,桌面可能打滑,握力太大容易捏坏杯子,力气太小又可能脱手,旁边还可能突然有人经过。人类觉得只是顺手一拿,机器人面对的却是一串不断变化的物理问题。
真正难啃的地方,集中在那双手上。
人的一只手拥有二十多个自由度,手指、关节和掌心会根据触感不断调整,如今的机器人灵巧手,即使能稳定控制十几个到二十个自由度,也已经称得上先进。
特斯拉Optimus的一只手就包含超过100个独立部件,触摸传感器还面临磨损和耐用性问题,为了解决这个麻烦,特斯拉甚至提出了使用可更换传感器“手套”的思路。
宇树科技创始人王兴兴在9月数贸会上说得很直接:当前最大的瓶颈,是人工智能模型输出的动作与真实物理世界之间存在几毫米误差。
机器人做大动作时方向基本没问题,可一到抓取、装配这类“最后几厘米”的环节,偏差无法及时修正,整个任务就可能失败。
视觉能告诉机器人“那是一个杯子”,却未必能告诉它杯子是否正在下滑,瓶盖有没有拧紧,手指究竟碰到了多大阻力,对机器人来说,触觉比视觉更难补上。
1971年,英国青年伊恩·沃特曼因病毒感染失去了颈部以下的本体感觉,但运动神经仍然正常。他无法判断手臂处于什么位置,只能一直盯着自己的手,才能完成端水杯这样的简单动作。一旦移开视线,动作很快就会失控。
如今的人形机器人,某种程度上也处在类似困境里:看得见,却感受不到;有力气,却不知道该怎么用。
硬件厂商正在努力补上这块短板,今年6月,上海张江举行具身智能供应链大会,傲意科技发布3D磁触觉灵巧手,能够感知0.1牛顿的力量,大约相当于一只蝴蝶落在手背上的重量,剪切力方向分辨精度达到1度,采样频率为150赫兹。
同月,纬钛机器人推出了专门面向灵巧手的视触觉仿生指尖GF515,传感器、仿生指尖和力控部件都在快速进步,但行业里那句评价依然刺耳:“有手无脑、有指标无数据、能演示不能干活。”
手造出来只是半程,怎么让它听懂指令、及时调整动作,才是更大的问题,更麻烦的是,训练机器人需要大量真实数据,而这恰恰是目前最稀缺的资源。
央视9月一档节目提到,从抓取物品到叠衣服,一个动作训练师往往要重复1250次。人类几秒钟叠好的衣服,机器人却要拆成视觉识别、柔性操作、动作规划等多个环节,稍有一个步骤出错,后面就全乱。
王兴兴提出的目标很明确:未来,人只需要说一句话,机器人就能理解意思并生成动作,随后投入大规模工作。可眼下,机器人执行指令仍有明显延迟,连续作业效率也远没有达到人类水平。
价格又给这条路添了一道门槛。目前主流灵巧手单价普遍在2万元到10万元以上,占人形机器人整机成本的20%至25%。特斯拉、宇树科技等企业都在压低成本,宇树9月发布的Dex5-S灵巧手拥有22个主动自由度,起售价降到3.99万元。
但即便如此,这个价格对普通家庭来说依旧不便宜,想让机器人真正走进厨房、客厅和养老场景,技术要过关,账也得算得过来。
今年6月,工信部与国务院国资委联合启动人形机器人与具身智能实景实训专项行动,提出到2026年底实现重点产品常态化部署。信号很清楚:机器人不能一直留在实验室里表演,必须进入工厂、仓库、餐厅和养老院,接受真实环境的反复“刁难”。
实验室里的任务像提前印好的试卷,现实世界却总会临时加题。箱子没有摆正,门没有完全打开,地上有水,工具被人随手放错位置——这些在人类看来只是现场有点乱,对机器人来说,却可能立刻变成系统崩溃。
从能翻跟头,到能稳定端水,中间差的不是一个动作,而是触觉精度、力控速度、训练数据和整机成本的共同突破。机器人最终能不能在十年后进入千家万户,关键不在演示有多漂亮,而在每一次失败之后,行业能不能把那几毫米的误差真正磨掉。
真正的智能,不是站在聚光灯下完成标准动作,而是在没人替它整理现场时,也能把一杯水稳稳送到你手里。
