DC娱乐网

百支模型一套标准,AI浪潮谁在裸泳 不知道大家有没有刷到过,各种各样的机器人视频

百支模型一套标准,AI浪潮谁在裸泳
不知道大家有没有刷到过,各种各样的机器人视频。

机器人参加运动会,端咖啡,跑步,一个一个动作都非常丝滑,感觉机器人革命就在明天了。

但是冷静下来看,这些视频好像只是放了成功的一遍,不过品牌方宣传吗,挑好的放天经地义

但是作为旁观者来看,我根本判断不了这些具身智能模型谁强谁弱,也不知道现在发展水平咋样?

前一阵发现了一个平台,感觉很有趣,叫做RoboColiseum,他起名的逻辑也很有意思,Coliseum的英语翻译就是古罗马竞技场,也就是他想建一个帮开发者测试模型的竞技和训练场。

简单说下它的原理,它构建了一个仿真环境,并且考题比较标准化,模型跑完直接出分。

平台环境也非常接近真实,评测的实用价值很高,仿真评测与实机部署的相关性已经达到了89.5%,评测差异不到10%,基本上效果和真机差不太多。

简单解释一下,在这上面行的,上真机大概也靠谱,所以如果有开发者为了省点钱,也可以在仿真模型里快速筛选一轮,然后在上真机,能比较快速筛选出模型问题。

为了更好地检测出这些模型的能力,RoboColiseum 还设置了四个维度:指令跟随、空间理解、扰动适应、通用操作、78 个任务一项项考,还会拆解子步骤,无论你模型卡在哪一步,短板在哪,都给你记下来。

而且这个平台的使用门槛也挺低的,注册到提交最快才5分钟,最快30分钟就出结果,也不用担心模型代码泄露,都保留在本地,接个本地部署就行。

也不用担心基线有水分,平台目前放了 ACoT-VLA、π0、π0.5、GR00T 这些主流模型的基线成绩和训练代码,开发者想自己复现核验都还比较容易。目前该平台从内测上线以来,也已经有海内外近百支队伍进行测试了。

总结一下吧,我觉得在具身智能领域,出现这样的平台挺好的,因为没有一把衡量的尺,很多人只能关心到谁家视频剪辑的更好,对于真正做技术的确实不公平。反正我挺期待这个平台的后续发展的,最好做个测评榜出来,让这个行业更透明客观。

这样以后那些靠demo活着的团队,可能要睡不着了!

AI工具 具身智能 人形机器人