外滩大会关于 LLM 和具身智能模型的讨论非常通透,很是解惑。强烈推荐大家找回放看看。
前两天不知道大家有没有看到,X 上有很多人用 GPT-6 Astra 直接操控机械臂完成一些简单任务,而且效果还不错。
当时我就在想,随着 LLM 能力越来越强,那是不是未来一个足够强大的语言模型,也可以直接用在具身智能领域?如果真是这样,那具身智能模型还有存在的必要吗?
具身创业公司自变量的创始人王潜说,他认为不会。虽然 LLM 确实存在泛化能力,但这种泛化能力并不是凭空产生的。它依然建立在数据基础上。
而操纵机器人需要的,恰恰还是采集自物理世界的交互数据。智能的本体存在于数据之中。
从去年年初起,OpenAI 和 Anthropic 便开始大量采购机器人数据,招聘机器人领域人才,并通过小规模数据工厂开展采集。
这些基础模型本身就具备很强的多模态能力,加入机器人数据后,能够控制机器人并不令人意外。
想要靠其他领域,比如 3D、视频领域的智能泛化,对具身智能降维打击,这个几乎不可能。不同领域的数据与任务之间,仍然存在对应关系。
比如为什么现在大模型的 Coding 能力越来越强?绝对不是因为模型具备语言理解能力之后,就自动获得了编程能力。
更重要的原因是,在预训练和后训练阶段,模型接触了大量代码数据,包括开源代码、技术文档等,所以它逐渐形成了 Coding 能力。
写文章也是一样。模型之所以能够写出不错的文章,本质上是因为它学习了互联网中大量文本数据,理解了语言表达的规律。
这些能力看起来像是泛化出来的,但背后依然有大量对应领域的数据支撑。
数学也类似。Coding 能力不会自然转化为数学能力,甚至在训练中还可能互相干扰。所以现在也有一些做法,会分别训练 Coding Expert 和 Math Expert,再把它们融合起来。
最近大家都在关注 AI 在数学领域的新突破,这可能会成为继 Coding 之后,大模型重点的渗透方向。但从公开信息来看,这些数学能力的提升,同样离不开针对数学领域的数据、训练和验证体系。
所以王潜的核心判断是,模型能力最终还是建立在数据基础上。数据是所有模型的第一性原理。
这个确实。无论多么强的 AI 公司,都围绕数据做了大量工作。诸如怎么制造数据、筛选数据、验证数据、标注数据,越来越成为核心竞争力。




