「DeepSeek 发布 R1 大模型后,有人提出,将大语言模型加入端到端方案,做出 VLA(视觉-语言-行动模型),可能成为新的追赶路径。
春节后,李想决定提前启动 VLA 量产开发,目标是甩开国内所有智驾对手。
多名参与者说,原定约两年的开发周期被压缩到半年左右,计划随 i8 首发。
VLA 引入了大语言模型能力,用于理解场景并生成驾驶动作,对数据和算力的需求更高,同时仍要满足驾驶决策的实时响应要求。
但 VLA 没能复制端到端的开发速度。端到端已经特斯拉大规模验证,VLA 没有。
而端到端量产才半年,数据和模型积累还有探索空间。一名数据闭环员工说,VLA 缺少充分预研,却直接进入了量产开发。
VLA 刚开始的几个版本体验不及端到端,理想智驾团队花了几个月才逐渐改善问题。
2025 年 12 月的更新把响应时间缩短到 200 毫秒;2026 年 1 月把加减速控制全部交给模型,顿挫才明显减少。
开发几个月后,一名项目成员说,团队发现新方案在一些复杂场景的应对成功率只有端到端的八成,跟车和加减速反应也更慢。
另一名参与者解释了原因:语言部分参与环境理解和驾驶决策,拉长了模型的推理链路。
但驾驶是毫秒级的连续决策,模型每慢一点,都会影响跟车、变道和避障的时机。
Momenta CEO 曹旭东认为,VLA 在驾驶领域即使有效,只会提供有限的增量。Momenta 没有在自己的新方案里加入语言层,直接用强化学习加世界模型。
另一家头部智驾供应商预研并测试后发现,在其测试任务中,一个 70 亿至 80 亿参数的 VLA 模型与一个参数不到 10 亿的端到端模型性能差距不大。」
