苹果高效推理新作:AI如何学会内化视觉CoT
多模态大模型近年来流行 Chain-of-Thought(CoT):让模型把中间思考过程显式写出来,再给出最终答案。在视觉领域,这演变成了 Visual CoT:让模型先生成一张未来帧的图像,再基于这张图做推理。这很直观,但代价高昂。生成和重新编码图像让推理延迟暴涨 5-6 倍。
最近,一项名为 “内化视觉思维”(Internalized Visual Thinking, IVT) 的新研究提出了一种更优雅的思路。它让AI在训练阶段大量学习预测视频未来的“潜表征”(latent representation),但在实际推理(使用)阶段,则直接给出预测结果,不再生成任何中间画面。
实验结果令人振奋:IVT 在全部 6 项评测设置上均优于基于文本的后训练,同时保持相同的推理速度。与视觉 CoT 相比,IVT 取得了相当或更好的性能表现,并将平均端到端延迟降低了 5 倍以上。
关键洞察来自一个"作弊"实验:如果把视觉CoT生成的图换成真实的未来帧,效果大幅提升。这说明问题不在"未来视觉信息有没有用",而在"生成的像素是否足够真实且廉价"。IVT 的答案是:把视觉预判内化到表征里,而不是外化成像素。
一句话总结:世界模型可以是训练时的"健身房",不必是推理时的"负重"。
论文标题:Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
Arxiv: 2608.15869
LLM 大模型







