【不仅是翻译手语:大模型正在接管真实世界的细微脉动】Google DeepMind推出的SL2T模型实现了手语到文本的实时转化,通过摄像头捕捉手势、表情及身体律动的复杂组合。它在FLEURS-ASL基准上获得70分,不仅远超此前45分的行业记录,甚至超越了64.6分的人类平均基准。值得注意的是,该模型特别针对单手握持手机等日常场景进行了优化,并坚持将姿态追踪放在端侧以保护隐私。社区对此呈现出两种极具代表性的视角:一派认为这展示了DeepMind在AGI路径上的战略坚持,相比其他厂商在对话机器人和UI包装上的内卷,这种深入物理空间感知、解决非盈利性复杂问题的“硬核科学精神”更具长远价值;另一派则担忧这会重蹈Google以往“发布即弃”的覆辙,甚至认为通用大模型最终会以暴力计算直接碾压这类专用模型。但不可忽视的是,手语并非简单的手势映射,而是包含空间语法的独立语言。这种突破不仅是无障碍工具的里程碑,更是AI从理解代码和文本,向理解真实物理交互进化的关键一步。无论未来是否会被通用模型集成,SL2T对边缘群体需求的深度响应,都为冷冰冰的算力竞赛注入了难得的技术尊严。 deepmind.google/blog/putting-sign-language-ai-into-users-hands/


