钱能把人挖来,却未必能把人留下——如今,余家辉也宣布离开Meta创业。
他的履历几乎串起了过去几年多模态 AI 的发展主线:
余家辉来自浙江,本科毕业于中国科学技术大学,2020 年获得 UIUC 电子与计算机工程博士学位,师从计算机视觉泰斗 Thomas S. Huang。
读博期间,他做出了图像修复技术 DeepFill、Slimmable Networks,并获得 2018 年 NTIRE 单图超分辨率挑战赛第一名。
进入 Google 后,他参与了 Conformer、SimVLM、CoCa、Parti、PaLM 2 等重要项目,并共同领导 Gemini 的多模态方向。
2023 年加入 OpenAI 后,他负责 Perception 团队,是 GPT‑4o 的视觉感知负责人之一。
据其个人主页披露,他还曾担任 o3 的多模态后训练负责人,以及 o4-mini 从预训练到后训练的 DRI。
2025 年 6 月,他从 OpenAI 加入 Meta,与扎克伯格、Alexandr Wang 一起建设 TBD Lab,担任多模态团队负责人,团队先后推出 Muse Spark、Voice Mode、Muse Image 和 Muse Video。
加入 Meta 约一年多后,他选择离开并创办一家新公司。目前公司名称、融资情况和具体方向均未披露,只说自己将全力投入一个“对人类未来至关重要、但仍鲜有人探索的问题”。
从图像修复、语音识别,到视觉语言模型、原生多模态和视觉推理,余家辉几乎踩中了近几年 AI 的每一轮技术主线。下一站值得关注。

