举个生活例子:老师花好几年博览群书、刷题思考(大模型原始预训练)。而蒸馏就等于你不去读书刷题,只疯狂抄这个老师的所有标准答案,背下来答题套路。考试看起来分数不错,但你没有自己的底层知识体系,遇到老师从来没见过的新问题,很容易胡说八道。而正规预训练是拿海量真实原始数据喂模型,由模型自己归纳世界规律。而蒸馏则是拿另一个大模型生成的答案当训练素材,模仿输出。API就是程序接口,简单来说就是程序之间互相提问的通道。比如你调用豆包API,就是你的程序发问题给豆包服务器,豆包把回答返回给你的程序。而API检测就是字节内部的监控手段,内部写代码、做实验的员工,不能批量疯狂调用自家大模型API,大批量抓取模型返回的回答,拿去训练另一个新模型。系统后台会实时监控。监控 输出文本是不是被导出拿去当训练集?一旦识别你在干"蒸馏"的事,会限流、告警、拦截,不让你把大量API返回结果扒出来训练新模型(不是监控员工聊天内容,是监控接口调用行为模式: 大批量拿模型生成内容,是蒸馏的典型行为特征)。字节内部定的规矩是: 内部研发人员,禁止拿自家大模型的输出来蒸馏出新模型。在 技术上,API检测拦截,工具层面不让你轻易拿到大批量模型输出用来训练。在制度上,研发规范,做模型不能走蒸馏这条路,不鼓励靠蒸馏做新模型,不把蒸馏模型当做主力技术路线。但允许做少量学术实验,但不允许把蒸馏作为产品模型的主要手段。这不是完全禁止碰蒸馏技术做研究,而是严禁把蒸馏当做打造新一代基础大模型的核心手段。张一鸣为什么说蒸馏会干扰真正长期技术突破?这里要分清几件事:一、工程优化 vs 底层技术突破蒸馏不是完全没用,它有好用的场景:比如已经有一个很强的大模型,蒸馏一个小版本,装在手机本地,追求速度、省算力。这叫工程优化,做产品落地很好。但它的短板是:1.知识是二手的,没有新增认知。也就是说,蒸馏小模型学到的全部东西,都来自原大模型。原模型懂什么,它才懂什么。原模型犯的错,蒸馏模型会原样继承,甚至错误被放大。就像抄作业,你不会比写作业的人懂得更多,最多模仿得很像,不会产生新认知。二、整个行业陷入"模仿内卷",原地打转如果大家都靠蒸馏做新模型,比如A训练一个大模型;B不去啃海量原始数据艰苦预训练,直接蒸馏A,然后C再蒸馏B,这样一代代传下去,模型只是复刻前人的能力,不会诞生超越前辈的能力。所有人都在"模仿别人的模型输出",没有人去攻坚原始预训练、新算法、新架构。行业看起来模型遍地开花,但底层没有实质性进步。三、错误会层层累积大模型本身就会幻觉胡说。蒸馏把生成的文本当训练数据,幻觉、错误会一代一代放大。越往后蒸馏出来的模型,胡说概率就越高。张一鸣这个观点的核心是说, 蒸馏适合做产品优化,但是不能用来做下一代基础模型。沉迷蒸馏,会逃避真正最难的原始预训练工作,扼杀底层创新。也就是说, 不是说蒸馏这个技术本身是垃圾,而是不能把蒸馏当作创造更强基础模型的主要路径。张一鸣的表述是什么意思呢?字节想要的技术突破又是什么呢?简单来说就是从头训练原生基础大模型,追求能力上的本质跃迁,而不是模仿复刻已有模型。依靠海量真实原始世界数据(书籍、网页、论文等),用新的模型架构、训练算法,训练出原生基座大模型。这个模型是自己从0学习理解世界,而不是模仿另一个模型的回答。追求模型本身底层能力提升和更强逻辑推理、真正的世界认知、更少幻觉,而不是"模仿现有模型说话很像"。其目标是超越现有水平的基座,而不是做一个高仿副本。那么这件事很难吗?难在哪?是的,非常难,是烧钱+技术双重地狱:1. 钱烧得恐怖:原生预训练,要采购海量GPU显卡,一次训练几亿、几十亿成本。而蒸馏成本极低,几张卡就能跑。2.高质量原始数据很难搞: 互联网干净、高质量的原始文本越来越少。到处都是AI生成的垃圾文本。找海量干净真实人类原始数据,是全世界大模型公司最头疼的头号难题。3.算法架构创新门槛高: 蒸馏是拿来主义,原生基座要摸索新网络架构、训练策略,大量实验会失败,试错成本极高。4.对比:蒸馏捷径,见效快,短期可以快速做出一个看起来不错的模型,交差出成果;原生预训练周期漫长,很可能砸了大钱,最后效果不尽如人意。所以很多团队会有动力走蒸馏捷径: 短期好看,省事省钱。但长期行业是没有实质进步的。
所以,从长期科研角度看,拒绝把蒸馏当做基座模型主力路线是对的。如果全行业都沉迷蒸馏捷径,大家都抄来抄去,确实会出现技术内卷,所有人都在做高仿,没人啃硬骨头。但是现实里,蒸馏本身又是非常实用的工程工具。大模型落地手机、端侧,几乎离不开蒸馏。区分场景很关键:做产品小模型可以蒸馏;做下一代基础基座,不能依赖蒸馏。字节内部限制的是后者,不是全盘废掉蒸馏技术。对企业内部工程师来说:蒸馏短期收益太高。蒸馏,几个星期就能出一个看起来效果不错的模型,可以写报告、出Demo。而原生预训练,耗费几个月,砸巨额算力,还可能失败。如果公司不做硬性限制,内部团队很容易优先选择捷径,所有都去做蒸馏,艰苦的原生模型研发就没人愿意碰。从公司管理角度,靠API检测+制度堵上这条捷径,逼迫团队去啃最难的活,逻辑说得通,但这条路风险巨大,代价很高。坚持原生基座路线,意味着要持续烧巨额资金,投入巨大,不一定就换来技术突破。可能砸了很多钱,出来的模型并没有达到预期效果。外面很多竞争对手会用蒸馏快速迭代,快速发布产品,短期看起来声势浩大。字节就要忍受短期节奏慢,承受业绩、舆论压力。蒸馏不等于抄袭作弊,它的原罪不是技术本身,而是拿蒸馏产物当做全新的基础大模型,对外宣称是全新原生研发。一个蒸馏得到的小模型,老老实实承认是基于某某基座蒸馏,做端侧产品,本身没有问题,问题是把二手模仿的模型包装成原生创新基座。一个现实矛盾是,现在互联网到处都是AI 生成的内容,网上已经充满AI生成文本,就算你做原生预训练,你搜集的原始数据里,也会混入大量AI产出的内容,变相带来类似蒸馏的污染。就算禁止内部蒸馏,外部世界的数据污染依然会客观存在。完全隔绝模仿、复制带来的负面影响,现实中很难做得到。所以,字节这套内部策略本质是一种取舍:牺牲短期快速出成果的捷径,强制团队走高成本、高风险,但有机会带来底层真正创新的原生预训练路线。但现实挑战重重,既要扛住巨额成本,又要对抗行业遍地AI生成数据的污染,还要平衡产品落地,不是简单靠几条内部规定就能完全解决的。
