DC娱乐网

AI 大模型蒸馏是什么?蒸什么?怎么蒸? 模型蒸馏(Knowledge Dis

AI 大模型蒸馏是什么?蒸什么?怎么蒸?

模型蒸馏(Knowledge Distillation)可以理解成一种“知识迁移”方法:让 Student Model 学习 Teacher Model 提供的监督信号,而不是直接复制 Teacher 的模型权重。它最初的重要目标,是把复杂模型的部分能力迁移给更小、更容易部署的模型。

Student 能学到的东西并不只有最终答案。经典蒸馏可以学习 Teacher 的输出分布;Sequence-level KD 会学习 Teacher 生成的完整序列;到了 LLM 时代,一些方法还会把 Response、Rationale 或分步解释作为额外监督。与此同时,按照能访问 Teacher 的信息不同,还可以区分 White-box 和 Black-box 场景。

这也是为什么蒸馏在大模型时代重新受到关注:Teacher 能生成的监督信息更丰富,合成训练数据的生产、筛选和验证也越来越自动化。以 output-based 蒸馏为例,一条常见流程是准备任务,让 Teacher 生成 Response 或 Rationale,经过必要的数据质量处理,再用于 Student 训练和评估。

但蒸馏并不是“Teacher 越强,Student 就一定越强”。Student 自身容量、Teacher 与 Student 的 Capacity Gap、数据质量和训练方法都会影响最终效果。它可以用于模型压缩和能力迁移,却不能替代预训练、模型架构、数据和完整训练体系。

另外,如果 Teacher 来自外部商业服务,技术上能获取输出,不等于这些数据一定可以随意用于训练,仍需要单独确认数据权限、服务条款和使用边界。

一句话理解:模型蒸馏是一种把 Teacher 的知识信号转化为 Student 可学习监督的训练方法,而不是复制模型的捷径。

参考内容:
1️⃣Hinton et al.《Distilling the Knowledge in a Neural Network》(2015)
2️⃣Kim & Rush《Sequence-Level Knowledge Distillation》(2016)
3️⃣《Distilling Step-by-Step!》(2023)、MiniLLM(ICLR 2024)、MiniPLM(ICLR 2025)、ACL 2025 Capacity Gap 相关研究
4️⃣晚点LatePost《蒸馏风暴:AI 公司不愿公开谈论的技术竞赛》

模型蒸馏 Distillation LLM 大模型 模型训练 TeacherModel StudentModel SFT 合成数据