分词器就是把文字切成模型能吃的小块,各家切法不同。过去做在线蒸馏,师生基本得同一系列,选择面很窄。
SimpleOPD的思路是绕开token对齐:在两边共有的文本片段上对齐,再用学生自己的初始策略做正则约束。
目标是让长上下文推理里的证明行为跨过分词器边界传给学生。论文出自上海人工智能实验室的SU-01团队。
手里没有同家族老师模型的团队,值得看看这个思路。但要清楚,迁移的是推理时的行为习惯,不等于把老师的能力整个搬过来。
推文只给了方法和链接,没有实验数字,想用还得自己翻论文核对基线。
#人工智能 #大模型 #AI #论文工具分享 #深度学习

