DC娱乐网

字节宁可用10万亿参数硬训,也不走这条省3倍钱的捷径。 别人都在蒸馏——把大模型

字节宁可用10万亿参数硬训,也不走这条省3倍钱的捷径。
别人都在蒸馏——把大模型的知识"压缩"到小模型里,又快又省,成本能砍掉三分之二。
字节偏不。
张一鸣这次的打法很轴:要训就训最原始的那个,不抄近路。
算笔账你就懂了。10万亿参数,等于把整个中文互联网读上几十遍,光训练电费可能就是天文数字。走蒸馏的话,钱能省下三倍。
它为什么不选省钱?
一种说法:字节要的不是"够用",是"底座不被任何人卡脖子"。豆包现在日活几千万,一旦底层依赖别人的模型,命脉就在别人手里。
另一种说法:它在赌下一个时代的入口——Agent。Agent要的是真本事,不是压缩过的二手能力。
你觉得这是战略定力,还是钱多烧的?