模型融合怪,Vasko把LFM2.5-2.6B和Qwen3.6-35B-A3B两个模型融合到了一起,得到了fuse-1 Lite,模型参数2.7B,性能却和Qwen3.6-35B-A3B类似(但只是写代码方面的性能)地址:huggingface.co/Akahsizrr/fuse-1-Lite
融合过程大致是这样的:它以 LFM2.5-2.6B 作为主体模型,保留原本的理解和生成能力,再从 Qwen3.6-35B-A3B 中取出部分擅长编程的“专家模块”,接到 LFM2.5 的每一层后面;当模型处理某个词时,一个新训练的“路由器”会判断是否需要代码能力,并从这些专家中挑选少数几个参与计算,结果再加回 LFM2.5 的输出。
作者说他还在用这种方式搞-minimax m3 和 deepseek v4 flash ,也许可以期待一下。
