DC娱乐网

Qwen3.8-27B就是新的模型斩杀线

身为开源社区开发者, 那些最擅长动手去进行模型折腾的, 通常也是最精于玩梗并创造概念的一类人。最近半年期间, 他们所喜爱
身为开源社区开发者, 那些最擅长动手去进行模型折腾的, 通常也是最精于玩梗并创造概念的一类人。最近半年期间, 他们所喜爱的一个概念乃是“斩杀线”。
这个词是从游戏那里借来的, 往后在更为广泛的场合当中变得愈发流行, 它原本所指的是血量下降到某个数字的下面, 对手下一回合就能够将你弄走, 这比赛实际上已经在了提前阶段完结了。
使其套于模型之上, 于过往一段时期人们所指的乃一直所充当着的角色: 当一个新的模型问世之后, 先是与比能力, 紧接着再去比价格。倘若性能未能提升上去、价格又没办法降下来, 那么在发布当日基本上就已然丧失了讨论的价值。
从 R1 开始, 一度成为模型世界默认的那条线。
但现在,这条线看起来要换人了。
8月14日, Qwen3.8 - 27B发布, 开源仅两天, 其下载量便突破百万, 于Face全球趋势榜上脱颖而出, 成功登顶,在编程Agent工具Cline的诸多开发者当中, 它仅花费四个日夜, 就成为了被选择次数频次最高的本地模型, 的Index给予其52分, 至此已稳稳踏入GPT - 5.6 Luna、V4 Flash这类档次模型所处的区间范围, 开发者们赋予它一个更为通俗易懂的外号:
“本地 Opus 4.6”。
当然, 这个模型是仍处于进化进程中的模型, 是一种综合方向上的趋近, 并非能直接等同于已将真实体验完全追平Opus 4.6的状态。在诸如-Bench、HLE这类高难度任务当中, Qwen3.8 - 27B依旧存在着差距。
再者, 于诸多评测当中, 它存有一个颇为显著的特性, 即格外擅于“思考”, 对待众多任务会产出远比同类模型数量更多的token, 借时间来换取能力, 在Simon进行实测时, 按照默认推理模式让它绘制一幅关于一只骑着自行车的鹈鹕的SVG图像, 它思索了21分钟。
不过这些都没有改变真正重要的地方:
它只有 270 亿参数。
这意味着, 几个月之前, 还需数百亿、数千亿乃至更大规模的模型, 才能够稳定达到的能力区间, 如今, 第一次被压进一个尺寸, 这个尺寸消费级硬件真正有可能容纳。
经过4-bit量化, 模型权重能够压缩至17GB左右, 一张24GB级的显卡已进入可部署它的范围;具备较大统一内存的Apple设备也能够运行。当然, 17GB的权重并不等同17GB内存就足够了, 真正运行时还需为KV Cache、上下文、视觉组件以及运行时预留空间, 长上下文对内存的消耗尤为显著。但实际上, 重要的边界已然跨越过去了。
以往, 本地模型的处境常常尴尬, 能运行的不够聪慧, 够聪慧的无法稳定在正常运行状态, Qwen3.8 - 27B 在具有实际应用价值的规模上首次让这两种情况同时出现。
于是从当下起始, 任何新近发布的, 并非仅是小尺寸的那种模型, 就连等之类的模型也涵盖其中, 都会被开发者拿去先问一个问题:
比 Qwen3.8-27B 怎么样?
过不了这一关,很难再有讨论的价值。这就是新的斩杀线。


由 定义的上一条斩杀线,最重要的武器其实是性价比。
旗舰模型所具备的能力, 在以Flash这个级别的价格予以售卖。开发者首次察觉到, 顶级的智能并不一定就意味着收费高昂的API。
然而,这套具备性价比的情况依旧是构建于云端之上的。模型是放置在数据中心那里的, 开发者依据 token 来购入使用权。其单价能够持续不断地下降, 只要 Agent 开始进行长时间的工作, token 的消耗依旧会持续地积累起来——一个 Agent 先是读取代码库内容, 接着修改代码, 然后运行测试, 之后再次进行修改, 一项任务产生几十万的 token 已经变得越来越平常了。在国内, 日均 token 的调用量已然攀升到了 140 万亿, 相较于 2024 年初增长幅度超过千倍。
且单价并非必然始终呈下降态势。八月中旬, 达成了自成立以来幅度最为显著的一轮价格提升, V4-Pro在高峰时段的输出价格由每百万token的6元调整为27元, 同时引入了峰谷计费方式, 智谱以及Kimi在此之前也已先后进行了价格调整。要是把线绘制在报价单之上, 那么就必定会随着报价单而移动。
那就是说, 以往两年之中模型公司所存在的竞争, 基本上围绕着这样一个问题展开: 在具备相同智能的情况下, 究竟哪家的token更为便宜? 然而Qwen3.8 - 27B将这个问题进一步深化了: 在同样拥有智能的状况下, 究竟需要规模多大的模型?
这是两类全然不一样的效率, 一个拥有千亿参数的模型便宜百分之三十, 然而仍然得待在数据中心里, 一个27B模型要是能够达成往昔千亿级模型方可完成的大多工作, 它所改换的是模型部署的物理边界。
在过去的半年时间里, 行业中被称作的所谓“斩杀线”, 依旧大致稳稳地锚定在千亿级别的模型之上, 甚至是规模更为庞大的模型之上。直至今日, 参数规模已然缩减到了270亿, 然而智能水平却出人意料地迈进了上一代千亿级旗舰模型所处于的区间范围。参数量减少的幅度接近一个数量级, 但是智能水平却并没有如同参数量那般跟着下降一个数量级。
模型竞争因此出现了一个越来越重要的指标:智能密度。
究竟每十亿参数能够容纳下多少的能力? 要达成同样的一件事情, 这究竟需要多少的显存? 又需要多少的内存带宽? 还需要什么样级别的机器? 这些过往在进行模型评测时扮演配角的问题, 现在正在逐步走向前台。
缘故也并非繁杂, 针对绝大部分真切任务来讲, 智能够为正渐渐自稀缺迈向过剩, 实际上我们现今大部分的真切人工智能任务, 真正的阻碍已然并非模型是否够聪慧, 而是这般聪慧的模型能否足够低廉、足够迅速、足够轻易地得以运行。
企业知识库用不着去处理 IMO, 会议纪要不需要运用世界最强的推理模型, 大量代码的修改、信息抽取以及后台 Agent 亦是这般情况。当模型能力抵达某个阈值之后, 再多出五分, 对于大量产品而言, 已不像前五十分那般关键;然而要是同样的能力从 200GB 显存降至 24GB, 产品形态会径直发生改变。
Qwen3.8-27B 斩掉了这道硬件门槛。
Qwen3.8 - 27B能力取得突破, 其背后的缘由, 可不是仅仅用简单的“模型越来越强”就能够概括表述的。
在过去的两年时间之中, 为了达成让大模型的成本变得更为低廉的目的, 行业里最为成功的一条技术路线乃是MoE, 也就是混合专家, 它所采用的办法是比较容易被理解的, 在模型里培育数量众多的“专家”, 在执行一次任务的时候, 仅仅召唤其中的一部分“专家”出来开展工作, 通过这种方式能够使得模型的总容量被打造得极为庞大, 与此同时对一次推理实际所需要的计算量进行有效的控制, 这条技术路线被推到了相当高的位置上。
可是, MoE存在着这样一个问题, 它在云端的时候不太明显, 然而到了个人设备上就会变得很麻烦, 那就是, 专家不工作并不意味着专家不存在。模型的总权重依旧是需要被存储的, 要么驻留在显存和内存之中, 要么在层级存储之间进行高效调度。稀疏激活能够大幅度降低每个token的计算量, 但是却不会使得一个拥有数千亿总参数的模型毫无缘由地缩减成20GB。
因而, MoE 格外契合数据中心, 几十张乃至几百张 GPU 一同承担一个庞大的模型, 接着运用稀疏激活去削减推理成本。到了 PC、机器人、汽车以及边缘设备那里, 另一件事情变得更为关键: 模型自身究竟能不能放置得下。
Qwen3.8 - 27B 属于一个稠密模型, 这表明它并不具备 MoE 所拥有的, 那种借助大量闲置专家来换取容量的空间, 故而其效率得从架构本身, 一点一点地去抠出来。
1. Qwen在这一代持续运用混合注意力结构, 2. 其中64层里有48层是线性注意力, 3. 其余部分保留传统全注意力。 线性注意力具有一个重要价值, 4. 即在长上下文运行时, 不需要如同纯那样, 让KV Cache随序列长度持续膨胀, 5. 保留部分全注意力层, 还能避免完全丧失模型回看细节以及复杂上下文的能力。6. 这属于典型的工程取舍, 是在能力、显存以及长上下文成本之间去寻找平衡。
MTP, 即Multi - Token, 解决了另外一个问题, 大模型一般是一个token接着一个token地向外输出, 本地推理极易因串行解码速度而受阻, MTP赋予模型一次预测多个未来token的能力, 借助此来提升生成吞吐, 在云端, 这或许仅仅是又一项优化举措, 在本地, 它却直接决定着一个模型到底是能够启动, 还是真的可以投入使用。
此外, 它具备原生视觉方面的能力, 这种能力使得相关的Qwen3.8 - 27B能够直接对图像以及视频进行处理。如此一来, 在诸多不同场景当中, 也就无需额外再外挂一套专有的具备视觉处理能力的模型了。
这几项技术, 单独拿出来, 都不属于那种突然冒出来的全新发明。真正棘手的在于, 要把它们同时放置到一个27B稠密模型当中, 而后还照样保持足够高的智能水平。
这件事情显然也不是 Qwen 到 3.8 才突然想明白的。
回顾 Qwen 过往三年所走过的路线, 就能够发觉 Qwen3.8~27B 并非是偶然间达成的命中结果。
2023年8月, 当Qwen那第一批开源模型发布之际, 彼时全世界的聚光灯尚聚焦于Llama之上。几个月过后, Qwen同时推出了72B以及1.8B。
这个细节, 在如今回头去看时, 显得颇为重要。Qwen从第一年起始, 小模型并非旗舰模型旁边顺手附带的那种经过缩水而成的版本, 它属于其开源路线的一部分。
达到 Qwen2 时, 参数尺寸进一步由 0.5B 一直延展到 72B;Qwen2.5 持续采用同样的方式;随后 QwQ - 32B 又以 32B 这个尺寸专门对标当时最热门的模型。这几年 Qwen 的产品线始终有着一个极为显著的特性: 尺寸极其完备。大模型、小模型, Dense、MoE, 通用、数学、视觉, 不断向同一套模型体系中纳入。
有这样一条路线, 在相当长的一段时期之内, 其并不显眼。在模型行业里, 最容易获取关注的一直都是那个最大的型号以及榜单排名第一的, 特别是在R1爆发之后, 开源模型的叙事差不多完全被接管了。Qwen所做的事情看起来没那么带有吸引力: 持续发布模型, 持续填充尺寸, 持续让开发者进行量化、微调以及魔改。
但今天这件事情开始产生复利。
Face针对今年的开源生态报告特别把Qwen单独拿出来予以讨论, Qwen已然产生了超出15万个清晰明确的衍生模型, 要是去计算所有带有Qwen标签的模型仓库的话, 数量是超过20万的;今年Qwen系列的下载量超过30亿次, 该下载量超过了 和Meta两者的总和。报告与此同时观察到了一个极为重要的趋势, 小模型的下载量以及实际部署量远比超大型模型要高。其原因十分简单, 绝大多数的开发者并没有一个数据中心。
这解释了 Qwen 为什么会走到今天这个位置。
长时间做小模型, 所积累的并非仅仅是“怎样将参数削减掉”。训练数据该如何配置, 哪种能力在缩模型后最易丢失, 教师模型与学生模型之间, 应当保留什么, 量化之后哪部分最为敏感, 长上下文要怎样降低内存消耗, 开发者手中最常见的硬件是什么, 这些细节需在一代一代模型实际发布以后, 依靠大量部署以及反馈磨合出来。
另一方面, 大模型持续负责朝着上边探究能力界限。Qwen 的大尺寸 MoE 以及小尺寸 Dense 并非是两条彼此毫无关联的产品线: 这一代的旗舰乃是 2.4T 参数的 MoE, 27B 与之共享同一套混合注意力骨架, 更大的模型承担探索能力、产出数据以及提供学习源头的职责, 经过验证的架构以及训练方法, 再逐步朝着更小尺寸转移——老师和学生生长在同一个架构当中。
所以今天回头看,Qwen 过去几年的技术路线其实很清楚:
大模型负责把智能做出来,小模型负责把智能压进去。
Qwen3.8 - 27B处于这两条路线头一回于极为显眼的一处位置实现汇聚的情况。它证实Qwen历经三年开展“全尺寸”工作, 并非只是为了在Face页面增添几个型号而已。其实际意图在于促使同一等级智能持续往更小的参数规模方向降低。
27B 只是目前最引人注目的那个落点。
Qwen3.8-27B打开的是一类过去一直卡在中间的产品。
机器人乃是最典型的示例, 如今诸多具身智能系统, 本体真正能够实现长期运行的依旧是相对较小的模型, 一旦遭遇复杂视觉理解、任务规划或者高难度判断, 便会将请求传至云端更大的模型, 缘由并非深奥: 在本地能够运行的不够聪慧, 足够聪慧的又过于庞大, AI PC、汽车、智能眼镜以及大量企业本地Agent, 本质上都面临同一问题, 此处所欠缺的向来是同一事物: 足够强大, 并且真正能够嵌入的模型。
说明问题的恰好正是硬件生态的反应, 在Qwen3.8 - 27B发布的当天, 针对它做了从RTX显卡开始, 经过DGX Spark, 直至边缘平台的全线适配, 机器人业务的官方账号特意专门发帖, 声称它已然为边缘做好了准备, 官方博客着重强调的卖点在于, 开发者能够让敏感代码以及专有数据留存于自身的设备之上, 芯片公司为了一个模型连夜铺设道路, 所赌的正是自身的硬件销量。
Qwen3.8-27B距离能够直接被塞进一副眼镜或者普通手机的程度还相差甚远, 24GB级显存当下也算不上是真正的大众设备, 然而产业里一个重要的边界已然向前有所移动了。
就在从前一代旗舰等级的智能开始从数据中心往下降, 一直降到一张消费显卡之时, “小模型”那属于它的春天正式来临了。
Qwen3.8 - 27B会成为新的一条斩杀线, 它首次将这条线显著地朝着设备方向挪动了一步, 往后判断一个模型有无价值时, 问题并非仅仅是它是否还能变得更聪明, 而是要看这一等级的智能, 究竟能够被压缩进多小的机器之中。
要知道, 当智能达到一定程度后,能够将其安置进更多设备的一方, 才具备更强的分发能力。而这, 恰恰是AI走进现实世界, 去解决实际问题的关键所在。