DC娱乐网

Qwen3.8 开源了,2.4 万亿参数,代码能力超 Qwen 发了 3.8 版

Qwen3.8 开源了,2.4 万亿参数,代码能力超
Qwen 发了 3.8 版本,这次是第一个开源的 Max 级别模型。

参数规模 2.4 万亿,但激活量是 95B(意思是推理时只用到这部分,不需要加载全部参数)。支持的上下文长度原生 26 万 token,可以扩展到 100 万。

我看了一下 benchmark 数据,几个关键测试集的成绩:
SWE-bench Pro(软件工程测试)67.7,Opus 4.8 是 69.2,GPT-5.6 Sol 是 64.6。
PaperBench(论文代码复现)93.0,Opus 4.8 是 80.3,GPT-5.6 Sol 是 90.5。
AndroidBench(安卓开发)75.1,Opus 4.8 是 69.8,GPT-5.6 Sol 是 74.0。

这几个数字意思是,在代码相关的任务上,Qwen3.8 要么跟 Opus 4.8 差不多,要么在某些场景下更强。GPT-5.6 Sol 在部分任务上略高,但 Qwen3.8 在 PaperBench 和 AndroidBench 上领先。

我去年用过 Qwen3.5,当时感觉是"能用,但跟 GPT-4 还有差距"。到 3.6 的时候明显进步了,代码补全和函数生成的准确率提高了不少,但在复杂的多文件重构任务上还是不如 Claude。这次 3.8 如果真的在 benchmark 上超过 Opus 4.8,那意味着它在实际使用中的表现应该能接近或达到商业闭源模型的水平。

关键是它开源。你可以下载权重自己部署,用 vLLM、SGLang 这些框架跑。不用担心 API 调用限制、不用交月费、不用把代码发到别人服务器上。

Agent 能力也提升了。官方说它在长周期任务(比如多步规划、根据环境反馈调整)的表现更好。我看了几个 Agent benchmark 的成绩,比如 CoWorkBench(协作任务)74.8,跟 Fable 5 的 75.9 很接近。Automation-Bench(自动化任务)27.3,跟 Opus 4.8 的 27.2 基本持平。

8 月 12 号放出来的,现在可以在 Hugging Face 上下载。如果你有足够的显存(或者用量化版本),可以试试。
Qwen38 开源AI 代码生成 大模型 AI编程 本地部署