8月14日,阿里把 Qwen3.8-27B 权重开源了。Hugging Face 和 ModelScope 同步上线,Apache-2.0 协议,商用免费。
一句话总结:27B 密集模型,在 Coding、Agent、视觉三项全部刷新开源 SOTA,部分指标超过 Opus 4.6 Max。
5 个关键数据
1. SWE-bench Pro 61.7 分(Opus 4.6 Max 是 53.4)
2. DeepSWE 1.1 42.2 分(Qwen3.6-27B 只有 13.3)
3. OSWorld-Verified 计算机使用 84.3 分(Opus 4.6 Max 是 72.7)
4. 原生 262K 上下文,可外推 1M tokens
5. NVFP4 量化在 RTX 5090 上跑出 148 tok/s
核心亮点
- 架构升级:Gated DeltaNet + Gated Attention 混合,64 层只有 4 层 full attention,其余是线性注意力
- 原生 VLM:视觉编码不再拖累语言能力,BabyVision、CharXiv 全部 SOTA
- MTP 推测解码:NVFP4 量化 + llama.cpp,可消费级 GPU 跑 Agent
- API 支持 reasoning_effort:xhigh / medium / low 三档,可控成本
- preserve_thinking:多轮 Agent KV 缓存复用,吞吐翻倍
三步上手
第一步:下载权重
推荐 ModelScope,直接 pip install:
```bash
pip install modelscope
modelscope download --model Qwen/Qwen3.8-27B --local_dir models/qwen3.8-27b
```
也可以用 Hugging Face 镜像:
```bash
export HF_ENDPOINT=https://hf-mirror.com
hf auth login
hf download Qwen/Qwen3.8-27B --local-dir models/qwen3.8-27b
```
第二步:启动 vLLM 服务
```bash
pip install vllm
vllm serve Qwen/Qwen3.8-27B \
--port 8000 --tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice --tool-call-parser qwen3_coder
```
第三步:调用 OpenAI 兼容 API
```python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
resp = client.chat.completions.create(
model="Qwen/Qwen3.8-27B",
messages=[{"role": "user", "content": "写一个 Python 合并两个有序链表"}],
extra_body={"chat_template_kwargs": {"enable_thinking": True}},
reasoning_effort="xhigh",
)
print(resp.choices[0].message.content)
```
4 个使用注意
1. 不要无脑开 low reasoning:Agent 场景用 xhigh 或 medium,low 单轮快但容易返工
2. 1M context 需配 YaRN:改 `rope_parameters`,静态 YaRN 在短文本有精度损失
3. NVFP4 量化要最新 llama.cpp:build 10434+ 才支持
4. HLE 仍落后 Opus:极限综合推理还是闭源强
商用授权
Apache-2.0 协议,商用免费,只需保留版权声明。
适用场景
- 本地 Agent 产品后端
- 长上下文文档分析(支持原生 262K)
- 视觉理解 + 工具调用一体
- 代码 Agent(Coding SOTA)
阿里开源 Qwen3.8-27B:27B 干翻 Opus 4.6 Max
8月14日,阿里把 Qwen3.8-27B 权重开源了。Hugging Face 和 ModelScope 同步上线,A
阅读:0
点赞:0