昨天阿里发布了Qwen3.8-27B,HN评分飙到903。编程benchmark直接暴涨217%,但我建议你先看完注意事项再决定要不要上车。
先说结论
这是目前27B级别里编程和Agent能力最强的开源模型,没有之一。但所有数据都是厂商自测,等第三方验证再冲不迟。
一张表看懂升级了多少
对比对象是上一代Qwen3.6-27B,数据来自Qwen官方model card(2026-08-14发布)。
编程能力(核心战场)
| Benchmark | Qwen3.6-27B | Qwen3.8-27B | 提升幅度 |
|---|---|---|---|
| DeepSWE 1.1(Agent编程) | 13.3 | 42.2 | +217% |
| QwenSWEBench(软件工程) | 49.3 | 79.0 | +60% |
| SWE-MM(多模态编程) | 25.7 | 38.6 | +50% |
| SWE-bench Pro | 53.5 | 61.7 | +15% |
| Terminal-Bench 2.1(终端编码) | 63.4 | 73.0 | +15% |
| NL2Repo-Bench(仓库生成) | 36.2 | 42.3 | +17% |
| LiveCodeBench v6(竞赛编程) | 83.9 | 90.3 | +8% |
Agent和办公能力
| Benchmark | Qwen3.6-27B | Qwen3.8-27B | 提升幅度 |
|---|---|---|---|
| OSWorld-Verified(桌面操控) | 63.9 | 84.3 | +32% |
| WebArena-Verified(浏览器操控) | 48.8 | 64.8 | +33% |
| CoWorkBench(长期办公任务) | 61.0 | 70.7 | +16% |
| AndroidWorld(手机操控) | 70.3 | 81.9 | +17% |
最炸裂的是DeepSWE:从13.3到42.2,涨了整整三倍多。
最值得关注的3个点
1. 编程能力不是小步快跑,是换了个台阶
DeepSWE +217%、QwenSWEBench +60%、SWE-MM +50%。
这三个benchmark覆盖的场景不同:Agent编程、软件工程、多模态代码。说明不是某个指标刷分,而是全面升级。
横向对比也猛:Qwen3.8-27B的编程分数超过了自家上一代旗舰Qwen3.7-Plus。
DeepSWE 14.2→42.2,SWE-bench Pro 57.6→61.7。
一个27B的小模型,编程能力碾压自家上一代Plus版本。
2. reasoning_effort:终于能控制"想多久"了
新增xhigh/medium/low三档推理深度。默认xhigh,简单任务设low可以省token和时间。
但官方文档里有一句话很重要:**在多轮Agent任务中,低推理深度不一定更快。**分析不够深入会导致重试增多,总耗时反而更高。
这个功能目前需要推理框架支持(vLLM、SGLang等),普通Chat Completions API也支持,但实际效果取决于你怎么调参。
3. 架构创新:64层里只有16层用全注意力
这是最技术性的变化,也可能是最深远的。
传统Transformer的每一层都用全注意力,计算量随序列长度平方增长。Qwen3.8用了一个混合架构:
48层Gated DeltaNet(线性注意力)处理大部分计算,只在关键位置插入16层全注意力恢复token间交互能力。
结果是KV cache更小,长序列处理更高效,理论上能处理更长的上下文而不爆显存。
原生上下文262K tokens,用YaRN扩展到1M。这个数字够用,但真正跑262K需要的显存远超24GB。
还能看什么:多模态和通用能力
Qwen3.8不只是编程强。它原生支持文本+图像+视频输入,是个视觉语言模型(VLM)。
| 场景 | Benchmark | Qwen3.8-27B | 对比 |
|---|---|---|---|
| 科学推理 | GPQA Diamond | 89.2 | 接近Opus4.6 Max的91.3 |
| 指令遵循 | IFBench | 79.5 | 超过Opus4.6 Max(62.5) |
| 文档理解 | OmniDocBench 1.5 | 91.1 | 与Qwen3.7-Plus持平 |
| 视觉数学 | MathVision | 90.0 | 超过Qwen3.7-Plus(90.3带CI) |
指令遵循能力(IFBench 79.5)超过了Opus4.6 Max,说明模型对复杂指令的理解和执行更准确。
诚实提醒:5个需要注意的事
1. 所有数据都是厂商自测
目前没有任何第三方独立验证。官方benchmark的选择、评测条件、prompt设置都可能对自家模型有利。
HN上903分说明社区关注度高,但不等于认可度高——评论区也有人质疑benchmark选择。
2. 24GB显卡的现实限制
24GB显卡(如RTX 4090)确实能跑,但只能用4-bit量化+中等上下文长度。
跑不了的:BF16/FP8全精度、262K原生上下文。需要长时间对话或大文件处理的场景,4-bit量化的精度损失是实打实的。
3. “开源权重”≠“完全开源”
Apache 2.0许可证,权重完全开放,可以商用。但训练数据、训练代码、知识截止日期均未公开。
对比真正的开源项目(如PyTorch),Qwen的"开源"只是开放了推理部分。
4. Qwen Cloud还没上线
官方说"coming soon",但目前没有托管推理服务。想用API只能自部署或等第三方(如硅基流动、Together AI等)。
5. GGUF是第三方转换
官方只提供BF16和FP8权重。GGUF格式是unsloth等社区项目转换的,质量和兼容性由社区保证。
竞品对比:它站在什么位置
| 对比维度 | Qwen3.8-27B | Muse Glimmer 30B | Gemma 4 |
|---|---|---|---|
| 定位 | 编程+Agent多面手 | 端侧Agent模型 | Google轻量模型 |
| 参数 | 27.8B | 29.6B | 待确认 |
| 开源协议 | Apache 2.0 | Apache 2.0 | 待确认 |
| 编程能力 | DeepSWE 42.2 | DeepSWE未测 | 待确认 |
| 桌面操控 | OSWorld 84.3 | OSWorld 65.9 | 待确认 |
| 浏览器操控 | WebArena 64.8 | 未测 | 待确认 |
| 本地部署 | 24GB+4bit可跑 | 24GB+4bit可跑 | 待确认 |
Qwen3.8在编程和Agent能力上明显领先Muse Glimmer-30B。
OSWorld从65.9到84.3,WebArena从48.8到64.8,差距不小。
但Muse Glimmer的优势在端侧部署优化,两者定位不完全重叠。
和Claude/GPT等闭源API模型不直接竞争——一个本地跑,一个云端调用,成本结构完全不同。
基本参数速查
| 项目 | 数据 |
|---|---|
| 发布日期 | 2026-08-14 |
| 参数量 | 27.8B |
| 架构 | Dense causal VLM(文本+图像+视频) |
| 解码器层 | 64层(48层线性注意力 + 16层全注意力) |
| 原生上下文 | 262K tokens(YaRN可扩展到1M) |
| 推理模式 | 默认开启thinking,支持reasoning_effort三档控制 |
| 权重格式 | BF16 + FP8 |
| 开源协议 | Apache 2.0 |
| 支持框架 | Transformers, vLLM, SGLang, TokenSpeed |
| HuggingFace | Qwen/Qwen3.8-27B |
我的判断
Qwen3.8-27B是27B级别目前最强的编程和Agent模型,这点没什么争议。
但"最强"和"好用"之间隔着一层:benchmark是厂商自测、24GB显卡有实际限制、推理框架需要更新适配。
建议:等一两周,看社区实际测评和第三方benchmark结果。如果你正好需要一个本地编程助手,而且有24GB以上显卡,可以先试试4-bit量化版。
不急的话,等Qwen Cloud上线再体验全精度版本。