Qwen 3.8 27B 昨天发布:编程能力暴涨217%,24GB显卡就能跑的新模型王

阿里Qwen3.8-27B发布,编程能力暴涨217%,Hacker News 903分。24GB显卡可本地部署,Apache 2.0完全开源。完整benchmark拆解+诚实评价。

昨天阿里发布了Qwen3.8-27B,HN评分飙到903。编程benchmark直接暴涨217%,但我建议你先看完注意事项再决定要不要上车。

先说结论

这是目前27B级别里编程和Agent能力最强的开源模型,没有之一。但所有数据都是厂商自测,等第三方验证再冲不迟。

一张表看懂升级了多少

对比对象是上一代Qwen3.6-27B,数据来自Qwen官方model card(2026-08-14发布)。

编程能力(核心战场)

BenchmarkQwen3.6-27BQwen3.8-27B提升幅度
DeepSWE 1.1(Agent编程)13.342.2+217%
QwenSWEBench(软件工程)49.379.0+60%
SWE-MM(多模态编程)25.738.6+50%
SWE-bench Pro53.561.7+15%
Terminal-Bench 2.1(终端编码)63.473.0+15%
NL2Repo-Bench(仓库生成)36.242.3+17%
LiveCodeBench v6(竞赛编程)83.990.3+8%

Agent和办公能力

BenchmarkQwen3.6-27BQwen3.8-27B提升幅度
OSWorld-Verified(桌面操控)63.984.3+32%
WebArena-Verified(浏览器操控)48.864.8+33%
CoWorkBench(长期办公任务)61.070.7+16%
AndroidWorld(手机操控)70.381.9+17%

最炸裂的是DeepSWE:从13.3到42.2,涨了整整三倍多

最值得关注的3个点

1. 编程能力不是小步快跑,是换了个台阶

DeepSWE +217%、QwenSWEBench +60%、SWE-MM +50%。

这三个benchmark覆盖的场景不同:Agent编程、软件工程、多模态代码。说明不是某个指标刷分,而是全面升级。

横向对比也猛:Qwen3.8-27B的编程分数超过了自家上一代旗舰Qwen3.7-Plus。

DeepSWE 14.2→42.2,SWE-bench Pro 57.6→61.7。

一个27B的小模型,编程能力碾压自家上一代Plus版本。

2. reasoning_effort:终于能控制"想多久"了

新增xhigh/medium/low三档推理深度。默认xhigh,简单任务设low可以省token和时间。

但官方文档里有一句话很重要:**在多轮Agent任务中,低推理深度不一定更快。**分析不够深入会导致重试增多,总耗时反而更高。

这个功能目前需要推理框架支持(vLLM、SGLang等),普通Chat Completions API也支持,但实际效果取决于你怎么调参。

3. 架构创新:64层里只有16层用全注意力

这是最技术性的变化,也可能是最深远的。

传统Transformer的每一层都用全注意力,计算量随序列长度平方增长。Qwen3.8用了一个混合架构:

48层Gated DeltaNet(线性注意力)处理大部分计算,只在关键位置插入16层全注意力恢复token间交互能力。

结果是KV cache更小,长序列处理更高效,理论上能处理更长的上下文而不爆显存。

原生上下文262K tokens,用YaRN扩展到1M。这个数字够用,但真正跑262K需要的显存远超24GB。

还能看什么:多模态和通用能力

Qwen3.8不只是编程强。它原生支持文本+图像+视频输入,是个视觉语言模型(VLM)。

场景BenchmarkQwen3.8-27B对比
科学推理GPQA Diamond89.2接近Opus4.6 Max的91.3
指令遵循IFBench79.5超过Opus4.6 Max(62.5)
文档理解OmniDocBench 1.591.1与Qwen3.7-Plus持平
视觉数学MathVision90.0超过Qwen3.7-Plus(90.3带CI)

指令遵循能力(IFBench 79.5)超过了Opus4.6 Max,说明模型对复杂指令的理解和执行更准确。

诚实提醒:5个需要注意的事

1. 所有数据都是厂商自测

目前没有任何第三方独立验证。官方benchmark的选择、评测条件、prompt设置都可能对自家模型有利。

HN上903分说明社区关注度高,但不等于认可度高——评论区也有人质疑benchmark选择。

2. 24GB显卡的现实限制

24GB显卡(如RTX 4090)确实能跑,但只能用4-bit量化+中等上下文长度。

跑不了的:BF16/FP8全精度、262K原生上下文。需要长时间对话或大文件处理的场景,4-bit量化的精度损失是实打实的。

3. “开源权重”≠“完全开源”

Apache 2.0许可证,权重完全开放,可以商用。但训练数据、训练代码、知识截止日期均未公开。

对比真正的开源项目(如PyTorch),Qwen的"开源"只是开放了推理部分。

4. Qwen Cloud还没上线

官方说"coming soon",但目前没有托管推理服务。想用API只能自部署或等第三方(如硅基流动、Together AI等)。

5. GGUF是第三方转换

官方只提供BF16和FP8权重。GGUF格式是unsloth等社区项目转换的,质量和兼容性由社区保证。

竞品对比:它站在什么位置

对比维度Qwen3.8-27BMuse Glimmer 30BGemma 4
定位编程+Agent多面手端侧Agent模型Google轻量模型
参数27.8B29.6B待确认
开源协议Apache 2.0Apache 2.0待确认
编程能力DeepSWE 42.2DeepSWE未测待确认
桌面操控OSWorld 84.3OSWorld 65.9待确认
浏览器操控WebArena 64.8未测待确认
本地部署24GB+4bit可跑24GB+4bit可跑待确认

Qwen3.8在编程和Agent能力上明显领先Muse Glimmer-30B。

OSWorld从65.9到84.3,WebArena从48.8到64.8,差距不小。

但Muse Glimmer的优势在端侧部署优化,两者定位不完全重叠。

和Claude/GPT等闭源API模型不直接竞争——一个本地跑,一个云端调用,成本结构完全不同。

基本参数速查

项目数据
发布日期2026-08-14
参数量27.8B
架构Dense causal VLM(文本+图像+视频)
解码器层64层(48层线性注意力 + 16层全注意力)
原生上下文262K tokens(YaRN可扩展到1M)
推理模式默认开启thinking,支持reasoning_effort三档控制
权重格式BF16 + FP8
开源协议Apache 2.0
支持框架Transformers, vLLM, SGLang, TokenSpeed
HuggingFaceQwen/Qwen3.8-27B

我的判断

Qwen3.8-27B是27B级别目前最强的编程和Agent模型,这点没什么争议。

但"最强"和"好用"之间隔着一层:benchmark是厂商自测、24GB显卡有实际限制、推理框架需要更新适配。

建议:等一两周,看社区实际测评和第三方benchmark结果。如果你正好需要一个本地编程助手,而且有24GB以上显卡,可以先试试4-bit量化版。

不急的话,等Qwen Cloud上线再体验全精度版本。