27B模型编程能力碾压自家Plus:Qwen3.8悄悄开源了一个怪东西

阿里Qwen3.8-27B发布,27B参数在编程benchmark上超越自家更大Plus模型。混合线性注意力架构创新,16GB显卡可跑,Apache 2.0完全开源。

上周四阿里悄悄开源了一个模型,没搞发布会,没写博客,直接把权重扔到了HuggingFace。结果HN冲到1061分,HF两天拿到9292个赞。

核心冲突点在于:这个27B参数的小模型,在编程benchmark上把自家更大的Qwen3.7-Plus按在地上摩擦。小模型打大模型,不是偶尔赢一两个指标,是全面碾压。

一句话定位:这是目前最强的27B开源模型,专为编程和Agent场景设计。

架构创新:64层里塞了48层线性注意力

Qwen3.8-27B最核心的变化不是参数量,而是架构。

传统Transformer每一层都用全注意力(Full Attention),计算量随序列长度平方增长——O(n²)。序列越长,显存和计算开销越大。

Qwen3.8用了混合架构:64层中48层是Gated DeltaNet线性注意力,只有16层保留全注意力。线性注意力的计算复杂度是O(n),长序列下效率远高于传统方案。

为什么这样设计?因为大部分token之间的关系其实不需要O(n²)的计算量来捕获。线性注意力处理局部和短期依赖,全注意力在关键位置恢复全局交互能力。两者配合,既保证了模型能力,又大幅降低了长序列的计算开销。

结果是:KV cache更小,长序列处理更高效,27B参数能塞进16GB显存。原生支持262K tokens上下文,用YaRN可外推到1M。

此外,Qwen3.8-27B是原生多模态模型,支持文本、图像、视频输入。不是在语言模型上套个视觉编码器那种拼凑方案,而是从架构层面就设计了多模态支持。

编程能力暴涨:小模型打大模型

这是Qwen3.8-27B最炸裂的部分。

先看编程核心benchmark(数据来自Qwen官方model card,2026-08-14发布):

BenchmarkQwen3.8-27BQwen3.6-27BQwen3.7-Plus
TerminalBench 2.173.063.464.0
SWE-bench Pro61.753.557.6
LiveCodeBench v690.383.9-
QwenSWEBench79.049.3-

TerminalBench从63.4到73.0,提升15%;SWE-bench Pro从53.5到61.7,同样提升15%。

但真正的重头戏是DeepSWE 1.1:从Qwen3.6-27B的13.3直接飙到42.2,提升217%。DeepSWE测的是Agent编程能力——模型自主读代码、改代码、提交PR的全流程。三倍多的涨幅说明Qwen3.8在工具调用和代码理解上做了根本性改进。

关键对比:Qwen3.8-27B的编程分数全面超越了自家上一代旗舰Qwen3.7-Plus。

一个27B的小模型,编程能力比Plus版本还强。这不是小步快跑,是换了个台阶。

多模态编程:超越Claude Opus

Qwen3.8-27B不只是文本编程强。作为原生多模态模型,它在看图写代码这个场景上也拿出了惊人成绩。

SWE-MM(多模态编程benchmark):

模型SWE-MM分数
Qwen3.8-27B38.6
Qwen3.7-Plus30.0
Claude Opus 4.6 Max27.1

38.6 vs 27.1,Qwen3.8-27B在多模态编程上超越了Claude Opus 4.6 Max

SWE-MM的测试方式是给模型看截图、UI设计稿、错误日志截图等视觉信息,让模型基于这些视觉输入写代码或修复bug。这个场景在实际开发中非常常见——产品经理扔个截图过来,你得看懂然后写代码实现。

一个27B的开源模型,在这个任务上打赢了闭源顶级模型。意义不言自明。

16GB显卡可跑:消费级硬件的本地部署

Qwen3.8-27B的参数量是27.8B(Dense架构),官方提供BF16和FP8两种权重格式。

本地部署的现实情况:

部署方式显存需求可用显卡
FP8全精度~28GBRTX 4090、A100
4-bit量化(GGUF)~16GBRTX 4060 Ti 16GB、RTX 4070
CPU推理(GGUF)内存32GB+任何机器,速度慢

16GB显卡跑4-bit量化版,是目前最现实的本地部署方案。社区已经完成了GGUF转换(unsloth等项目),Ollama也已适配。

262K的原生上下文很诱人,但要注意:跑满262K需要的显存远超16GB。4-bit量化+中等上下文(32K-64K)是消费级硬件的实际上限。

推理框架方面,vLLM、SGLang已支持,社区反馈推理速度比上一代有明显提升,得益于线性注意力带来的KV cache优化。

本周第三个重磅开源模型

Qwen3.8-27B不是孤立事件。本周(8月10-14日)是开源模型的爆发周:

日期模型参数量亮点
8月10日Meta Muse Glimmer 30B29.6B端侧Agent模型,Apache 2.0
8月13日NVIDIA Nemotron 3.5 Lightning-推理加速,消费级优化
8月14日Qwen3.8-27B27.8B编程能力暴涨,混合注意力架构

三个模型都瞄准27-30B参数区间,都走Apache 2.0完全开源,都在消费级硬件上做优化。

趋势很明显:27-30B正在成为开源模型的甜点区。 够大,能力不弱;够小,消费级显卡能跑。这个区间直接对标的是本地部署市场——不想把代码和数据交给云端API的开发者和企业。

结论

Qwen3.8-27B重新定义了27B开源模型的能力上限。混合线性注意力架构是真正的技术创新,不是换个数据集训一遍就叫"新一代"。

实操建议:如果你有16GB以上显卡,值得试试4-bit量化版本。编程助手、代码review、Agent任务,这三个场景Qwen3.8-27B目前在同级别没有对手。

所有数据来自Qwen官方model card,第三方独立验证尚未完成。建议关注后续社区测评结果。

作者:varkm