上周四阿里悄悄开源了一个模型,没搞发布会,没写博客,直接把权重扔到了HuggingFace。结果HN冲到1061分,HF两天拿到9292个赞。
核心冲突点在于:这个27B参数的小模型,在编程benchmark上把自家更大的Qwen3.7-Plus按在地上摩擦。小模型打大模型,不是偶尔赢一两个指标,是全面碾压。
一句话定位:这是目前最强的27B开源模型,专为编程和Agent场景设计。
架构创新:64层里塞了48层线性注意力
Qwen3.8-27B最核心的变化不是参数量,而是架构。
传统Transformer每一层都用全注意力(Full Attention),计算量随序列长度平方增长——O(n²)。序列越长,显存和计算开销越大。
Qwen3.8用了混合架构:64层中48层是Gated DeltaNet线性注意力,只有16层保留全注意力。线性注意力的计算复杂度是O(n),长序列下效率远高于传统方案。
为什么这样设计?因为大部分token之间的关系其实不需要O(n²)的计算量来捕获。线性注意力处理局部和短期依赖,全注意力在关键位置恢复全局交互能力。两者配合,既保证了模型能力,又大幅降低了长序列的计算开销。
结果是:KV cache更小,长序列处理更高效,27B参数能塞进16GB显存。原生支持262K tokens上下文,用YaRN可外推到1M。
此外,Qwen3.8-27B是原生多模态模型,支持文本、图像、视频输入。不是在语言模型上套个视觉编码器那种拼凑方案,而是从架构层面就设计了多模态支持。
编程能力暴涨:小模型打大模型
这是Qwen3.8-27B最炸裂的部分。
先看编程核心benchmark(数据来自Qwen官方model card,2026-08-14发布):
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus |
|---|---|---|---|
| TerminalBench 2.1 | 73.0 | 63.4 | 64.0 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 |
| LiveCodeBench v6 | 90.3 | 83.9 | - |
| QwenSWEBench | 79.0 | 49.3 | - |
TerminalBench从63.4到73.0,提升15%;SWE-bench Pro从53.5到61.7,同样提升15%。
但真正的重头戏是DeepSWE 1.1:从Qwen3.6-27B的13.3直接飙到42.2,提升217%。DeepSWE测的是Agent编程能力——模型自主读代码、改代码、提交PR的全流程。三倍多的涨幅说明Qwen3.8在工具调用和代码理解上做了根本性改进。
关键对比:Qwen3.8-27B的编程分数全面超越了自家上一代旗舰Qwen3.7-Plus。
一个27B的小模型,编程能力比Plus版本还强。这不是小步快跑,是换了个台阶。
多模态编程:超越Claude Opus
Qwen3.8-27B不只是文本编程强。作为原生多模态模型,它在看图写代码这个场景上也拿出了惊人成绩。
SWE-MM(多模态编程benchmark):
| 模型 | SWE-MM分数 |
|---|---|
| Qwen3.8-27B | 38.6 |
| Qwen3.7-Plus | 30.0 |
| Claude Opus 4.6 Max | 27.1 |
38.6 vs 27.1,Qwen3.8-27B在多模态编程上超越了Claude Opus 4.6 Max。
SWE-MM的测试方式是给模型看截图、UI设计稿、错误日志截图等视觉信息,让模型基于这些视觉输入写代码或修复bug。这个场景在实际开发中非常常见——产品经理扔个截图过来,你得看懂然后写代码实现。
一个27B的开源模型,在这个任务上打赢了闭源顶级模型。意义不言自明。
16GB显卡可跑:消费级硬件的本地部署
Qwen3.8-27B的参数量是27.8B(Dense架构),官方提供BF16和FP8两种权重格式。
本地部署的现实情况:
| 部署方式 | 显存需求 | 可用显卡 |
|---|---|---|
| FP8全精度 | ~28GB | RTX 4090、A100 |
| 4-bit量化(GGUF) | ~16GB | RTX 4060 Ti 16GB、RTX 4070 |
| CPU推理(GGUF) | 内存32GB+ | 任何机器,速度慢 |
16GB显卡跑4-bit量化版,是目前最现实的本地部署方案。社区已经完成了GGUF转换(unsloth等项目),Ollama也已适配。
262K的原生上下文很诱人,但要注意:跑满262K需要的显存远超16GB。4-bit量化+中等上下文(32K-64K)是消费级硬件的实际上限。
推理框架方面,vLLM、SGLang已支持,社区反馈推理速度比上一代有明显提升,得益于线性注意力带来的KV cache优化。
本周第三个重磅开源模型
Qwen3.8-27B不是孤立事件。本周(8月10-14日)是开源模型的爆发周:
| 日期 | 模型 | 参数量 | 亮点 |
|---|---|---|---|
| 8月10日 | Meta Muse Glimmer 30B | 29.6B | 端侧Agent模型,Apache 2.0 |
| 8月13日 | NVIDIA Nemotron 3.5 Lightning | - | 推理加速,消费级优化 |
| 8月14日 | Qwen3.8-27B | 27.8B | 编程能力暴涨,混合注意力架构 |
三个模型都瞄准27-30B参数区间,都走Apache 2.0完全开源,都在消费级硬件上做优化。
趋势很明显:27-30B正在成为开源模型的甜点区。 够大,能力不弱;够小,消费级显卡能跑。这个区间直接对标的是本地部署市场——不想把代码和数据交给云端API的开发者和企业。
结论
Qwen3.8-27B重新定义了27B开源模型的能力上限。混合线性注意力架构是真正的技术创新,不是换个数据集训一遍就叫"新一代"。
实操建议:如果你有16GB以上显卡,值得试试4-bit量化版本。编程助手、代码review、Agent任务,这三个场景Qwen3.8-27B目前在同级别没有对手。
所有数据来自Qwen官方model card,第三方独立验证尚未完成。建议关注后续社区测评结果。
作者:varkm