MiMo v2.5-Pro长测30天:小米推理模型的真实能力边界

全量使用MiMo v2.5-Pro 30天,覆盖写作、调研、代码、运维等场景。Agent能力全球开源第一不假,但通识推理短板和多源幻觉问题必须诚实说。

先说结论

用了30天,我的判断是:MiMo v2.5-Pro 是目前性价比最高的 Agent 模型,但不是万能模型。

Agent 能力全球开源第一、Token 效率比竞品省 40-60%、缓存命中价低到 ¥0.025/百万 token——这些数据都是真的。但通识推理比 DeepSeek 差 20 分、多源信息合成时会编造不存在的产品、缓存命中率远达不到官方声称的 89%——这些坑也是真的。

30天下来,我总结出一个选型原则:Agent/自动化场景优先考虑 MiMo,知识密集型任务换别的模型。

我的使用场景

过去30天,我把 MiMo v2.5-Pro 接入了日常工作流的全部环节:

  • 每日内容选题、写稿、审校
  • 技术调研和竞品分析
  • Python/Shell/JavaScript 代码生成与调试
  • 运维自动化(定时任务编排、部署流水线)
  • 知识库管理和记忆检索

日均消耗约 50-80 万 token,30天累计超过 1500 万 token。不是跑 benchmark,是真刀真枪干活。

模型基本面

先摆参数,后面所有结论都基于这个基础:

项目MiMo-V2.5-Pro
厂商小米 Core AI 团队
发布2026年4月27日
架构MoE,1.02T 总参 / 42B 激活
上下文1M tokens
最大输出128K tokens
开源MIT

架构上是典型的 MoE(混合专家),总参数万亿级但每次推理只激活 42B,这就是它便宜的原因之一。

四款国产模型横评

30天里我同时用过 DeepSeek V4-Pro、Kimi K2.6 和 GLM-5.1,直接上对比表:

维度MiMo V2.5-ProDeepSeek V4-ProKimi K2.6GLM-5.1
Agent 能力1581 (GDPVal-AA)
SWE-bench Pro57.2%58.6%58.4%
MMLU-Pro68.5%87.5%
输入价/百万token¥3¥12(限时¥3)~¥10
缓存命中价¥0.025¥1.2
上下文窗口1M1M128K202K
Token 效率最优次优比 MiMo 多 85%比 MiMo 多 20%

一句话总结:MiMo 在 Agent 场景碾压,但在 MMLU-Pro 这类通识考试上被 DeepSeek 和 Qwen 拉开 20 分差距。

30天验证的6个真实优势

1. Token 效率是真的省

这是最直观的感受。做同样的任务,MiMo 的 Token 消耗比 Claude Sonnet 少 40-60%。VentureBeat、dayahimour.org、Superculture 三个独立来源都确认了这个数字。

体现在账单上更明显——缓存命中价 ¥0.025/百万 token,比 DeepSeek 的 ¥1.2 便宜 48 倍。一个月下来,我的 API 账单大概只有之前用 DeepSeek 的 1/3。

2. 代码能力扎实

Python、Shell、JavaScript 的代码生成都很可靠。工具调用错误率低(平均 2.82%),结构化输出基本能用。

日常的运维脚本、数据处理脚本、API 对接代码,MiMo 生成的质量和 DeepSeek 差不多,但 Token 消耗少很多。这是它性价比高的核心原因。

3. 中文表达自然

这一点比 Claude 和 GPT 都好。MiMo 生成的中文没有那种翻译腔,用词和句式都比较地道。写公众号文章时 AI 味明显更低,审校时需要改的地方更少。

4. 1M 上下文是真能用

不是所有标 1M 的模型都能真的处理 100 万 token。MiMo 的长上下文在实际使用中表现稳定,我在处理长文档和多轮对话时没有遇到上下文丢失的问题。

5. 推理稳定

复杂任务规划、多步骤决策、条件分支判断——这些场景下 MiMo 的表现很一致,不会出现"上一步还行下一步就飞了"的情况。

6. 生态适配广

OpenRouter 上 MiMo 的流量排名靠前,DeepInfra、Xiaomi 直连、AtlasCloud 等多个提供商都有部署。选提供商时有冗余,不会被单一节点卡死。

30天踩过的5个坑(必须诚实说)

坑1:多源信息合成会幻觉(最严重)

这是 30 天里最惊悚的一次。我在做选题推荐时,让模型同时处理 HN、V2EX、Product Hunt、HuggingFace、arXiv、Dev.to 六个平台的热门数据。

输出 5 个推荐选题,其中 4 个存在幻觉:

  • 编造了一个不存在的模型"Meta Muse Glimmer 30B"
  • 编造了具体的数字"HN score 1023"
  • 编造了根本不存在的产品名称

根因:大量异构数据同时输入时,模型容易把不同来源的信息混搭,生成看似合理但完全虚构的内容。

教训:凡是涉及"从多个来源汇总信息"的任务,必须逐条验证。不能信任模型给出的具体数字和产品名。

坑2:通识推理是明显短板

MMLU-Pro 只有 68.5%,DeepSeek V4-Pro 是 87.5%,差了将近 20 分。GPQA-Diamond 也类似,MiMo 66.7% vs Qwen3.5-Plus 88.4%。

实际体感:问一些需要广泛知识储备的问题(比如解释某个物理概念、分析某个历史事件),MiMo 的回答深度明显不如 DeepSeek。它更像一个"做事的模型"而不是"博学的模型"。

坑3:长任务偶尔中断

社区评测里提到的"长时间任务生成中断",我自己也遇到过。特别是在处理大量文件或复杂编排任务时,偶尔会突然中断输出。

不是每次都发生,但概率不低。对于需要持续运行的自动化任务,这是个风险点,需要做好重试和断点续传的逻辑。

坑4:缓存命中率名不副实

官方声称缓存命中率约 89%,TRAE 社区实测约 40%,我的使用体验也差不多。

这意味着实际账单会比理论计算高不少。如果按 89% 命中率算成本,实际可能只有一半多的请求命中缓存,成本直接翻倍。定价虽然便宜,但不要按最理想情况做预算。

坑5:Pro 版不支持多模态

MiMo-V2.5-Pro 是纯文本模型。需要理解图片、音频、视频时,必须切换到 V2.5 基础版。

这在实际使用中是个麻烦。比如让我分析一张截图里的数据,Pro 版直接报错,得手动切模型。如果你的工作流涉及多模态输入,要提前规划好模型切换策略。

定价:真正的价格屠夫

模型输入/百万token输出/百万token缓存命中
MiMo V2.5-Pro¥3¥6¥0.025
DeepSeek V4-Pro¥12(限时¥3)¥24(限时¥6)¥1.2
GLM-5.1~¥10~¥32

缓存命中价 ¥0.025/百万 token,降幅 99%。

小米的降价逻辑来自推理系统优化:基于 SGLang HiCache,KV Cache 在 GPU/CPU/SSD 多级存储间的传输量降到优化前的 1/7,可缓存 Token 数提高到 5 倍。

到底该不该用?

30天下来,我的选型逻辑变成了这样:

场景推荐模型理由
Agent / 自动化任务MiMo V2.5-ProAgent 能力开源第一,Token 效率最优
代码生成 / 脚本MiMo V2.5-Pro可靠且便宜
通识推理 / 科学问答DeepSeek V4-Pro 或 Qwen3.5MMLU-Pro 差距 20+ 分
中文内容创作MiMo V2.5-Pro中文表达自然,AI 味低
多模态理解Qwen3.5-Plus 或 MiMo V2.5Pro 版不支持
预算敏感DeepSeek V4-Pro(限时折扣)折扣期间性价比也不错

一句话:如果你的场景是 Agent 自动化和代码生成,MiMo V2.5-Pro 的性价比目前很难被超越。但通识推理的短板是真实存在的,不适合所有场景。

30天长测最大的收获是搞清楚了它适合做什么、不适合做什么。模型选型的关键是匹配你的具体场景。


备选标题(供公众号选用):

  1. 用了30天小米推理模型,这些坑官方文档不会告诉你
  2. MiMo v2.5-Pro 长测30天:Agent 能力确实强,但这几个问题必须说
  3. 小米推理模型到底行不行?30天高强度实测给你答案