先说结论
用了30天,我的判断是:MiMo v2.5-Pro 是目前性价比最高的 Agent 模型,但不是万能模型。
Agent 能力全球开源第一、Token 效率比竞品省 40-60%、缓存命中价低到 ¥0.025/百万 token——这些数据都是真的。但通识推理比 DeepSeek 差 20 分、多源信息合成时会编造不存在的产品、缓存命中率远达不到官方声称的 89%——这些坑也是真的。
30天下来,我总结出一个选型原则:Agent/自动化场景优先考虑 MiMo,知识密集型任务换别的模型。
我的使用场景
过去30天,我把 MiMo v2.5-Pro 接入了日常工作流的全部环节:
- 每日内容选题、写稿、审校
- 技术调研和竞品分析
- Python/Shell/JavaScript 代码生成与调试
- 运维自动化(定时任务编排、部署流水线)
- 知识库管理和记忆检索
日均消耗约 50-80 万 token,30天累计超过 1500 万 token。不是跑 benchmark,是真刀真枪干活。
模型基本面
先摆参数,后面所有结论都基于这个基础:
| 项目 | MiMo-V2.5-Pro |
|---|---|
| 厂商 | 小米 Core AI 团队 |
| 发布 | 2026年4月27日 |
| 架构 | MoE,1.02T 总参 / 42B 激活 |
| 上下文 | 1M tokens |
| 最大输出 | 128K tokens |
| 开源 | MIT |
架构上是典型的 MoE(混合专家),总参数万亿级但每次推理只激活 42B,这就是它便宜的原因之一。
四款国产模型横评
30天里我同时用过 DeepSeek V4-Pro、Kimi K2.6 和 GLM-5.1,直接上对比表:
| 维度 | MiMo V2.5-Pro | DeepSeek V4-Pro | Kimi K2.6 | GLM-5.1 |
|---|---|---|---|---|
| Agent 能力 | 1581 (GDPVal-AA) | — | — | — |
| SWE-bench Pro | 57.2% | — | 58.6% | 58.4% |
| MMLU-Pro | 68.5% | 87.5% | — | — |
| 输入价/百万token | ¥3 | ¥12(限时¥3) | — | ~¥10 |
| 缓存命中价 | ¥0.025 | ¥1.2 | — | — |
| 上下文窗口 | 1M | 1M | 128K | 202K |
| Token 效率 | 最优 | 次优 | 比 MiMo 多 85% | 比 MiMo 多 20% |
一句话总结:MiMo 在 Agent 场景碾压,但在 MMLU-Pro 这类通识考试上被 DeepSeek 和 Qwen 拉开 20 分差距。
30天验证的6个真实优势
1. Token 效率是真的省
这是最直观的感受。做同样的任务,MiMo 的 Token 消耗比 Claude Sonnet 少 40-60%。VentureBeat、dayahimour.org、Superculture 三个独立来源都确认了这个数字。
体现在账单上更明显——缓存命中价 ¥0.025/百万 token,比 DeepSeek 的 ¥1.2 便宜 48 倍。一个月下来,我的 API 账单大概只有之前用 DeepSeek 的 1/3。
2. 代码能力扎实
Python、Shell、JavaScript 的代码生成都很可靠。工具调用错误率低(平均 2.82%),结构化输出基本能用。
日常的运维脚本、数据处理脚本、API 对接代码,MiMo 生成的质量和 DeepSeek 差不多,但 Token 消耗少很多。这是它性价比高的核心原因。
3. 中文表达自然
这一点比 Claude 和 GPT 都好。MiMo 生成的中文没有那种翻译腔,用词和句式都比较地道。写公众号文章时 AI 味明显更低,审校时需要改的地方更少。
4. 1M 上下文是真能用
不是所有标 1M 的模型都能真的处理 100 万 token。MiMo 的长上下文在实际使用中表现稳定,我在处理长文档和多轮对话时没有遇到上下文丢失的问题。
5. 推理稳定
复杂任务规划、多步骤决策、条件分支判断——这些场景下 MiMo 的表现很一致,不会出现"上一步还行下一步就飞了"的情况。
6. 生态适配广
OpenRouter 上 MiMo 的流量排名靠前,DeepInfra、Xiaomi 直连、AtlasCloud 等多个提供商都有部署。选提供商时有冗余,不会被单一节点卡死。
30天踩过的5个坑(必须诚实说)
坑1:多源信息合成会幻觉(最严重)
这是 30 天里最惊悚的一次。我在做选题推荐时,让模型同时处理 HN、V2EX、Product Hunt、HuggingFace、arXiv、Dev.to 六个平台的热门数据。
输出 5 个推荐选题,其中 4 个存在幻觉:
- 编造了一个不存在的模型"Meta Muse Glimmer 30B"
- 编造了具体的数字"HN score 1023"
- 编造了根本不存在的产品名称
根因:大量异构数据同时输入时,模型容易把不同来源的信息混搭,生成看似合理但完全虚构的内容。
教训:凡是涉及"从多个来源汇总信息"的任务,必须逐条验证。不能信任模型给出的具体数字和产品名。
坑2:通识推理是明显短板
MMLU-Pro 只有 68.5%,DeepSeek V4-Pro 是 87.5%,差了将近 20 分。GPQA-Diamond 也类似,MiMo 66.7% vs Qwen3.5-Plus 88.4%。
实际体感:问一些需要广泛知识储备的问题(比如解释某个物理概念、分析某个历史事件),MiMo 的回答深度明显不如 DeepSeek。它更像一个"做事的模型"而不是"博学的模型"。
坑3:长任务偶尔中断
社区评测里提到的"长时间任务生成中断",我自己也遇到过。特别是在处理大量文件或复杂编排任务时,偶尔会突然中断输出。
不是每次都发生,但概率不低。对于需要持续运行的自动化任务,这是个风险点,需要做好重试和断点续传的逻辑。
坑4:缓存命中率名不副实
官方声称缓存命中率约 89%,TRAE 社区实测约 40%,我的使用体验也差不多。
这意味着实际账单会比理论计算高不少。如果按 89% 命中率算成本,实际可能只有一半多的请求命中缓存,成本直接翻倍。定价虽然便宜,但不要按最理想情况做预算。
坑5:Pro 版不支持多模态
MiMo-V2.5-Pro 是纯文本模型。需要理解图片、音频、视频时,必须切换到 V2.5 基础版。
这在实际使用中是个麻烦。比如让我分析一张截图里的数据,Pro 版直接报错,得手动切模型。如果你的工作流涉及多模态输入,要提前规划好模型切换策略。
定价:真正的价格屠夫
| 模型 | 输入/百万token | 输出/百万token | 缓存命中 |
|---|---|---|---|
| MiMo V2.5-Pro | ¥3 | ¥6 | ¥0.025 |
| DeepSeek V4-Pro | ¥12(限时¥3) | ¥24(限时¥6) | ¥1.2 |
| GLM-5.1 | ~¥10 | ~¥32 | — |
缓存命中价 ¥0.025/百万 token,降幅 99%。
小米的降价逻辑来自推理系统优化:基于 SGLang HiCache,KV Cache 在 GPU/CPU/SSD 多级存储间的传输量降到优化前的 1/7,可缓存 Token 数提高到 5 倍。
到底该不该用?
30天下来,我的选型逻辑变成了这样:
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| Agent / 自动化任务 | MiMo V2.5-Pro | Agent 能力开源第一,Token 效率最优 |
| 代码生成 / 脚本 | MiMo V2.5-Pro | 可靠且便宜 |
| 通识推理 / 科学问答 | DeepSeek V4-Pro 或 Qwen3.5 | MMLU-Pro 差距 20+ 分 |
| 中文内容创作 | MiMo V2.5-Pro | 中文表达自然,AI 味低 |
| 多模态理解 | Qwen3.5-Plus 或 MiMo V2.5 | Pro 版不支持 |
| 预算敏感 | DeepSeek V4-Pro(限时折扣) | 折扣期间性价比也不错 |
一句话:如果你的场景是 Agent 自动化和代码生成,MiMo V2.5-Pro 的性价比目前很难被超越。但通识推理的短板是真实存在的,不适合所有场景。
30天长测最大的收获是搞清楚了它适合做什么、不适合做什么。模型选型的关键是匹配你的具体场景。
备选标题(供公众号选用):
- 用了30天小米推理模型,这些坑官方文档不会告诉你
- MiMo v2.5-Pro 长测30天:Agent 能力确实强,但这几个问题必须说
- 小米推理模型到底行不行?30天高强度实测给你答案