
5 月 27 日,小米 MiMo 官方宣布,对 MiMo-V2.5 系列 API 进行永久降价。
这次不是短期促销,也不是限时补贴,而是一次面向整个模型价格体系的长期调整。根据公开报道,MiMo-V2.5 系列 API 新价格最高降幅可达 99%,并且不再区分上下文窗口长度。本次调价已于北京时间 5 月 27 日 0 点正式生效,并全球同步调整。
这意味着,开发者在调用 MiMo-V2.5 系列模型时,成本将明显下降,计费规则也变得更简单。
在大模型行业里,价格正在变成越来越关键的竞争因素。过去大家更关注谁的模型更强,现在用户和开发者也开始关心另一个问题:谁的模型更便宜、更稳定、更适合大规模调用。
MiMo-V2.5 系列具体降了多少?
这次降价覆盖 MiMo-V2.5 和 MiMo-V2.5 Pro 两个核心版本。
根据公开信息,MiMo-V2.5 Pro 输入缓存命中价格降至 0.025 元 / 百万 tokens,最高降幅达 99%;MiMo-V2.5 输入缓存命中价格降至 0.02 元 / 百万 tokens,最高降幅达 98%。输出价格方面,MiMo-V2.5 Pro 降至 6 元 / 百万 tokens,最高降幅 86%;MiMo-V2.5 降至 2 元 / 百万 tokens,最高降幅 93%。(新浪财经)
这组价格变化对开发者非常直接。
输入成本下降,意味着长上下文、知识库问答、文档分析、Agent 多轮任务等场景会更便宜。
输出成本下降,意味着内容生成、代码生成、客服回复、报告撰写等场景的整体调用费用也会降低。
尤其是缓存命中价格大幅下降,对高频重复调用和长上下文应用非常有价值。
不再区分上下文窗口长度,计费更简单
这次调价还有一个很重要的变化:不再区分上下文窗口长度。
过去,一些模型 API 会根据上下文窗口大小采用不同价格。上下文越长,价格越高,开发者在选模型和设计应用时要反复计算成本。
MiMo-V2.5 系列这次取消上下文窗口长度区分,让定价逻辑更简单。(腾讯新闻)
这对开发者来说是好事。
因为很多 AI 应用并不是每次都能准确预测上下文长度。比如知识库问答、企业文档助手、长文本总结、代码仓库分析、Agent 工作流,都可能涉及不同长度的输入。
如果价格体系太复杂,开发者就要在产品设计中频繁控制上下文,甚至牺牲效果来压低成本。
现在规则简化后,开发者更容易估算预算,也更容易把长上下文能力放进真实应用里。
Token Plan 计费体系优化,用量提升至原来的 5 至 8 倍
除了 API 降价,小米这次还同步优化了 Token Plan 计费体系。
公开报道显示,优化后的 Token Plan 在加量不加价的基础上,用量提升至原来的 5 至 8 倍,同时引入 Credits 概念,让计费规则更清晰、更易理解。(新浪财经)
这对个人开发者、小团队和中小企业都很重要。
很多开发者不是按单次调用来评估成本,而是更关心一个月内能跑多少任务、能服务多少用户、能支撑多少次请求。
Token Plan 用量提升后,同样预算下能做更多实验,也能承担更多真实业务请求。
比如:
更多次 AI 聊天;
更多文档解析;
更多代码生成;
更多图片或文本理解任务;
更多 Agent 多轮执行;
更多企业知识库查询。
对 AI 应用早期开发来说,这种额度提升会明显降低试错成本。
为什么小米能降价?技术底座优化是关键
大模型 API 降价,背后不是简单让利,也和推理系统优化有关。
据公开报道,小米基于 SGLang HiCache 完整支持 SWA,也就是 Sliding Window Attention,将 KV Cache 在 GPU 显存、CPU 内存、SSD 等多级存储之间的数据搬运量降低至优化前的近 1/7,并将可缓存 token 数量提升至优化前的近 5 倍,从而提升缓存命中率和推理效率。同时,小米还优化了专家并行方案、输入长度分桶策略,进一步提升集群输入吞吐能力,并降低单位 token 服务成本。(新浪财经)
这段技术说明背后的意思很清楚:价格下降不是只靠补贴,而是系统效率提升后,把成本空间释放给用户。
对大模型服务来说,真正影响成本的不只是模型本身,还有推理引擎、缓存机制、调度策略、硬件利用率和集群吞吐。
谁能把推理成本打下来,谁就能在 API 价格上更有竞争力。
缓存命中价格大降,对 Agent 应用尤其重要
这次 MiMo-V2.5 系列缓存命中价格大幅下降,对 Agent 场景非常友好。
AI Agent 通常不是一次请求就结束,而是需要多轮调用。
比如一个智能体任务可能要:
理解用户目标;
读取历史上下文;
调用工具;
分析结果;
继续规划;
再次调用模型;
修改答案;
检查输出;
最终交付。
在这个过程中,很多上下文会重复出现。如果缓存机制做得好,重复部分就不需要每次都完整计算,成本也会明显下降。
MiMo-V2.5 系列输入缓存命中价格降到非常低的水平,意味着多轮对话、长上下文应用和 Agent 工作流的成本会更可控。
这对开发者非常实用。
因为 Agent 应用最怕“跑起来很酷,账单也很酷”。缓存成本下降后,更多开发者会愿意尝试复杂工作流。
对开发者来说,最大的变化是试错成本降低
很多 AI 应用做不起来,不一定是因为模型能力不够,而是因为成本太高。
开发者需要反复测试提示词;
需要多次调用模型调试效果;
需要处理用户真实请求;
需要评估不同模型组合;
需要跑 Agent 长任务;
需要做知识库检索和上下文拼接。
这些都会消耗 tokens。
API 价格下降后,开发者可以更放心地测试模型能力,快速迭代应用。
比如一个团队想做 AI 客服,以前可能担心每次查询都要花不少成本;现在输入和输出价格下降后,就可以更大胆地测试高频场景。
一个开发者想做 AI Agent,以前可能担心多轮调用费用过高;现在缓存命中价格下降后,长任务成本会更容易控制。
这就是降价对 AI 生态真正的意义:它让更多想法可以被验证。
对企业用户有什么价值?
企业使用大模型,最关心的通常有三件事:效果、稳定性和成本。
如果模型效果不错,但调用价格太高,很多企业只能在小范围试点,难以大规模推广。
MiMo-V2.5 系列 API 降价后,企业可以更低成本地尝试更多场景。
比如:
智能客服;
企业知识库问答;
内部文档总结;
销售话术生成;
会议纪要整理;
代码辅助开发;
运营内容生成;
长文本分析;
Agent 自动化流程。
尤其是那些调用量大、频次高、用户多的业务,价格下降会直接影响 ROI。
企业部署 AI 不再只是看模型能力,也会看单位调用成本能不能支撑长期运行。MiMo-V2.5 的降价,正好击中了这个痛点。
对个人开发者和小团队更友好
大模型应用并不只属于大公司。
很多 AI 工具、插件、小程序、知识库、效率工具,都是个人开发者和小团队先做出来的。
但对小团队来说,API 成本非常敏感。
一个产品早期可能还没有收入,却要承担模型调用费用。用户一多,成本就上升;如果收费模式没跑通,很容易越做越亏。
MiMo-V2.5 系列降价后,个人开发者可以更低成本地做原型、测试功能、验证市场。
这会带来更多轻量级 AI 应用,比如:
AI 写作工具;
AI 阅读助手;
AI 简历优化;
AI 客服插件;
AI 知识库;
AI 编程助手;
AI 办公自动化;
AI 学习工具。
价格下降越明显,创新门槛越低。
大模型价格战进入新阶段
小米这次 MiMo-V2.5 系列 API 永久降价,也说明大模型行业价格竞争正在继续加速。
过去一年,大模型行业更多比拼能力:
谁推理更强;
谁代码更好;
谁多模态更完整;
谁上下文更长;
谁 Agent 能力更强。
现在,价格也成为核心竞争力。
因为 AI 应用真正落地时,开发者和企业不会只看模型排行榜,还会看:
每百万 tokens 多少钱;
缓存命中怎么算;
上下文长度是否加价;
额度是否清晰;
调用是否稳定;
整体成本是否可预测。
小米这次取消上下文长度区分、降低缓存命中价格、优化 Token Plan 体系,本质上是在把模型服务做得更像基础设施。
基础设施的竞争,最终一定会走向更低成本、更高吞吐、更简单计费。
降价会不会影响模型质量?
很多用户看到大幅降价,可能会担心一个问题:价格低了,质量会不会下降?
从目前公开信息看,小米强调本次降价背后来自推理系统和基础设施优化,包括缓存、专家并行、输入长度分桶和集群吞吐能力提升,而不是降低模型能力。(新浪财经)
也就是说,降价逻辑更像是“单位服务成本下降”,而不是“换成弱模型”。
当然,开发者在正式接入前,仍然需要用真实任务测试模型表现。
比如:
长文本理解是否稳定;
代码生成是否可靠;
多轮对话是否一致;
Agent 工具调用是否顺畅;
高并发下响应是否稳定;
缓存命中场景是否符合预期。
价格是优势,但最终能不能成为主力模型,还要看效果、稳定性和生态支持。
MiMo-V2.5 降价适合哪些场景?
1. AI 客服
客服场景调用频率高,成本敏感。价格下降后,智能客服更容易规模化运行。
2. 企业知识库
知识库问答经常需要长上下文和多轮交互,缓存命中价格下降会明显降低成本。
3. AI Agent
Agent 多轮调用、重复上下文多,对低缓存价格非常敏感。MiMo-V2.5 降价后更适合复杂任务测试。
4. 内容生成
文章、营销文案、商品描述、短视频脚本等内容生成场景,可以从输出价格下降中受益。
5. 代码辅助
代码解释、代码生成、报错分析和文档生成等开发场景,通常需要大量 token,价格下降会提升可用性。
6. 教育和学习工具
AI 答疑、学习辅导、题目讲解、阅读总结等场景,对低成本 API 需求很强。
7. 个人 AI 应用
个人开发者可以更低成本做 AI 小工具、小程序、插件和实验性产品。
对小米 AI 生态有什么意义?
MiMo-V2.5 系列 API 降价,也说明小米在 AI 生态上正在加速。
小米本身拥有手机、汽车、IoT、操作系统和智能硬件生态。如果大模型 API 成本下降,未来这些能力不仅能服务外部开发者,也可能反向推动小米自身产品体验升级。
比如:
手机端 AI 助手;
车载 AI 交互;
智能家居控制;
IoT 场景问答;
系统级 AI 功能;
开发者生态工具;
企业和个人 AI 应用。
价格体系越友好,越容易吸引开发者围绕 MiMo 构建应用。
大模型生态不只是靠一个模型,而是靠模型能力、开发平台、价格体系、工具链和应用场景共同推动。
仍需关注哪些问题?
虽然 MiMo-V2.5 降价力度很大,但开发者在接入前仍然需要关注一些实际问题。
比如:
API 稳定性如何;
高并发性能如何;
是否有明确 SLA;
上下文长度具体限制是多少;
缓存命中策略如何计算;
Token Plan 的 Credits 如何换算;
不同套餐适合哪些场景;
模型在中文、代码、工具调用等任务中的实际效果如何;
是否适合企业级合规和私有化需求。
价格下降是好消息,但真正落地还要看产品文档、调用体验和业务适配。
总结:MiMo-V2.5 永久降价,让大模型调用成本继续下探
小米 MiMo-V2.5 系列 API 永久降价,是大模型行业价格竞争中的一次重要动作。
这次调价覆盖 MiMo-V2.5 和 MiMo-V2.5 Pro 两个版本,最高降幅达 99%,并且不再区分上下文窗口长度。MiMo-V2.5 Pro 输入缓存命中价格降至 0.025 元 / 百万 tokens,MiMo-V2.5 输入缓存命中价格降至 0.02 元 / 百万 tokens;输出价格方面,MiMo-V2.5 Pro 降至 6 元 / 百万 tokens,MiMo-V2.5 降至 2 元 / 百万 tokens。(新浪财经)
同时,Token Plan 计费体系也同步优化,用量提升至原来的 5 至 8 倍,并引入 Credits 概念,让规则更加清晰。(新浪财经)
这次降价背后,是小米在推理系统、缓存机制、专家并行和集群吞吐上的持续优化。对开发者来说,调用成本更低,试错空间更大;对企业来说,AI 应用规模化部署的门槛进一步下降;对行业来说,大模型竞争正在从“谁更强”扩展到“谁更便宜、更稳定、更适合落地”。
相关链接
小米 MiMo API 调价公告:
https://platform.xiaomimimo.com/docs/en-US/news/v2.5-price-update









评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。