XM
MiMo V2.5
模型简介
小米 MiMo V2.5 是小米自研的原生多模态混合专家模型,面向生产级 AI 应用。它能理解文本、图像、视频和音频,并为聊天、编程、推理、内容生成和 Agent 工作流生成高质量文本。凭借长上下文设计和工具调用能力,MiMo V2.5 适用于文档分析、多模态助手、结构化提取,以及需要融合多种输入格式的复杂任务。你可以通过 Tokiway 调用 Xiaomi MiMo API,查看当前 MiMo V2.5 的价格、模型 ID、支持端点和模型限制,再决定是否用于生产环境。
规格与价格
- 上下文窗口
- 1.1M Token
- 最大输出
- 131.1K Token
- 输入价格
- ¥0.98/M
- 输出价格
- ¥1.96/M
- 缓存读取
- ¥0.0196/M
- 发布日期
- 2026年4月23日
- 输入价格
- ¥0.98/M
- 输出价格
- ¥1.96/M
- 缓存读取
- ¥0.0196/M
API 能力
- 推理
- 支持
- 工具调用
- 支持
- Temperature 参数
- 支持
- 附件
- 支持
- 知识库
- —
- Endpoint 协议
- Messages API
模型亮点
MiMo V2.5 结合原生全模态理解、通用 Agent 能力和百万 Token 上下文,适合响应速度敏感的多模态应用。
MiMo V2.5 模型亮点
MiMo V2.5 结合原生全模态理解、通用 Agent 能力和百万 Token 上下文,适合响应速度敏感的多模态应用。
原生全模态理解
模型可综合理解文本、图像、视频和音频,在同一任务中利用不同媒体的信息。
通用 Agent 能力
MiMo V2.5 可将多模态感知转换为行动,用于需要规划和工具协调的日常 Agent 任务。
高响应百万 Token 上下文
百万 Token 上下文与较高的平均推理速度,可处理大型输入并保持高频任务的响应性。
适用场景
MiMo V2.5 适合多媒体分析、图表与视频理解,以及将感知结果转化为实际操作的日常 Agent。
MiMo V2.5 使用场景
MiMo V2.5 适合多媒体分析、图表与视频理解,以及将感知结果转化为实际操作的日常 Agent。
多媒体内容分析
综合文本、图像、音频和视频,识别事件、主题、说话者和关系,并生成统一的文本摘要。
图表与视频理解
理解信息密集的图表或长视频,提取重要变化和依据,并回答相关内容问题。
多模态日常 Agent
理解混合媒体请求,规划较短的操作序列,协调工具并为日常工作生成实用结果。
调用示例
from openai import OpenAI
client = OpenAI(
base_url="https://api.tokiway.com/v1",
api_key="YOUR_TOKIWAY_KEY",
)
resp = client.chat.completions.create(
model="mimo-v2-5",
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)