MiniMax
公司介绍
MiniMax 是一家全球领先的通用人工智能科技公司,2022 年底成立,以「与所有人共创智能」为使命,致力于推动 AI 科技前沿发展,实现通用人工智能(AGI)。公司自主研发了一系列多模态通用大模型,具备强大的代码和 Agent 能力以及超长上下文处理能力,能够理解、生成并整合文本、音频、图像、视频和音乐在内的多种模态。
公司定位
- 多模态原生:不是单一文本模型,而是文本、音频、图像、视频、音乐五大模态全栈
- 长上下文领先:M3 模型支持 1M(100 万)token 上下文
- Agent 能力突出:在 SWE-Bench Pro、Terminal Bench 等国际评测中表现领先
- 开源 + 闭源双线:M3 是开源旗舰模型,商业产品走订阅制
核心模型
| 模型 | 类型 | 发布时间 | 核心特点 |
|---|---|---|---|
| MiniMax M3 | 文本/Coding/Agent | 2026-06-01 | 全新 MSA 稀疏注意力架构,1M 超长上下文,原生多模态,国内首个齐备这三个要素的模型,也是目前唯一的开源模型 |
| MiniMax M2.5 | 推理模型 | 2026-02-12 | 基于 MoE 架构,编程/智能体/生产力场景显著提升 |
| MiniMax H3 | 视频生成 | 2026-07-31 | 打破任务和模态的边界,更广泛的艺术和风格化能力 |
| MiniMax Speech 2.8 | 语音 | 2026-01 | 语音合成与理解 |
| MiniMax Music 3.0 | 音乐生成 | 2026-08-13 | ⚠️ 已停止服务(付费接口 08-20 起不面向新用户,免费接口全线关停),改用开源版 |
各模型的能力侧重
- M3 是主力:日常 Coding、Agent 任务、长文档分析都用它
- M2.5 是推理专精:数学竞赛、逻辑推理、复杂决策用 M2.5 更准
- H3 是视频生成:文生视频、图生视频、视频风格化
- Speech 2.8 是语音:TTS、ASR、语音克隆
- Music 3.0 是音乐:作曲、编曲、纯音乐生成
订阅状态(2026-09-08 确认)
- M3 包月不限量(老用户权益):用户的模型版图中承担「量大管饱」位——批量任务、长文档、不挑智力的量活零成本跑
- 与 GLM-5.3-Flash、DeepSeek V4 Flash(API 按量付费)的分工:M3 管量、Flash 双子管质;包月模式能不能活,取决于模型本身行不行(MiMo V2.5 因模型差被弃,M3 因模型好续费)
M3 核心架构:MSA(MiniMax Sparse Attention)
M3 最重要的架构创新是全新稀疏注意力机制 MSA,它解决了全注意力机制计算复杂度平方级增长的「先天缺陷」。
什么是稀疏注意力
传统全注意力的问题:
- 每个 token 都要和上下文里所有其他 token 计算相关性
- 上下文越长,计算量平方级增长
- 100 万 token 上下文下,计算量是 1K 的 100 万倍
- 实际部署成本极高,跑不动
稀疏注意力的解决思路:
- 不是所有 token 都需要两两相关
- 大部分 token 只和「附近」的 token 关系强
- 把注意力计算稀疏化,跳过不重要的 token 对
MSA 的独到之处
与 DSA 和 MoBA 等方案相比,MSA 可以更精确地为 KV 分块,实现更高的有效上下文覆盖。
全注意力: 每个 query 都和所有 KV 计算
DSA: query 只和最近的 KV 块计算
MoBA: query 选择性跳过某些 KV 块
MSA: query 自适应选择 KV 块大小 + 命中区域
核心优化:
- 在算子层直接优化,采用以 KV 块为外层来聚合命中 query 的 KV outer gather Q
- 每块只读一次、访存连续
- 在 M3 的 head 配比下计算访存比显著优于通行方法
- 比开源的 Flash-Sparse-Attention、flash-moba 快 4 倍以上
实际效果
在 100 万上下文下,M3 每 token 计算量仅为上代模型的 1/20。
| 阶段 | 加速比 |
|---|---|
| Prefilling(首次填充) | 超过 9 倍 |
| Decoding(逐 token 生成) | 超过 15 倍 |
| 整体每 token 计算量 | 上代模型的 1/20 |
而且在多个对照实验中,MSA 的绝大部分能力与全注意力打平——既快又准,不是「快了但变笨」。
M3 能力评测
在涵盖软件工程、终端执行等多个维度的国际权威评测中,M3 均达到国际领先水平:
| 评测 | 成绩 | 说明 |
|---|---|---|
| SWE-Bench Pro | 59.0% | 软件工程评测(修真实 GitHub Issue) |
| Terminal Bench 2.1 | 66.0% | 终端执行能力 |
| SWE-fficiency | 34.8% | 代码效率 |
| KernelBench Hard | 28.8% | CUDA 算子 |
| MCP Atlas | 74.2% | MCP 工具调用 |
评测解读
- SWE-Bench Pro 59%:是真实工程任务,比 SWE-Bench Verified 难得多,能修复杂 Issue
- MCP Atlas 74.2%:工具调用能力突出,适合做 Agent
- KernelBench Hard 28.8%:写 CUDA 算子的能力也强,能做 GPU 优化
实际任务表现
论文独立复现
M3 自主运行接近 12 小时,全程自主产出 18 次 commit 与 23 张实验图表,跑通了 ICLR 2025 Outstanding Paper Award 获奖论文 Learning Dynamics of LLM Finetuning 的核心实验。
成功吻合 SFT 阶段的预测概率变化趋势,观测到 DPO 实验的 squeezing 效应,验证了 Extend 缓解方法。
意义:一个 AI 能独立跑通获奖论文实验,意味着科研工作流可以大幅自动化。
CUDA 算子优化
在 NVIDIA Hopper 架构 GPU 上优化 FP8 GEMM kernel,M3 共完成 147 次 benchmark 提交、1959 次工具调用,自主走完 baseline 实现到生产级优化的全部路径。
最终将硬件峰值利用率从首版 7.6% 推进至 71.3%,实现 9.4× 加速。
横向对比:
- 除 Opus 4.7 和 M3 外,其余模型大多在前 30 次提交内不再取得新进展并主动退出
- M3 的最优解出现在第 145 次提交——证明它能持续探索不放弃
- 只有 Opus 4.7 在这个任务上和它有可比性
让 M3 自己「训」模型
在 PostTrainBench 上,给 M3 四个只完成预训练的 Base 模型,让它在 12 小时内自主完成数据合成、训练、评测、迭代的全部流程。
最终得分 0.37,略低于 Opus 4.7(0.42)和 GPT-5.5(0.39),但明显领先其余模型。
意义:M3 不仅能调模型,还能自己造模型——这是 AGI 的关键能力。
产品矩阵
| 产品 | 定位 | 特点 |
|---|---|---|
| MiniMax Code | Coding Agent | 专为 M3 设计并一起训练,Agent Team 可拆解大型任务为多阶段可并发 Workflow,Producer + Verifier 对抗式 Harness 循环,可自主运行数天。具备 Computer Use 能力,基于 OpenCode 和 Pi Agent 构建 |
| MiniMax Design | AI 设计平台 | AI Agent 驱动的商业内容生产平台 |
| MiniMax Audio | 语音产品 | 语音合成与理解 |
| 星野 | C 端产品 | 面向个人用户的应用 |
MiniMax Code 的特色
- Agent Team:不是单个 Agent,而是多个 Agent 协作
- Producer + Verifier 对抗:一个写代码,一个验证,互相博弈提升质量
- 可运行数天:不像普通 Agent 几分钟就结束,Code 能跑几天不中断
- Computer Use:能直接操作电脑 GUI,不只是命令行
Token Plan 三档
| 档位 | 价格 | token 量 | 折算 |
|---|---|---|---|
| Plus | ¥49/月 | 6 亿 | ≈ Claude Pro $20 月度容量的 5 倍 |
| Max | ¥119/月 | 18 亿 | ≈ Claude Max 5x $100 月度容量的 2 倍 |
| Ultra | ¥469/月 | 55 亿 | ≈ Claude Max 20x $200 月度容量的 3 倍 |
按相同价格算,约是 Claude 订阅的 15 倍用量。
订阅档位选择建议
- Plus ¥49/月:轻度用户,写写代码、查查资料
- Max ¥119/月:中度用户,每天跑 Agent 任务
- Ultra ¥469/月:重度用户,长链路 Agent、批量任务
API 计价(2026-10-01 官方核实)
当前主力已是 M2.7
⚠️ 重要变化:按量计费页面当前主推的是 MiniMax-M2.7(输入 ¥2.1 / 输出 ¥8.4 / 百万 tokens),M3 反而在「历史模型」之外单列。M2.7-highspeed 是高速版,价格翻倍(¥4.2 / ¥16.8)。
M3 价格(永久五折后)
M3 按输入上下文长度分两档,≤512k 部分永久五折:
| 模型 | 输入(元/百万 tokens) | 输出(元/百万 tokens) | 缓存读取 |
|---|---|---|---|
| M3 ≤512k 输入 | |||
| M3 >512k 输入 | |||
| M2.7 | 2.1 | 8.4 | 0.42 |
| M2.7-highspeed | 4.2 | 16.8 | 0.42 |
| M2.5 / M2.1 / M2(历史) | 2.1 | 8.4 | 0.21 |
优先服务:service_tier=priority,按标准价 1.5 倍计费,换取优先准入和更低失败率。
估算参考:1600 个中文字符约消耗 1000 tokens。
其他产品线定价
| 产品 | 单价 |
|---|---|
| 语音识别 ASR | ¥2.50 / 小时 |
| 语音合成 speech-2.8-turbo | ¥2.00 / 万字符 |
| 语音合成 speech-2.8-hd | ¥3.50 / 万字符 |
| 音色设计 / 快速复刻 | ¥9.90 / 音色(首次使用才计费) |
| 图像 image-01 | ¥0.025 / 张 |
| web_search 服务端工具 | ¥0.03 / 次 |
| API-vlm(Token Plan MCP) | ¥0.025 / 次 |
视频生成(MiniMax-H3)
| 模型 | 分辨率 | 单价 |
|---|---|---|
| H3-Max | 480P | ¥0.33 / 秒 |
| H3-Max | 768P | ¥0.50 / 秒 |
| H3 | 768P | ¥0.50 / 秒 |
| H3 | 2K | ¥0.80 / 秒 |
| H3-Context-IR | — | 输入 ¥5.80 / 输出 ¥23.00 每百万 tokens |
输入素材:音频免费、图片 5 张内免费(超出 ¥0.20/张)、视频按时长计费(2K ¥0.80/秒、768P ¥0.50/秒)。
⚠️ 音乐生成已全线停止服务
自 2026 年 8 月 20 日起:
- 付费音乐生成、歌词生成接口不再面向新用户,历史付费用户可继续用
- 免费音乐接口(Music-3.0-free、Music-2.6-free、music-cover-free)全部停止服务
- 替代方案:去 MiniMax Audio 体验,或用 Hugging Face / ModelScope 上的开源 MiniMax Music 3
原表格里 Music 3.0 那行需要标注为已下线。
⚠️ 记账提醒
Token Plan 额度耗尽且已购积分可用时,超出部分会自动由已购积分补充支付(1,000 积分 = ¥7,与 API 按量付费 1:1)。这是静默扣费路径,用套餐 Key 时要留意超额消耗。
在国内大模型中的位置
| 模型 | 公司 | 上下文 | 开源 | Agent 能力 |
|---|---|---|---|---|
| M3 | MiniMax | 1M | ✅ | ⭐⭐⭐⭐⭐ |
| GLM-5.3 | 智谱 | 200K | ✅ | ⭐⭐⭐⭐ |
| Kimi K3 | 月之暗面 | 1M | ❌ | ⭐⭐⭐⭐ |
| DeepSeek V4 | DeepSeek | 128K | ✅ | ⭐⭐⭐⭐ |
M3 在 Agent 能力和开源两方面都有优势,是国内 Coding Agent 首选之一。
相关笔记
- TraeWork - 接入的目标
- OpenRouter - 接入渠道
- Kimi K3 - 同级别模型
- DeepSeek - 同级别模型
- API Keys - Key 存放处(私密)
- GLM-5.3 - 同为国内旗舰,可对比
相关日记
- 2026-08-25 - 全员模型对比调研
- 2026-08-26 - 测试 MiniMax Code 和 Token Plan