AI觉醒星球
Awakening is here
Knowledge File / 全球热点解读
2026-06-15 10 浏览 公开

MiniMax 开源 M3 模型权重及 MSA 技术论文

MiniMax 开源 428B 参数、23B 激活的 M3 模型,发布 MSA 稀疏注意力技术,降低长上下文成本,性能领先。

SOURCE / 全球热点解读 MIN / 9 ACCESS / 公开 POST / 2026-06-15 22:40:02

原贴

查看原文
作者:公众号:MiniMax(稀宇科技) 来源站点:mp.weixin.qq.com 原贴时间:

原文

MiniMax 上周五开源了 428B 总参数、23B 激活参数的 M3 模型权重,同步发布 MSA(MiniMax Sparse Attention)技术论文,该架构显著降低长上下文计算成本。M3 是首个从预训练阶段就进行文本、图像等多模态交错混合训练的开源模型。发布两周后,M3 在 Artificial Analysis 综合智能指数、GDPval-AA 排行榜均获开源模型第一,Code Arena WebDev 跻身帕累托最优序列,Vals.AI 榜单居国产模型首位。输出速度已从约 30 TPS 提升至约 80 TPS,计划再提速 30-40%;Token Plan 后台新增调用量看板。 AIHOT 分类:ai-models

中文翻译

MiniMax 上周五开源了 428B 总参数、23B 激活参数的 M3 模型权重,同步发布 MSA(MiniMax Sparse Attention)技术论文,该架构显著降低长上下文计算成本。M3 是首个从预训练阶段就进行文本、图像等多模态交错混合训练的开源模型。发布两周后,M3 在 Artificial Analysis 综合智能指数、GDPval-AA 排行榜均获开源模型第一,Code Arena WebDev 跻身帕累托最优序列,Vals.AI 榜单居国产模型首位。输出速度已从约 30 TPS 提升至约 80 TPS,计划再提速 30-40%;Token Plan 后台新增调用量看板。

核心信息

MiniMax 开源 428B 参数、23B 激活的 M3 模型,发布 MSA 稀疏注意力技术,降低长上下文成本,性能领先。

  • MiniMax 开源 428B 参数 M3 模型,23B 激活。
  • MSA 稀疏注意力降低长上下文计算成本。
  • M3 是多模态预训练开源模型。
  • 发布两周获多项基准第一。
  • 输出速度从 30 TPS 提升至 80 TPS。

详细解读

这是什么信号?MiniMax 开源了 M3 模型权重和 MSA 技术论文,M3 是一个 428B 总参数、23B 激活的稀疏注意力多模态模型,从预训练开始就融合文本和图像,显著降低了长上下文的计算成本。这标志着开源大模型在效率和规模上迈出了重要一步。

为什么重要?M3 在多个基准测试中取得开源模型第一,证明稀疏注意力架构能在不牺牲性能的前提下降低推理成本,这对于部署长上下文应用(如文档分析、多轮对话)至关重要。同时,多模态预训练的开源模型将降低企业开发 AI 应用的门槛。

对谁有价值?对 AI 开发者、创业公司、研究机构以及需要长上下文处理的企业有价值。他们可以基于 M3 快速构建或微调多模态应用,而无需从头训练。

可以怎么行动?立即访问 MiniMax 官方仓库下载模型权重和论文,测试其在自有数据上的效果;关注 Token Plan 调用量看板,评估成本;考虑将 M3 集成到现有工作流中,如内容生成、智能客服等。

风险或限制?尽管 M3 性能领先,但 428B 总参数仍对硬件有一定要求,推理时 23B 激活虽降低显存,但长上下文场景仍需优化;开源社区竞争激烈,需持续关注后续迭代和生态建设。

信息差价值

信息差价值:M3 是首个从预训练阶段就进行多模态交错混合训练的开源模型,其稀疏注意力架构(MSA)显著降低长上下文推理成本,这与其他开源模型(如 LLaMA 系列)形成差异化。开发者若只关注通用模型,可能忽略这一在效率和多模态能力上的突破。

业务启发:企业可基于 M3 快速构建长文本理解、图像标注、多模态问答等应用,降低部署成本。例如,电商平台可结合商品图文进行智能推荐,法律行业可处理长文档摘要。同时,MSA 架构提示业务应关注稀疏注意力在降低计算成本方面的潜力,可迁移至自有模型优化。

可沉淀动作:1. 下载 M3 模型和论文,搭建内部测试环境,评估其在具体业务场景下的表现。2. 将 M3 纳入模型选型清单,对比其他开源模型(如 Qwen2-VL)的成本与效果。3. 跟进 MiniMax 后续更新,关注 Token Plan 看板以优化调用成本。4. 将多模态预训练思路融入自有模型训练流程。

参考来源

上一篇 趋势解读:We’re strengthening our presence in Alabama through new,解读最新 AI 进展 下一篇 纳德拉定调微软:不做最强模型,做模型生态