值友们好!👋

国庆假期刚过,国产大模型圈就扔出一颗重磅炸弹:10月2日,MiniMax(稀宇科技)正式发布新一代大模型 MiniMax M3。

官方给它的定位很狂:对标GPT-5.5。社区实测数据更直观——在编程能力的硬指标SWE-Bench Pro上拿到59.0%的成绩,直接超过GPT-5.5和Gemini 3.1 Pro,紧追Claude Opus 4.7。要知道Opus系的API价格是它的好几倍。💥

更关键的是:API已经上线,官方承诺10天内向全球开发者开源模型权重和技术报告——掐指一算,就这两天了。今天咱们把M3的看点、和国产兄弟们的对比、值友怎么上手,一次讲透。

一、M3强在哪?三个”首次”看懂它

1️⃣ 编程能力:正面硬刚闭源旗舰

SWE-Bench Pro考的是真实软件工程能力——给模型一个真实代码库的bug,让它自己定位、修改、跑通测试。M3拿到59.0%,超过了GPT-5.5和Gemini 3.1 Pro。在Agent能力的Claw-Eval测试中同样表现优越,多模态文档理解的OmniDocBench基准也拿了领先分数。对用AI写代码、做Agent的值友来说,这意味着:国产开源模型第一次在”干活能力”上摸到了闭源旗舰的门槛。👨‍💻

2️⃣ 中国首个”文+图+视频+桌面操作”全整合开源模型

M3原生支持图像和视频输入,还支持计算机桌面交互。官方口径是”中国首个整合这三项关键能力的开源模型”。注意”原生”两个字——不是外挂个视觉模块缝合出来的,是训练时就长在一起的。这意味着它能看你的屏幕、看懂你丢给它的视频,然后直接操作电脑干活。🖥️

3️⃣ MSA稀疏注意力:长上下文不再肉

100万token上下文不稀奇,稀奇的是效率。M3采用新的稀疏注意力架构MSA,在处理100万token超长上下文时,单token计算量比上一代减少一半,解析速度提升9倍以上,答案生成速度提升15倍以上。说人话:以前丢一本专业书进去等半天,现在喝口水的功夫就出结果。📚

二、和国产兄弟们比,M3什么水平?

2026年国产开源大模型已经是神仙打架,值友最关心的还是横向对比。基于公开评测数据,我整理了这张表:

模型 发布时间 上下文 SWE-Bench Pro 多模态 开源情况
MiniMax M3 2026-10-02 100万 59.0%(超GPT-5.5) 文本+图+视频+桌面操作 权重10天内开源
Kimi K3 2026-07-16 100万 —(SWE-bench Verified 76.8%) 原生视觉 2.8万亿参数,已开源
DeepSeek V4 Pro 2026-04 100万 SWE-bench Verified 80.6% 纯文本 MIT,已开源
GLM-5.2 2026-06 100万 三者中领先(预测77.8%) 纯文本 MIT,已开源

说明一下:各家评测口径略有差异(SWE-bench Pro和SWE-bench Verified不是同一个测试),表格只做直观参考。绿色高亮的M3,最大差异化优势就是多模态全整合+Agent能力——别的兄弟要么纯文本,要么视觉是外挂。而M3的架构创新(MSA稀疏注意力)让它在1M上下文的实际可用性上领先一截。

三、值友现在能怎么用?

🟢 立刻能用:M3的API已经上线MiniMax开放平台,支持Agent场景调用。开发者值友现在就能接。参考上一代M2.7的定价策略,Coding Plan套餐一直是国产里额度限制最松、速率最稳的那档,日常429很少,适合跑Agent工作流。

🟡 等几天就白嫖:权重开源后(官方口径10天内),意味着可以本地部署、通过中转站免费调用、在开源社区魔改微调。36B级别的前作都白菜价了,M3这个量级大概率也能在消费级多卡平台上跑量化版——存储党、隐私党狂喜。🏠

🔵 现在该干嘛:把这篇收藏⭐,等开源权重落地我会回来补部署教程。急着用编程能力的值友,现在手里其实已经有不少选择——想要免费上手可以先看我10月8日那篇《2026年AI编程工具横评》,Trae、通义灵码对新手更友好。

四、这波之外,10月AI圈还有什么看点?

M3不是孤例,最近几周国产AI圈的密度非常高,值友可以顺便记几个时间点:

  • 🤖 Kimi:9月11日K2.8 Preview全量上线,所有会员档位都给了100万token上下文;另外API后台已经出现”kimi-k3-1″标识,业内预计10月正式发布K3.1,支持Low/High/Max三档推理强度;
  • 📈 豆包:10月5日网经社《通用大模型人气周榜》显示,豆包以143.6的人气指数首次登顶全球第一,打破ChatGPT、Gemini对榜首的垄断,文心一言也冲到第三——国产包圆前三,里程碑时刻;
  • 🧠 字节Seed-OSS-36B开源:512K上下文+业界首创”Thinking Budget”(自己控制模型思考多深),Apache-2.0协议,本地部署党值得蹲一波。

五、课代表总结

✅ 优点:

  • 编程/Agent能力进入第一梯队,且承诺开源,性价比路线明确;
  • 多模态全整合(文+图+视频+桌面操作),差异化明显,不是简单堆参数;
  • MSA稀疏注意力把长上下文从”能用”变成”好用”,解析提速9倍不是小数字。

⚠️ 注意:

  • Preview阶段实测样本还少,官方数据等开源后社区会有一轮真实检验,别急着All in工作流;
  • 警惕二手信息平台的”M3内部额度”代充,等官方渠道;
  • 权重未开源前,重度使用者优先用API按量计费,别买长期套餐。

🏆 一句话结论:国产开源大模型的第一梯队又添一员,且这次是带着多模态和Agent短板补全来的。这两天把权重蹲住,开源即白嫖,值友先收藏再上车!🚀

M3和K3你更看好谁?平时用AI编程多还是写作多?评论区聊聊!💬


📂 更多推荐

  • 查看更多相关文章:https://www.88531.cn
  • 关注公众号「实用软技」获取更多软件推荐和实用技巧
  • 所有软件均提供夸克网盘下载,公众号回复「软件」一键获取

https://www.88531.cn/?p=58126

www.npspro.top互联侠客
软师兄 » MiniMax M3发布:SWE-Bench Pro 59.0%硬刚GPT-5.5,国产开源AI大模型又炸了,值友先收藏再上车

最TOP的Docker,软路由,虚拟机等学习资料

立即查看 了解详情