MiniMax-M3 模型发出来也很久了,网上大家的评论众说纷纭。最近正好有时间,我高低得来试一下这个模型到底是怎么样子的。我需要的是一个“无偏”的评价!所以我开了一个 MiniMax Token plan。
首先,我评价一个模型的 Agent 的能力,必须是长时程的 Agent 任务。好的,那我就把 Claude Sonnet 5、MiniMax M3、GLM 5.2 以及 Kimi 2.7 Code 都用 Claude Code 打开 goal 模式,给到相同的提示词,在浏览器中尽可能的构建一个能玩的“我的世界”游戏。提示词我会放在最后,大家感兴趣也可以自己试一试。
claude-sonnet-5 用了30 分钟完成;MiniMax-M3 用了 40 分钟;GLM-5.2 用了 30 分钟;kimi-2.7-code 用了 2 小时 34 分钟;DeepSeek V4 Pro 用了1小时20分钟。
评价一下 Claude Sonnet 5,完成度也不错,也能玩,就是这个树都没有树冠,只有树干。还有,也没有什么贴图,就是纯色的方块。MiniMax M3 有贴图,做得也挺好的,但是这个方块好像没有闭合,不是每个面都有贴图。GM5.2应该是做得最好的,有贴图,方块也能破坏,能玩,但是没有光影,有待进步。最后是 Kimi 2.7 code,和 Claude Sonnet 5 一样,只有树干,没有树冠也没有树叶。而且它应该是一点光影都没有,只有纯色的贴图,比 Claude Sonnet 5 还要差很多。DeepSeek 似乎没有做好地面碰撞,用户进去之后直接开始下落。总的来说,表现最好的就是 GLM-5.2和 MiniMax-M3。
我又试了一下 MiniMax Code,这是一个类似 Codex App 的一个东西。他们说这个有 Agent team,Agent team 做的确实不错,和 Codex 的 subagent 一样,但是不会像 codex 一样自我繁殖,以至于消耗太多 token。我最近比较关注 AI 算力的股票,所以就问了一下浪潮信息和工业富联,因为这两个我都有持仓。结果发现 MiniMax 回答还挺不错的,也会调用不同的 subagent。而且它每一轮的调研都会把上一轮的调研结果作为提示词,这点我还挺意外的。你最终的回答结果,我感觉也挺符合我的要求的。他说出了预期,就是证券公司给出的预期,所以才会有这样的结果。
同时看了一下 GLM 的 ZCode 和 kimi 的网页版对话,kimi 只是搜了相关新闻表明不及券商的预期;ZCode 做的比较好,统计了每一家券商对浪潮信息和工业富联的预期业绩,MiniMax Code 也做到了这一点,挺棒的哇~
最后关于套餐价格49一个月,和智谱以及 Kimi 的价格是持平的,但 MiniMax 有6亿 tokne 的额度,就算是 DeepSeek V4 Pro,我用 API 测试下来,算上缓存命中涨价之前,一个亿的 token 大概是 10 块钱。6个亿就是60块钱,那 MiniMax 还是挺有性价比的。
而且 MiniMax 是做多模态出身的,所以它的 token plan 里面会有视频生成、图片生成、音乐生成,特别是音乐生成,我很喜欢。我也用它生成了一首歌曲,就是这个小红书的背景音乐,大家可以点开听一听。我觉得这首歌我还蛮喜欢的,我已经无脑循环播放1个下午了。
#大模型##minimax创始人兼ceo不再领取薪酬##minimax#
