KDnuggets

Does MiniMax Agent Actually Make Work Easier?

8.5内容质量

TL;DR · AI 摘要

MiniMax Agent(现Mavis)通过Agent Teams架构提升复杂任务效率,但存在法律风险且简单任务效果不佳。

核心要点

  • MiniMax Agent重命名为Mavis,采用Leader-Worker-Verifier架构,仅在长任务中有效
  • 实际测试显示多代理协作使简单任务耗时增加3倍且无精度提升
  • 需注意Anthropic的模型蒸馏指控及迪士尼等公司的版权诉讼

结构提纲

按章节快速跳转。

  1. 文章通过实测验证MiniMax Agent的实际效果,而非简单复述其宣传内容。

  2. MiniMax Agent在2026年5月更名为Mavis,采用Leader-Worker-Verifier的Agent Teams架构。

  3. 实际API测试显示复杂任务效率提升,但简单任务耗时增加3倍且无精度收益。

  4. 需注意Anthropic的模型蒸馏指控、迪士尼版权诉讼及M2.7的许可证限制。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • MiniMax Agent评估
    • 架构变化
      • Agent Teams架构(Leader-Worker-Verifier)
      • 2026年5月更名为Mavis
    • 实测表现
      • 复杂任务效率提升
      • 简单任务耗时增加300%
    • 法律风险
      • Anthropic蒸馏指控
      • 迪士尼版权诉讼
      • M2.7许可证限制

金句 / Highlights

值得收藏与分享的关键句。

#AI#机器学习#法律风险#MiniMax#Anthropic
打开原文

MiniMax代理真的让工作更轻松吗? - KDnuggets

publ: 2026年8月3日

  • 博客热门文章
  • 主题 人工智能 职业建议 计算机视觉 数据工程 数据科学 语言模型 机器学习 MLOps 自然语言处理 编程 Python SQL
  • 数据集
  • 活动
  • 资源 快速参考指南 推荐 技术简报
  • 广告

订阅时事通讯

#header end

/ad_wrapper

MiniMax代理真的让工作更轻松吗?

阅读MiniMax自身的架构说明,观察其如何通过真实API执行实际任务。了解在发布文章中未提及的MiniMax技术细节。

作者:Shittu Olumide,技术内容专家 2026年8月3日发布于 人工智能

<div class="addthis_native_toolbox"></div>

# 引言

每个AI实验室最终都会发布一种特定类型的博客文章:工程团队解释新架构存在的原因,承认其代价,并告诉你何时不应该使用它。大多数这类文章读起来就像穿着实验室外套的营销文案。MiniMax于2026年5月27日发布了这样一篇文章,其价值值得通过实际测试而非简单总结来验证。

本文要回答的问题不是"MiniMax的模型表现如何?"。这是一个基准问题,答案相当乏味(是的,在纸面上具有竞争力)。真正的问题是:将该模型封装进代理产品中,是否真的改变了工作完成的方式,还是仅仅将同样的工作量转移到了更隐蔽的地方?为了解答这个问题,本文将把MiniMax自身的架构文章视为一个待验证的主张而非需要重复的事实,通过真实API执行实际任务,并列出那些完全未出现在发布文章中的MiniMax技术细节。

实践部分的前提条件:

  • Python 3.10或更新版本
  • MiniMax API密钥
  • pip install anthropic python-dotenv

MiniMax的API直接使用Anthropic消息格式,因此如果你之前使用过Claude的SDK,这会立即显得非常熟悉。

# TL;DR

MiniMax代理于2026年5月更名为Mavis,并围绕"代理团队"(包含Leader、Worker和Verifier)重新构建,通过拆分任务而非单一模型独立完成所有工作。MiniMax自身工程文章罕见地坦承,这种架构仅在长期可验证任务中才具有优势,其引用的研究表明,非结构化多代理协作在简单任务中可能消耗超过三倍的token却无准确率提升。对API的实际测试验证了这一点:价值确实存在但具有条件性。此外,评估该产品用于生产环境的团队需要了解Anthropic对MiniMax的蒸馏指控、迪士尼/环球/华纳兄弟对其视频产品的版权诉讼,以及M2.7的静默许可证限制。

# 当前MiniMax代理的真实情况

在评估任何内容之前,有必要澄清发生了哪些变化,因为目前网络上关于"MiniMax代理"的很多描述实际上已经不再适用。MiniMax于2025年年中首次公开推出该代理,作为处理长期多步骤任务的通用助手,据同一发布文章称,该工具在内部使用两个月后,已成为超过半数MiniMax团队的日常工具。

2026年5月27日,MiniMax发布了他们称之为全面升级的版本,并为其赋予了新名称:Mavis,意为"MiniMax as a Jarvis"。核心变化并非模型规模的扩大,而是引入了名为Agent Teams的新运行方式。通过该方式,桌面应用可以并行运行多个具有不同角色的代理,共同协作完成单一任务,而非由单一模型按顺序处理所有操作。在同次更新中,MiniMax将TokenPlan和Agent Plan订阅服务合并为统一方案,该方案通过单一密钥和共享信用池,覆盖命令行界面(CLI)、API和Agent产品。

在进入代码部分前需了解模型授权的转变:MiniMax-M2和M2.5在宽松许可证下作为完全开放权重模型发布,但M2.7打破了这一模式。MiniMax在Hugging Face上发布了M2.7的权重,随后不久悄然更新了商业条款,要求商业使用需书面授权,而研究和个人使用仍保持免费。最新模型M3是本文代码所针对的目标模型,其引入了MiniMax自研的稀疏注意力架构,支持高达100万token的上下文窗口,并原生支持多模态输入。

# 支撑该主张的架构

MiniMax的工程博客开篇坦诚承认:单一代理端到端处理复杂任务,在他们看来既是裁判也是参赛者。该代理既生成输出又检查自身输出,这正是自我批评研究中普遍存在的连贯性问题。他们的解决方案是Agent Teams,围绕三个角色构建:

  • 领导者接收用户目标并转化为任务结构,首先判断任务是否值得拆分。执行者负责具体子任务,不同执行者根据任务性质获得不同工具、不同上下文和不同输出要求。验证者是真正执行核心工作的模块:它检查来源、覆盖范围和风险边界,并可将执行者的输出退回修改。MiniMax将执行者与验证者的关系描述为刻意对抗性的,类似于开发团队和测试团队都希望项目上线,但任何一方都不能成为对方的唯一检查机制。

这种架构并非MiniMax独创。它存在于已有技术生态中,包括OpenAI的Agents SDK(基于交接的顺序处理)、LangGraph(带监督节点的显式工作流图)以及Claude Code的Teams功能(领导者代理分配独立团队成员)。MiniMax博客强调其版本的独特之处在于名为Team Engine的持久状态机,该机制跟踪每个任务从生成、验证到完成的状态,并在验证失败时自动重启生成步骤,而非将多代理协作视为返回单一文本块的单次函数调用。

三个角色框图:领导者、执行者和验证者
三个角色框图:领导者、执行者和验证者

相比"启动几个代理并让它们聊天"的设计,这确实是一个更具防御性的架构。MiniMax的博客特别明确指出,这种价值仅在特定类型的任务中显现——这正是下一章节要测试的内容。

# 对实际使用者而言的实质变化

一个开发者在测试MiniMax Agent时的独立实操体验表明,该模型的价值核心在于减少工作量而非单纯的能力,其设计目标是通过最小化内部摩擦逐步推进任务完成,而非对每个任务都强制进行深度嵌套的规划。这与MiniMax官方博客中阐述的理念几乎完全一致:其定义的“领导者”角色在执行任务前会明确判断是否需要拆分任务,因为修正拼写错误或替换常量等简单操作,由单个代理或普通脚本处理成本更低。

该模型的诚实之处——也是更具实用价值的方面——体现在其坦承Agent Team架构所付出的代价。官方博客明确指出,即便增加更多代理,仍有三项具体成本无法消失。交接成本是指信息在研究代理、写作代理和格式化代理之间传递时需要重新组织,这一过程在token消耗和时间成本上均无法避免。共享成本是让每个代理都能访问共享上下文所需付出的代价,因为每增加一个共享部分,每个工作者在每轮处理中都需要消耗额外的token。聚合成本是最具挑战性的:生成十个并行草稿相对容易,但将它们合并为一份包含一致事实、匹配引用且语气统一的文档却极其困难。

MiniMax还提到了一项名为“共识成本”的发现,研究显示同构模型之间的无结构化多代理辩论,其token消耗量是单个代理修正自身输出的2.1至3.4倍,且准确率没有提升,有时甚至更差。这个数据在本文中具有关键意义,因为这是MiniMax在自身架构博客中引用的权威数据,用以反驳其销售产品类别中“无结构化多代理协作”的原始版本。他们明确得出的结论是:缺乏真实结构的多代理协作只是更昂贵的并发操作,而结构本身正是“领导者-工作者-验证者”分工的核心价值所在。

同一篇博客中还隐藏着一个虽小但非常具体的技术细节值得单独指出:MiniMax将他们观察到的“上下文焦虑”定义为一种真实行为,即一个长期运行的代理会在任务中途暂停并询问用户是否继续,因为随着运行时间延长,模型对任务何时真正完成的判断会变得模糊。这不是基准测试数据,而是他们承认的产品缺陷,这也是他们部分构建Agent Teams的原因——通过快速响应的领导者提前确认计划,再在后台异步执行实际工作,从而绕过这一缺陷。

综合来看,诚实版本的结论比营销版本的表述更为有限:当任务足够长且可验证时,运行领导者、多个工作者和验证者的成本会低于单个代理因偏离目标、停滞或静默输出错误内容而产生的成本,此时工作会变得更高效。但对于简短或简单的任务,这种结构反而更接近纯粹的额外开销。

# 实操体验:通过API构建和运行真实任务

撇开理论不谈,最快判断这些内容的方式是实际通过API发送任务并观察其执行过程。MiniMax的API与Anthropic兼容,这意味着标准的Anthropic Python SDK只需修改基础URL即可使用,这遵循了MiniMax官方的快速入门模式。

搭建项目:

code
mkdir minimax-test && cd minimax-test
python3 -m venv venv
source venv/bin/activate
pip install anthropic python-dotenv

创建一个包含你的密钥和MiniMax的Anthropic兼容端点的.env文件:

code
# .env
ANTHROPIC_API_KEY=your-minimax-key-here
ANTHROPIC_BASE_URL=https://api.minimax.io/anthropic

通过这种方式设置ANTHROPIC_BASE_URL,标准的anthropic.Anthropic()客户端可以自动使用MiniMax的端点,无需其他代码修改。这与OpenCode等工具将MiniMax作为即插即用提供商的实现方式相同。

现在来看脚本本身——一个小型代理循环,用于发送任务、在模型要求时执行工具调用,并精确报告任务消耗的轮次和令牌数量:

/think

code
# run_task.py
import os
import json
from dotenv import load_dotenv
import anthropic

load_dotenv()

client = anthropic.Anthropic()  # 从环境变量中读取 ANTHROPIC_API_KEY 和 ANTHROPIC_BASE_URL

MODEL = "MiniMax-M3"

# 一个简单的工具:字数统计。足以证明实际工具调用正在发生
# 而无需为此测试使用外部服务。
TOOLS = [{
    "name": "count_words",
    "description": "统计文本块中的字数。",
    "input_schema": {
        "type": "object",
        "properties": {"text": {"type": "string"}},
        "required": ["text"],
    },
}]

def count_words(text: str) -> int:
    return len(text.split())

def run_task(task: str, max_turns: int = 6) -> dict:
    """通过模型运行任务,执行其调用的任何工具,并返回一个小的执行报告。"""
    messages = [{"role": "user", "content": task}]
    total_input_tokens = 0
    total_output_tokens = 0
    turns_used = 0

    for turn in range(max_turns):
        turns_used = turn + 1
        response = client.messages.create(
            model=MODEL,
            max_tokens=1024,
            tools=TOOLS,
            messages=messages,
        )

        total_input_tokens += response.usage.input_tokens
        total_output_tokens += response.usage.output_tokens

        # 如果模型没有请求工具,说明已完成,返回答案
        if response.stop_reason != "tool_use":
            final_text = "".join(
                block.text for block in response.content if block.type == "text"
            )
            return {
                "answer": final_text,
                "turns_used": turns_used,
                "input_tokens": total_input_tokens,
                "output_tokens": total_output_tokens,
            }

        # 否则执行工具调用并反馈结果
        messages.append({"role": "assistant", "content": response.content})
        tool_results = []
        for block in response.content:
            if block.type == "tool_use" and block.name == "count_words":
                result = count_words(block.input["text"])
                tool_results.append({
                    "type": "tool_result",
                    "tool_use_id": block.id,
                    "content": str(result),
                })
        messages.append({"role": "user", "content": tool_results})

    return {"answer": None, "turns_used": turns_used, "error": "达到最大轮数仍未完成"}

if __name__ == "__main__":
    task = (
        "用两句话描述软件系统中断路器的作用,"
        "然后使用count_words工具告诉我你的描述包含多少个单词。"
    )
    report = run_task(task)
    print(json.dumps(report, indent=2))

这实现了什么:循环会发送任务,并在每次响应后检查 stop_reason。如果它是 tool_use,模型正在请求运行 count_words,因此代码会在本地执行该操作,并将数字结果以 tool_result 块的形式反馈到对话中,然后再请求模型继续。如果是其他任何情况,模型会认为任务已完成,函数会返回答案,并精确说明往返过程消耗了多少轮次和多少个令牌。最后一部分比看起来更重要:轮次计数和令牌总数是“这是否让工作更轻松”的实际可衡量指标,而不是一种感觉。

如何运行:在填写好 .env 文件并激活虚拟环境后,运行 python run_task.py。

关于定价,因为它直接影响“是否值得为更轻松付出代价”的判断:MiniMax-M3 在其标准层级的定价为每百万个输入令牌 0.30 美元,每百万个输出令牌 1.20 美元,目前有促销活动,享受 50% 的折扣,即原价 0.60/2.40 美元的半价。与 Claude Opus 4.6 的每百万个令牌 5 美元和 25 美元相比,输入成本低至原来的 1/17,输出成本低至原来的 1/21。但需要指出的是,如果代理需要更多轮次、更多工具调用或更多重试才能达到相同结果,输入令牌成本较低并不一定意味着整体任务成本更低。

# 结论

综合架构、实际操作和注意事项:MiniMax Agent(现名为 Mavis)确实让特定类别的工作变得更轻松,而这一类别正是 MiniMax 自身所定义的。具有真实验证标准的长期任务、跨多个来源的研究与综合、需要运行测试的编码工作,以及结构清晰的正式文档生成,正是 Leader 分配任务、Workers 并行执行、Verifier 在发布前检查结果的架构真正优于单一代理线性处理任务的场景。

对于简短、低风险且易于验证的任务,同样的架构更接近于负担而非帮助,而 MiniMax 自身引用的“共识成本”研究也直接支持了这一点:没有真实停止条件的非结构化多代理协作只会消耗更多令牌,最终得到相同或更差的答案。对“是否让工作更轻松”的诚实解读是条件性的,而非普遍适用的——这虽然不如一篇发布文章给出的答案令人兴奋,但却是与 MiniMax 自身书面内容最契合的结论。

# 总结

这个故事中最有价值的部分并非多代理架构本身;而是 MiniMax 在设计文档中公开了自身的失败模式,这种做法足够罕见,值得仔细阅读而非草率浏览。在将任务路由到 Agent Teams、Mavis 或任何类似的多代理产品之前,请先问其内部工程师所问的同一个问题:这项任务是否足够长、复杂且可验证,以至于拆分任务并检查结果的成本能够得到补偿?或者一个单一的、范围明确的代理调用,只需运行一次,就能更快、更便宜地完成任务?大多数情况下,这个问题的答案就是你所需的全部评估。

Shittu Olumide 是一名软件工程师和技术作家,热衷于利用前沿技术创作引人入胜的叙事,他注重细节,擅长将复杂概念简化。你也可以在 Twitter 上找到 Shittu。

更多相关内容

/think

  • 5 个 NotebookLM 技巧让您的工作更轻松
  • Python 的 __slots__ 实际上做了什么?
  • Python 的 GIL 结束意味着什么?
  • 什么是数据血统,为什么它很重要?
  • ChatGPT 有潜力成为新的国际象棋特级大师吗?
  • 构建一个真正能培训人员的 AI 驱动学习管理系统

<hr class="grey-line"><br> <div><h3>我们推荐的 5 门免费课程</h3><br> </div>

WordPress 的 Mailchimp v4.13.1 - https://wordpress.org/plugins/mailchimp-for-wp/

/ WordPress 的 Mailchimp 插件

您可以从这里开始编辑。

如果评论已关闭。

<= 上一篇

#content end

<script type="text/javascript">kda_sid_write(kda_sid_n);</script>

最新文章

  • MiniMax Agent 真的能让工作更轻松吗?多智能体 AI 如何节省令牌使用量 KDnuggets 每周回顾:构建并部署您的第一个自主代理 • 7 个仍具重要性的机器学习算法... 构建语音控制的 AI 代理 5 本书将加深您对大型语言模型的理解 与 Claude 设计的初学者指南

热门文章

  • 5 本书将加深您对大型语言模型的理解
  • 7 个适用于 CLI 智能体编程的 Claude 代码最佳替代方案
  • 7 个仍具重要性的机器学习算法
  • Kaggle + Google 的免费 5 天智能体 AI 课程
  • 与 Claude 设计的初学者指南
  • 构建并部署您的第一个自主代理的 7 个步骤
  • 2026 年您应该尝试的 5 个最佳 AI 数据分析工具
  • KimiClaw 是一个有用的工具吗?
  • 每个工程师必须了解的智能体 AI 5 个关键概念
  • 停止使用 If-Else 链:在 Python 中改用注册表模式

#content_wrapper end

© 2026

Guiding Tech Media

|

关于

联系我们

广告合作

隐私政策

服务条款

2026 年 8 月 3 日由 Olumide Shittu 发布

blank

不,谢谢!

/.main_wrapper

<script defer type="text/javascript" src="https://s7.addthis.com/js/300/addthis_widget.js#pubid=gpsaddthis"></script>

noptimize

/noptimize