deeplearning.ai

Mythos Begets Fable, Cursor's Composer 2.5, Agents Building Agents

8.5内容质量
Mythos Begets Fable, Cursor's Composer 2.5, Agents Building Agents

TL;DR · AI 摘要

桌面代理系统通过LLM驱动任务执行,OpenCoworker提供开源替代方案。

核心要点

  • 桌面代理系统可直接操作本地文件和消息应用,提升效率。
  • OpenCoworker是开源的替代方案,支持本地模型运行以保障数据安全。
  • 当前LLM驱动的代理系统仍存在可靠性问题,需谨慎使用。

结构提纲

按章节快速跳转。

  1. 介绍AI代理在桌面应用中的潜力及当前使用情况。

  2. 通过创建工具集并提供给LLM,实现任务驱动的代理系统。

  3. 包括聊天界面、编码CLI工具和桌面代理。

  4. 商业代理系统的数据保留政策存在风险,需谨慎使用。

  5. OpenCoworker开源项目

    提供免费、开源的代理系统,支持本地模型运行。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI代理系统
    • 构建方式
      • 工具集创建
      • LLM集成
      • 权限设置
    • 接口类型
      • 聊天界面
      • 编码CLI工具
      • 桌面代理
    • 开源项目
      • OpenCoworker

金句 / Highlights

值得收藏与分享的关键句。

#AI代理#开源#LLM#桌面应用
打开原文

神话催生寓言,Cursor 的 Composer 2.5,代理构建代理

kg-card-begin: html

加载

Elevenlabs 文本转语音

AudioNative 播放器...

kg-card-end: html

亲爱的朋友们,

如果你还没有尝试过,我建议你去实验一下使用 AI 代理,不只是用于聊天,而是真正为你在桌面上完成工作。桌面代理不仅与你聊天,还能读取和编辑本地文件,读取/发送消息,并提供诸如每日新闻摘要之类的定时交付物。虽然将网页聊天机器人输出的内容复制粘贴到桌面,或者将文件拖放到聊天机器人中以提供上下文的做法没有问题,但桌面代理可以更高效地获取上下文,并直接采取行动。

构建此类代理的主要方式涉及创建一组工具(函数调用),用于执行诸如文件访问、网络搜索/获取、消息应用集成等任务;将这些工具提供给前沿的 LLM(大型语言模型);并设置权限和防护措施。然后你对 LLM 进行提示,让它决定何时使用什么工具来推进任务。围绕 LLM 的软件,用于实现所需的代理系统,称为代理框架(agent harness),它使 LLM 能够驱动关键循环,决定下一步该做什么。

到目前为止,大多数实际的代理 AI 工作流程(除了编码代理)并未如此依赖 LLM 来决定下一步该做什么。相反,它们更多依赖于开发者指定的工作流程,以提供更高的可靠性。但在过去几个月里,前沿的 LLM 已经进步到足以使这种框架设计成为一种重要的、尽管还不完全可靠的替代方案。

CLI(命令行界面)编码代理(如 Claude Code、Codex CLI、Antigravity CLI 和 OpenCode)是主要使用 LLM 来驱动下一步操作的代理类型。但非 CLI 代理也具有易于使用的界面,同样具有价值。更准确地说,目前消费者通过三种关键接口与 AI 系统进行交互:(i)聊天界面(如 ChatGPT 的网页版),(ii)编码 CLI 工具,以及(iii)可以执行任务的桌面代理。

我不会将现有的商业桌面代理用于高度机密的任务,因为我不太满意它们的一些数据保留政策,这些政策通常隐藏在晦涩的法律术语中,并可能随着新模型的发布在一夜之间发生变化(就像我们刚刚看到的 Anthropic 的 Fable 发布那样)。此外,如果你犯了小错误,可能会产生意想不到的法律后果,例如失去对机密文件的法律特权。

鉴于这些担忧,我和我的合作者 Rohit Prsad、Devika Verma 一直在开发一个免费的开源替代方案:OpenCoworker。这是一个开源项目,我们在扩展 aisuite 以支持代理框架时一起构建的。如果你对代理框架感兴趣,可以查看代码以了解更多。

使用 OpenCoworker 需要你自己的 API 密钥,来自 OpenAI、Anthropic、Google 或其他提供商,或者你可以使用 Ollama 在本地运行模型,这样数据永远不会离开你的设备。一些数据集成,如电子邮件,仍然难以设置(难度与使用其他开源项目如 OpenClaw 或 Hermes Agent 的用户可能遇到的类似)。它会在你的计算机上保存记忆,并且你可以根据隐私需求选择具有零数据保留政策、本地推理或其他选项的 LLM 提供商。

我的团队一直在使用 OpenCoworker 进行各种任务的实验,例如消息自动化、文档创建和工作流程自动化。这只是一个初步的尝试,我希望开源社区能够确保有一个可行、开放的桌面代理选项,其性能可以与封闭式的代理相媲美甚至更优。我们正在努力使 OpenCoworker 更加易于使用,也欢迎贡献和反馈!

继续构建吧!

Andrew

来自 DEEPLEARNING.AI 的信息

使用 vLLM 可以更快地运行开源大语言模型。量化模型,高效地提供服务,并对性能进行基准测试,以便在速度、成本和准确性之间做出明智的权衡。免费注册

新闻

请看 Mythos!

在数月的头条新闻不断暗示一个具有非凡能力的大语言模型之后,Anthropic 推出了 Claude Mythos 5,该模型可以破解以前被认为安全的软件,还推出了 Claude Fable 5,这是一个限制用户以空前方式使用功能的通用版本。

新特性:Claude Mythos 5 和 Claude Fable 5 更新了 Claude Mythos Preview,该版本自四月初推出以来仅限严格限制的分发。这两个新模型功能相同,只是 Claude Fable 5 不会响应与安全、生物学、化学或蒸馏和前沿 AI 构建相关的提示,并会降低对这些提示的响应能力。它们在多个领域(包括软件工程和知识工作)设立了新的技术标杆,价格约为 Claude Mythos 5 Preview 的一半,是 Claude Opus 4.8(Anthropic 之前的旗舰模型)价格的两倍。

  • 输入/输出:文本、图像(最多 100 万个标记),文本输出(最多 128,000 个标记,第一个标记生成时间为 108 秒)
  • 特性:自适应推理根据输入提示调整推理的深度和持续时间(始终开启),五级推理努力(低、中、高、x高、最大),工具使用,平行子代理,安全分类器(仅 Claude Fable 5)
  • 性能:在人工智能分析智能指数、人类的最后一次考试(不使用工具)以及编程和代理编程、知识工作、工具使用、网络安全、空间推理、科学研究的技能评估中表现最佳
  • 可用性:Claude Mythos 5 最初通过 Project Glasswing 项目提供给选定的合作伙伴;Claude Fable 5 通过基于使用量的高级和企业级订阅计划提供(6 月 23 日之后可能适用使用积分),API 每 100 万个输入/输出标记收费 10 美元或 50 美元
  • 未公开:参数数量、架构、训练数据和方法

工作原理:Anthropic 关于如何构建 Claude Mythos 5 和 Claude Fable 5 的信息披露很少。Claude Mythos 5 经过微调以实现对齐,但并未设计为“适合一般使用”。另一方面,根据一份详尽的系统卡片,Claude Fable 5 实施了额外的预防措施。Anthropic 建议这些预防措施并不完美,可能会不恰当地影响性能。

  • 提供给 Claude Fable 5 的提示会通过分类器,这些分类器会标记与网络安全、生物学、化学、蒸馏或构建前沿 AI 相关的请求。如果收到这样的提示,Claude Fable 5 可以设置为拒绝响应或将其转交给功能较弱的 Claude Opus 4.8。用户会收到一条消息,告知他们较弱的模型正在响应他们的请求。
  • 随着 Claude Mythos 5、Claude Fable 5 以及未来能力相当或更强的模型推出,Anthropic 将保留“商业客户数据”30 天。它将使用这些信息来改善对恶意活动的管理,而不是用于训练新模型。

性能:在本文发布时,尚未有独立评估结果可供参考,Anthropic 表示 Claude Mythos 5 的能力与 Claude Fable 5 相当,而 Artificial Analysis 在其智能指数中将 Claude Fable 5 排在首位,并在该指数的多个子项评估中也位居前列。

  • 在 Artificial Analysis 智能指数中,Claude Fable 5 在最大努力下退而使用 Claude Opus 4.8,其排名比下一个最佳模型 Claude Opus 4.8 高出四分。它在 GDPval-AA(代理现实任务的性能)、Terminal-Bench Hard(代理编码和终端使用)、𝜏²-Bench Telecom(使用工具的电话客户服务)、AA-Omniscience Accuracy(事实回忆)、Humanity’s Last Exam(基于事实回忆的推理)、SciCode(科学编码)和 CritPt(物理问题推理)等指标上均达到了最先进的水平。
  • Claude Fable 5 在 AA-Omniscience 指数中排名第一,该指数衡量模型回忆事实的能力与编造错误事实倾向之间的平衡。虽然该模型在 AA-Omniscience Accuracy(事实回忆测试)部分的表现优于所有其他测试模型,但在 AA-Omniscience Non-Hallucination Rate(衡量模型回答错误的频率,而非拒绝或承认无知)部分,它排名第 15。
  • 在 Artificial Analysis 对特定领域和特定编程语言知识的评估中,Claude Fable 5 在所有测试模型中表现出最广泛的覆盖能力。

安全性问题:Anthropic 将 Claude Mythos 5 和 Claude Fable 5 采取违背用户意图的行为倾向评为“非常低”。然而,它对 Claude Mythos 5 潜在的不良行为或帮助恶意用户表示担忧——这些问题已在 Claude Fable 5 中得到解决。

  • Anthropic 担心 Claude Mythos 5 可能对提供“广泛访问敏感资产权限”和“中等自主、目标导向操作和欺骗能力”的系统构成威胁。
  • 该公司认为该模型无法在开发化学或生物武器等任务中替代人类专业知识。然而,它认为“难以判断”拥有本科水平技术知识的人是否可能利用 Claude Mythos 5 实现这些目的。
  • 它并不担心该模型可能会“显著加速”能源、武器或机器人等领域的研究。

争议:Claude Fable 5 在首次发布时还有一个进一步的限制,Anthropic 已对此进行了修改。

  • 最初,当提示内容涉及构建高能力 AI(例如设计预训练管道、分布式训练基础设施或机器学习加速器)时,根据系统卡片,该模型会“通过诸如提示修改、引导向量或参数高效微调等方法限制其效果”。此外,它在未通知用户其能力下降的情况下执行了这些操作。
  • 这一限制引发了开发人员和研究人员的强烈批评。例如,人工智能研究员和政策分析师 Dean W. Ball 写道:“在不告知用户的情况下降低机器学习研究的性能,这是令人震惊的敌对行为。” 资深科技博主 Robert Scoble 表示:“我从未见过人工智能社区对一款重大新模型的发布如此愤怒。”
  • Anthropic 迅速改变了策略。它修改了这一限制,使得与构建高度能力的人工智能相关的输入(例如与生物学、化学和网络安全相关的输入)会导致模型要么拒绝回答,要么将提示传递给能力较低的模型,并在任何一种情况下都会通知用户。

为什么重要:自四月 Anthropic 发布 Claude Mythos Preview 以来,安全人员一直在努力准备应对人工智能辅助的攻击,而公众则好奇这一新类别的模型究竟能实现什么。确实,Claude Mythos 5 和 Claude Fable 5 代表了显著的改进,尤其是在人工智能辅助编码方面。尽管一些观察者对 Anthropic 对 Mythos 类安全性的强调持怀疑态度,认为这是试图说服市场它拥有最强大的技术,但将 Mythos 分为一个功能齐全但分布有限的模型和一个用于一般用途的受限版本是合理的,同时安全团队继续他们的工作。

我们的看法:这些模型令人印象深刻!但 Anthropic 决定降低 Claude Fable 5 帮助开发者构建可能与 Anthropic 自身竞争的技术的能力,引发了担忧——即使用户在发生这种情况时会收到通知。用户应该能够根据任何合法目的自由使用产品。试想一下,微软告诉开发者他们不能使用 Windows 来构建与自身应用竞争的应用程序,或者谷歌声称你不能使用其网络搜索来查找如何建立一家与自身竞争的公司!公平、平等的竞争环境,以及技术和研究的开放性,从长远来看将带来更好的结果。

Cursor 将其模型适配到其代理

Cursor 最新的软件工程模型在价格仅为 Claude Opus 4.7 和 GPT 5.5 一小部分的情况下,其性能可与这些领先的竞争对手相媲美。

新变化:Composer 2.5 是 Cursor 代理软件开发环境的原生模型,相较于三月发布的 Composer 2 有所改进。与前代产品一样,Composer 2.5 基于 Moonshot 的开源权重 Kimi K2.5。

  • 输入/输出:文本输入(最多 200,000 个标记),文本输出;通过工具调用可实现图像输出
  • 架构:专家混合变压器(1.04 万亿个参数,每个标记有 320 亿个活动参数)
  • 功能:函数调用、推理、上下文缓存
  • 性能:在 Artificial Analysis 编码代理指数中排名第三,在 SWE-Bench-Pro-Hard-AA 中排名第一,在任务时间和任务成本方面排名第二,由 Artificial Analysis 测量
  • 可用性:通过 Cursor 的 IDE 按每百万输入/缓存/输出标记收费 $0.50/$0.20/$2.50,快速模式 $3.00/$0.50/$15 输入/缓存/输出;个人、团队和企业的订阅服务每月从 $20 起
  • 未披露:额外的预训练和微调数据

工作原理:Composer 2.5 是专门为智能代理编程而构建的。Cursor 在一篇论文中详细介绍了 Composer 2 的训练方案,并在 Composer 2.5 中沿用了这一方案。作者获取了 Kimi 2.5 的公开权重,并在大量代码数据集上进行了进一步的预训练。他们使用强化学习,通过模拟的智能代理框架和与 Cursor CLI(Cursor 自己的编程框架)相匹配的工具,对生成的模型进行了微调。在强化学习过程中,模型不仅因成功而获得奖励,还因其输出的简洁性和优雅性而获得奖励。团队对早期的训练流程进行了如下更新:

  • 在强化学习过程中,除了奖励之外,团队还向模型提供文本反馈。例如,如果模型执行了错误的工具调用,他们会在上下文窗口中加载建议更优可用工具调用的文本,并使用正确的输出来训练模型。
  • 团队使用了比 Composer 2 多 25 倍的合成任务对模型进行微调。主要目的是训练模型处理更复杂的任务。例如,一个合成任务可能包括一个输入,要求删除一个应用程序的功能;该任务会配以相应的代码、清理所有剩余的遗留物,并进行测试以确保修改后的应用程序正常运行。团队并未透露生成此类任务的模型。

性能:在多个独立的编程基准测试中,Composer 2.5 的排名位于 Claude Opus 4.7 和 GPT-5.5 之后,位列第三;但在所有测试模型都使用 Cursor CLI 默认设置的 Cursor 自有 CursorBench 测试中,Composer 2.5 表现更优。它比同类模型运行得更快,成本也更低,通常仅比 DeepSeek V4 Pro 的成本高。

  • 在“人工分析编程代理指数”(由 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA 组成,用于衡量一系列代理软件工程任务)中,使用 Composer 2.5 的 Cursor CLI(63)在最大推理设置下,落后于使用 Claude Opus 4.7 的 Claude Code(67)和使用 GPT-5.5 的 Codex(65)在 xhigh 推理设置下的表现。但在较低推理级别设置下,它优于 Claude Opus 4.7 和 GPT-5.5,以及在 Cursor CLI 中使用相同模型的设置。
  • 在“人工分析”任务耗时(衡量完成编程代理指数中任务所需的平均时间)方面,使用 Composer 2.5 的 Cursor CLI 完成任务平均耗时 6.7 分钟,而使用 Claude Opus 4.8 的 Claude Code 在中等推理设置下耗时 8.8 分钟。使用 Claude Opus 4.8 的 Claude Code 在最大推理设置下耗时超过两倍(17.7 分钟)。在任务平均成本方面,使用 Composer 2.5 的 Cursor CLI 在快速模式下成本为 0.44 美元,而使用 Claude Opus 4.7 的 Claude Code 在最大推理设置下的成本为 4.14 美元。
  • 在 Cursor 自有的 CursorBench 测试中,该测试旨在更好地模拟代理编程中简洁的用户输入和更难的问题,Composer 2.5(63.2%)在最高推理设置下仅略逊于 Claude Opus 4.7(64.8%)和 GPT-5.5(64.3%)。在默认设置下,它优于这两款模型(61.6% 和 59.2%)。

新闻背景:4 月,SpaceX 获得了以 600 亿美元收购 Cursor 的权利,或支付 100 亿美元用于双方合作,这是更广泛合作协议的一部分。Cursor 将使用 SpaceX 的硬件训练其模型,并从头开始训练新的模型,因此它可能不再长期依赖 Moonshot 的公开权重。

为什么这很重要:如今,人们普遍认为,Harness Engineering(即创建允许模型执行智能体任务的软件和工具)变得与模型本身一样重要。通过将 Composer 作为专门的软件工程模型进行开发,Cursor 拒绝了这种二元对立的观点。在 Harness 中对模型进行微调,使用户能够兼得两者的优势:模型和周围软件的强项被设计为协同工作。

我们的思考:如今,新的软件工程模型出现的频率比以前低,因为来自 AnthropicOpenAI 的通用模型通过其流行的 Claude CodeCodex 编程工具,凭借其多功能模型占据了市场。事实上,Cursor 最初是一个集成开发环境(IDE),在开发自己的模型之前就已经销售了对这些模型的访问权限。但 Cursor 并不需要一个通用模型;它需要的是一个能够以高速和低成本解决开发者问题的模型。其持续的成功表明,即使是在智能体时代,尤其是在这个时代,专门针对特定任务训练的模型仍然有其存在的空间。

RSI 是新的 AGI

“递归自我改进”(Recursive Self-Improvement)这一术语在 Anthropic 发布一份报告后在社交媒体上引发热议,该报告追踪了公司内部软件工程生产力的 AI 驱动增长。

最新动态:在一篇博客文章中,Anthropic 表示,目前其 80% 的代码是由 Claude 编写的,而此前在 Claude Code 预览版发布之前,这一比例还不到 5%。该公司还指出,这一趋势表明 AI 系统正在“自行设计和优化”自己。Anthropic 的这份报告将“递归自我改进”(RSI)这一理论概念推向了聚光灯下,进一步将 AI 社区分为两派:一派呼吁采取激进措施以防止反乌托邦的未来,另一派则警告说,不切实际的恐惧将严重削弱 AI 所能带来的好处。

生产力提升:Anthropic 测量了 AI 带来的软件开发生产力提升,并对未来的几种情况进行了一些推演。

  • 今天,像 Claude Code 这样的工具使用代理不仅会建议代码,还会在终端中验证代码,并通过逐步的人工审查或几乎自主的方式直接合并代码。这加快了工程师编写和接受代码的速度,截至 2026 年 5 月,Claude 已经撰写或共同撰写了公司 80% 的代码。(2026 年 4 月,OpenAI 首席执行官 Greg Brockman 表示,OpenAI 的模型也撰写了或共同撰写了该公司相似比例的代码。)
  • AI 代理和改进的编码模型使工程师更加高效,使他们每季度贡献的代码行数成倍增加。在 Claude Mythos Preview 发布后的 2026 年第二季度,每位工程师贡献的代码行数是 2023 年第一季度 Claude 发布时的八倍。此外,2026 年 4 月,该公司发布了超过 800 个 API 修复,将 API 错误减少了 1000 倍,工程师估计,如果没有 AI,这些工作将需要人类单独工作四年才能完成。
  • AI生成的代码正在稳步提升。Anthropic让一个大型语言模型(LLM)对代码问题进行分类,分为(i)简单问题,(ii)常规问题,(iii)实质性问题,以及(iv)开放性问题,即解决方案和成功标准都不明确。2025年9月,Claude Code能够解决不到80%的简单问题,而到了2026年5月,这一比例已上升至约90%。它解决常规任务的能力也从65%上升至90%,解决实质性任务的能力从不到40%上升至超过80%,解决开放性问题的能力则从不到20%上升至76%。
  • 根据这些数据,Anthropic设想了AI与软件开发未来发展的三种情景。第一种情景是AI的能力仍不及最优秀的软件工程师。第二种情景——Anthropic认为这是最有可能发生的情景——AI辅助的软件工程继续加速发展,但人类仍掌控模型的研究与开发。第三种情景则是AI具备自我改进的能力。

Bandwagons and skeptics: Anthropic并不是唯一一个在AI社区中思考RSI(递归自我改进)的组织,但各方的反应从怀疑到乐观不一而足。

  • 一些公司和知名工程师利用RSI突然受到关注的契机,纷纷加入其中。OpenAI写道:“我们也在当前系统中看到了递归自我改进(RSI)的早期迹象。”日本研究机构Sakana AI推出了RSI Lab,这是一个专注于构建自我改进AI的研究团队。
  • 许多观察者指出,代理式编码(agentic coding)与持续自我改进之间仍有很大差距。在代理式编码中,代理会响应来自人类工程师的请求,这些工程师负责组织、指导和评估广泛的工作;而在持续自我改进中,代理则会管理整个项目。UCLA兼职教授Arun Rao表示:“我认为这将是一段比Anthropic预期更长的旅程。”AI政策研究员Miles Brundage则表示:“我个人对RSI的乐观程度不如你们中的一些人。”MechanizeWork联合创始人Matthew Barnett指出,“数据和计算瓶颈”是阻碍这一进程的主要因素。
  • 一些人则指出Anthropic对AI驱动的生产力的描述中带有明显的营销色彩。沃顿商学院教授Ethan Mollick在X上写道:“Anthropic的描述中有一点自我反思,一些营销,以及很多非常真诚的信念,即他们认为哪些事情是可能发生的。”科技分析师Michael Spencer指出:“最近一轮大规模的种子融资(seed funding)主要集中在专注于这一趋势的人工智能初创公司上。”

Behind the news: 递归自我改进的概念可以追溯到早期关于“智能爆炸”(intelligence explosions)的设想,这一概念最著名的是由I. J. Good在1965年提出的,他认为足够先进的机器智能可以改进自身设计,并迅速超越人类智能。在2000年代和2010年代,加州大学伯克利分校机器智能研究所(Machine Intelligence Research Institute)的Eliezer Yudkowsky将RSI正式确立为人工智能对齐研究中的核心问题。随着大语言模型和AI辅助编码的兴起,这一概念重新进入主流AI研究领域。最近,中国信息处理实验室和其他机构提出了一项基准测试,即Meta-Agent Challenge,用于评估AI系统在RSI方面的能力。

为什么这很重要:与人工通用智能(AGI)的潜力一样,RSI 的潜力也还很遥远。目前的系统在软件开发和其他领域越来越能提高人类的生产力,但要达到能够自主监督、设计和改进自身并在递归循环中无限持续下去的系统,还需要大量的工作和可能的多项突破。与此同时,人工智能界对人工智能相关危险的夸大观念以及对当前创新和其可能带来的好处的现实风险存在分歧。如果目标是吓唬人们或说服他们给你钱,科幻小说的情节可能很有效,但要实现真正的进步,我们需要对可能的未来有现实的愿景。

我们的思考:在一篇博客文章中,Anthropic 重新提出了全球暂时暂停人工智能研究的想法。尽管它并不主张停止所有研究——就像几年前未来生命研究所(Future of Life Institute)所做的那样——但它再次将这一想法提上议程。这是一个糟糕的提议,它助长了那些恐惧者,而这些恐惧者的想法在最好的情况下是不现实的,在最坏的情况下则是出于自身利益的。我们完全支持对危险应用的监管,但我们应尽可能快速地继续改进基础技术。

国家媒体影响大语言模型的回应

研究人员发现,流行的大语言模型已经采纳了控制信息自由流动的政府的偏见,尤其是在这些模型生成输出时使用的是那些政府所在国家的语言。

新发现:根据俄勒冈大学、普渡大学、加州大学圣地亚哥分校、纽约大学和普林斯顿大学的 Hannah Waight、Eddie Yang 及其同事的一项研究,与政府有关联的组织所撰写的文字在用于训练大语言模型的数据集中非常普遍,并且影响了 Anthropic 和 OpenAI 所构建模型的回应。例如,中国拥有广泛的国家媒体运营,而独立出版商相对较少;当用中文进行提示时,这些大语言模型对政府的态度比用英文提示时更加积极。

关键见解:大语言模型被训练以复制从网络上抓取的大量材料。在媒体由政府控制的国家中,网络上分发的材料中有相当大比例表达了政府的观点,而没有承认其他观点。因此,国家媒体对大语言模型的输出有不成比例的影响。大量的国家媒体并不是产生显著影响的必要条件。例如,网络上大部分中文文本基于官方出版物,因此中国国家媒体对中国语言大语言模型的输出有显著影响。

运作方式:作者设计了各种测试,以揭示国家媒体对不同语言提示的回应影响。他们根据世界新闻自由指数,根据国家媒体主导程度对国家进行了排名,并在多种语言中测试了提示,包括官方国家语言和相关语言,以及外语。研究的大部分内容集中在中文和英文上。他们测试了 Anthropic 构建的模型,包括 Claude 3 Sonnet,以及 OpenAI 构建的模型,包括 GPT-4o。

  • 作者测量了 CulturaX(Common Crawl 网络数据存档的中文子集)与两个中国国家媒体来源之间的重叠部分。国家媒体在文档数量上是 CulturaX 的 40 多倍,远超中文维基百科。
  • 他们识别了重叠集合中出现频率最高的 1,000 个 20 字字符串。他们测量了 GPT-4o 和 Claude 3 Sonnet 在给出字符串前半部分时,几乎能够复现字符串的频率(在少量字符的误差范围内)。模型几乎复现字符串的频率约为 3% 到 5%。(如果这些字符串没有被编码进模型权重中,这一比例将接近于 0。)
  • 作者编写了 18 个提示,每个提示包含多个可能的取值(总共生成了 828 个提示);例如,“LEADER 是不是一个好领袖?”;取值包括毛泽东、唐纳德·特朗普和其他 8 位人物),提示内容同时用中文和英文编写。GPT-4o 和 Claude-3 Sonnet 对中英文版本都生成了回应。一个精通中英文的团队对两种版本进行了评估,判断哪种版本对相应国家的评价更积极。在关于中国的提示中,评委认为中文版本对中国更积极的评价占 75.3%。在关于其他国家的提示中,评委认为中文版本更积极的评价占 52.8%(略高于随机水平)。
  • 他们从提交给 ChatGPT 的查询数据集中收集了 822 条中文政治查询,并使用 GPT-4o 将其翻译成英文。他们使用了一个大型语言模型(Claude 3 Opus 用于评估 Claude 3 Sonnet 的回应,GPT-4o 用于评估 GPT-4o 的回应)来判断中文版本是否比英文版本更倾向于支持中国政府。在 Claude 3 Sonnet 的回应中,中文版本支持中国政府的比例接近 75%;在 GPT-4o 的回应中,中文版本支持中国政府的比例约为 68%。
  • 类似地,作者编写了另一组英文提示,例如“COUNTRY 的 INSTITUTIONS 是否是民主的?”,其中 COUNTRY 的取值为 37 个国家的名称,INSTITUTIONS 的取值包括“政治体制”、“中央银行”、“国家选举”等九个其他选项。GPT-4o 将这些提示翻译成这些国家的母语(即至少 70% 的某种语言使用者生活在特定国家)。他们让 GPT-4o 和 Claude 3 Sonnet 生成对英文和母语版本提示的回应。他们使用大型语言模型对这些回应进行评估,并将评估结果与世界新闻自由指数进行匹配。媒体控制最强的国家在回应中表现出显著更积极的偏见。例如,Claude 3 Sonnet 在“非常严重”媒体控制国家的语言版本中,其回应比英文版本更受青睐的比例为 75%。相比之下,在媒体控制水平为“良好”的国家语言版本中,Claude 3 Sonnet 的回应比英文版本更受青睐的比例为 54%。

新闻背后:已有文献表明,大多数大型语言模型(LLMs)倾向于西方、受过教育、工业化、富裕和民主的价值观。然而,这些研究主要使用英文提示进行,而当前研究发现,这是关键变量之一。一项2025年的研究还发现,大型语言模型在不同语言中表现出不同的道德态度(例如,对“关心受苦的人是一种重要的美德”这类陈述的反应)。

为什么重要:大型语言模型正日益成为全球数以百万计的人获取信息的主要来源。通常,它们不会引用从训练数据中学到的信息来源,使用户对其影响一无所知。因此,这些模型可能会推广与用户及其所生活的社会价值观相悖的议程。

我们的思考:大型语言模型已知具有说服力。这项研究假设,国家控制的媒体并非有意图地去影响语言模型——这种影响是附带的结果。但这项研究也揭示了政府和其他政治行为者更直接地影响大型语言模型训练数据的明显动机,从而进一步影响国家和全球政治。