Latent Space

The Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)

8.5内容质量
The Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)

TL;DR · AI 摘要

Latent Space发布的AEO追踪器揭示了Astra及其他前沿模型在推荐产品时的偏好和偏差,为工程师提供技术选型参考。

核心要点

  • Astra模型推荐时更自信(中位数5个来源),Sol模型搜索源更多(中位数15个)
  • 28个类别存在单一主导产品,但多数类别存在激烈竞争
  • Anthropic模型在推荐时更倾向于搜索更多来源(中位数11个)

结构提纲

按章节快速跳转。

  1. 介绍AEO追踪器的开发背景及研究动机。

  2. 通过6种提示变体在7个模型161个类别中进行测试。

  3. 发现28个类别存在单一主导产品,但多数类别存在激烈竞争。

  4. 分析SolAstraOpusFable模型间的推荐差异。

  5. Astra模型更自信(中位数5个来源),Sol模型搜索源更多(中位数15个)。

  6. 模型偏好差异为AEO投资提供关键参考依据。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AEO追踪器分析
    • 方法论
      • 161个类别测试
    • 结果发现
      • 28个主导类别
      • 133个竞争类别
    • 模型对比
      • Astra vs Sol
      • Opus vs Fable

金句 / Highlights

值得收藏与分享的关键句。

  • Astra模型在推荐时表现出更高的置信度(中位数5个来源),而Sol模型搜索源数量是其3倍(中位数15个)

    第4段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 28个类别存在单一主导产品,但133个类别存在激烈竞争,这些是AEO投资的关键战场

    第5段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Anthropic模型在推荐时更倾向于搜索更多来源(中位数11个),而Astra模型更高效(中位数5个)

    第6段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI模型比较#AEO追踪#技术选型#模型偏好分析
打开原文

前沿AEO追踪器:Astra的选择(以及每个前沿模型的选择,以及你可以如何应对)

我们的第一个Astra项目深入探讨了AEO趋势,这是我们在与创始人和DX领导者交流时最常被提及的话题。

2026年9月7日

我们在AEO上的初步自动研究投资已带来了令人印象深刻的回报率,因此自然需要认真对待这一领域。我们受到《What Claude Code Actually Chooses》的启发,决定根据我们的需求进行扩展和调整。

经过数万亿个token的原型设计、对齐和流水线扩展后,我们推出了潜在空间前沿AEO追踪器。我们的方法扩展了AmplifyingAI的方案,在161个类别中(包括代码代理、AI播客、AI沙盒、托管数据库、ASR模型,甚至包括天使投资人、企业支出和薪资软件等非常规类别)对7个模型进行6种提示变体的测试。

答案提取由Astra完成,并根据专有的AEO评分体系进行评分,该体系对首选项、备选方案和提及内容赋予权重,同时对温和和强烈反对推荐赋予负权重(虽然这种情况很少见,但确实会发生)。考虑到你们的需求,我们还提取了影响代理推荐的最重要引用来源,并进行了顶级失败案例的分析。

基础结果

以下是全球各领域最主导的产品(在各自类别中):

其中有一些熟悉的名字——这自然引发了关于污染的疑问,我们已经进行了检查。由于我们没有隐藏任何内容,每对提示和答案都可以被审查。

然而,偏见确实存在——当模型被要求推荐代码代理时,类似Claude Code的Fable/Opus模型和类似Codex的Sol/Astra模型更倾向于推荐Grok、Cursor和Muse Code,而SWE-1.7则更喜欢Devin。我很好奇原因。你也可以看到其他“软偏见”现象……

尽管如此,也有GPT模型推荐Claude的显著例子,这体现了可取的非偏见行为:

在我们总共的161个类别中,有28个类别在所有被调查的前沿模型中都有一个普遍主导的首选项。

还有大量“势均力敌”的竞争类别以及“始终是气氛组,从不是主心骨”的类别,这些应成为AEO的关键战场。

Sol与Astra,Opus与Fable

新预训练模型为新模型类别带来了新的机会,让我们能够检查实验室在数据和强化学习优先级上的发展方向,并验证初创公司对AEO的投资是否产生回报。我们准备了专门的报告分析我们的排名,观察到同一实验室不同代际模型之间在选择上出现了非常重大的转变。

我们有单独的Opus→Fable和Sol→Astra总结页面。对于某些转变,我们特别突出了对竞争对手在每种情境下表现更优的中立分析。

效率与信心,以及推荐来源

我们在Sol→Astra和Opus→Fable之间的最令人惊讶的发现是,Anthropic似乎正在对其模型进行偏见训练,使其搜索更多来源(Sol的中位数为9个来源,Astra为5个,Opus为11个,Fable为15个)。Astra似乎总体上更加“自信”或“高效”,这取决于你如何看待——当用户对问题进行轻微改写时,Astra改变主意的可能性要小得多。这使得随着选择随机性下降,AEO本身的价值也随之上升。

来源分析也相当强烈地预测了实验室的优先事项与非优先事项。

然而此处的样本量较小,仅能代表我们从尝试的工具调用中抓取到的内容,而非预训练数据集本身。我们可以验证的是,由Ora和Vercel衡量的AEO实践(如markdown内容协商)是真实存在的,而失败案例会阻止模型阅读你的内容。

仅限娱乐

根据LLMs的统计,以下是全球顶尖天使投资人(仍需处理一些重复条目…)。

了解更多

我们还开发了一个类似家族争斗的小游戏,你可以测试自己的先验认知是否与数据一致。很有趣!

我们欢迎进一步建议和商业合作意向,如对该项目感兴趣可联系@latentspacepod或发送邮件至[email protected](我们现在有专职商务经理了!woo!)

如我们在方法论文章中所述,我们确实尝试非常努力地纳入Gemini/Antigravity、GLM/Zcode以及DeepSeek/DeepCode,但由于错误和速率限制,这些模型在首次分析中无法纳入。如果你代表这些公司,请告知我们如何提升调用限制。

上一页