面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-09

前沿模型会推荐什么?AEO 追踪器揭示选择格局与偏差

The Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)

AI 编程实践Latent Space · 2026-09-07

全文中文翻译 · AI 生成,仅供学习交流

前沿 AEO 追踪器:Astra 的选择(以及每个其他前沿模型的选择,以及你能做些什么)

新的预训练(pretrain)对应新的模型类别,这给了我们一次新的机会,去看看各实验室在数据和强化学习(RL)优先级上正在往哪走,也顺便看看初创公司在 AEO(Answer Engine Optimization,面向答案引擎的优化)上的投入有没有开始收到回报。我们做了几份专项分析报告来解读我们的排名,观察到同一实验室在不同代际模型之间出现了一些影响极其深远的「翻转」。

我们为 Opus→Fable 和 Sol→Astra 分别准备了汇总页面。对于部分「翻转」,我们做了一份中立分析,把竞争对手在各自场景下做得更好的地方标了出来。

效率与自信,以及推荐来源

Sol→Astra 和 Opus→Fable 之间最让我们意外的一个发现是,Anthropic 似乎在刻意让自己模型去搜更多来源。Sol 的来源中位数是 9,Astra 是 5,Opus 是 11,Fable 是 15。Astra 整体上明显更「自信」,或者说更「高效」,看你怎么理解。当你对问题做轻度改写时,Astra 改口的概率要低得多。选择随机性下降之后,AEO 本身的价值反而上来了。

来源分析在相当程度上能预测出各实验室到底在重视什么、不重视什么。

不过这里样本量很小,能代表的也只是我们从尝试性工具调用(toolcall)中抓到的内容,不是预训练数据集本身。我们能验证的是,Ora 和 Vercel 衡量的一些 AEO 实践,比如 Markdown 内容协商(markdown content-negotiation),是真实有效的;这些实践一旦失败,模型读你内容的意愿就会下降。

纯属娱乐

以下是各 LLM 眼中全球顶尖的天使投资人(去重工作还没做完……)。查看更多。

我们还做了一个类似 Family Feud(译注:美国一档经典家庭问答竞猜节目)的小游戏,看看你自己的先验判断和数据是不是对得上。挺好玩的!

想一起把这事儿往前推的,或者有商务合作意向,欢迎来聊。可以联系 @latentspacepod,或发邮件至 [email protected]。

(我们现在有商务经理啦!耶!)

方法论那篇文章里也提过,我们真的下了很大力气想把 Gemini/Antigravity、GLM/Zcode 和 DeepSeek/DeepCode 也纳入进来,但报错和速率限制让它们实在没法被放进这第一轮分析里。如果你是这些公司的人,麻烦告诉我们怎么才能把调用额度提上去。

原文配图
原文配图
原文配图
原文配图