面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-10

前沿模型AEO追踪:Astra如何挑选答案来源

The Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)

AI 编程实践Latent Space · 2026-09-07

全文中文翻译 · AI 生成,仅供学习交流

前沿 AEO(Answer Engine Optimization)追踪器:Astra 的选择(以及其他所有前沿模型的选择,以及你能做什么)

新一类模型带来了新一轮预训练(pretrain),这正好给我们一个机会,去看看各实验室在数据和强化学习(RL)优先级上的方向,同时验证一下创业公司在 AEO 上的投入到底有没有回报。我们准备了专项报告来分析这些排名,还真看到了一些同一实验室在新老两代模型之间发生的影响深远的选择翻转(flip)。

我们有独立的 Opus→Fable 和 Sol→Astra 摘要页面。对于其中一些翻转,我们用中立视角分析了每种情况下竞品各自胜出的地方。

效率 vs 置信度,以及推荐信源Sol→Astra 与 Opus→Fable 之间最让我们意外的发现之一是,Anthropic 似乎在把自家模型推向检索更多信源的方向(Sol 中位数 9 个,Astra 中位数 5 个,Opus 中位数 11 个,Fable 15 个)。Astra 整体上要「自信」得多,或者换个角度说,要「高效」得多。当你只是轻微改写下问题时,Astra 改变答案的概率远低于其他模型。选择上的随机性一降,AEO 本身的价值反而跟着往上走。

信源分析也在相当程度上预示了各实验室会优先看重什么、不会优先看重什么。

不过这里的样本量很小,且只能反映我们从工具调用(tool calls)尝试中抓取到的内容,而非预训练数据集本身。我们能够验证的是,Ora 和 Vercel 所衡量的 AEO 实践(比如 Markdown 内容协商(markdown content-negotiation))确实存在,而这些实践一旦出问题,模型就不太愿意去读你的内容。

趣味彩蛋下面是 LLM 眼里全球顶级天使投资人(Angels)的名单(去重工作还有些没做完……)。

了解更多我们还做了一款「Family Feud 风格」的小游戏(译注:美国经典电视答题节目,玩家需猜测调查中最受欢迎的答案),你可以看看自己的先验和这些数据是否对得上。挺好玩的!

欢迎进一步提建议或谈商务合作,有兴趣可以联系 Ping@latentspacepod,或者发邮件到 [email protected]。

(我们有专属商务经理啦!耶!)

正如我们在方法论(methodology)一文中所说明的,我们确实非常努力地想把 Gemini/Antigravity、GLM/Zcode 和 DeepSeek/DeepCode 也加进来,但各种错误和速率限制(rate limits)实在让它们没法被纳入这第一轮分析。如果你是来自这些公司的人,请告知我们怎样才能提升调用额度。

原文配图
原文配图
原文配图
原文配图