面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-28

2026年LLM进展回顾:编码代理与沙箱安全成焦点

2026 in LLMs (so far)

AI 编程实践Simon Willison · 2026-09-27

中文翻译 · AI 生成,仅供学习交流

2026 in LLMs(到目前为止)

上周五,我在加州圣何塞的 WeAreDevelopers World Congress North America 大会上做了闭幕主题演讲。我把过去一年的关键趋势串到一起,按时间顺序过了一遍 2026 年发生的所有事情。演讲视频已经上了 YouTube,下面是带注解的幻灯片和配套笔记。这就算是一份带注解的演示稿。

我来快速过一遍 2026 年到目前为止发生的所有事。这一年还没结束呢!

对我来说,2026 年其实在 2025 年 11 月就提前启动了。

11 月发布了两款重要模型,Claude Opus 4.5 和 GPT-5.1。新模型发布一般也就是在前代基础上小幅迭代一下。但隔一阵子会有一次跃升,能力跨过某条看不见的线,原本不太好用的东西突然就行了。这次跨线的是它们的编程智能体(coding agent)。Claude Code 从 2025 年 2 月就有了,Codex 比它年轻一点。这两款新模型配上各自的编程智能体框架之后,从「经常出错」变成「够日常用」。

这几年我一直在拿一道题评估新模型,让它「生成一幅鹈鹕骑自行车的 SVG」。这大概是世界上最蠢的基准了,能从里面学到的很有限。但它对模型来说仍然很难,画鹈鹕难,画自行车难,鹈鹕本来也不会骑车。下面是 11 月时的最高水平。Claude 还是没真正画出一辆自行车来。GPT-5.1 的车架也是一塌糊涂。

同样在 11 月,一个名叫 Warelay 的不起眼的 GitHub 仓库有了第一次提交。等会儿我们还会回到这个仓库。

然后就到了 12 月假期,开发者们各自歇了一阵子,不少人开始摆弄这些新的编程智能体组合……大家逐渐意识到,它们能干的事比之前多了那么多。一月的时候,很多人迫不及待想把这些东西用到实处。

每年我都给自己定一个新年计划,从我记事起就一直是同一件事:保持专注。少接新项目,尽量把手头的事做完。

今年我反了个方向,既然这条路从来没走通过,那就反过来走。我们现在有了编程智能体,看看它们到底能干什么,我想接多少新项目就接多少。(年底你可以再来问我这是不是一个好主意,我手头现在同时转着一大堆盘子。)「更有野心一点」差不多成了今年的主题,因为想摸到这项技术的边界,唯一的办法就是一直往前推,推到它不行为止。

我还上了 Oxide and friends 播客,跟 Bryan Cantrill 和 Adam Leventhal 一起聊了对未来一年(以及三年、六年)的预测。现在回看,我对 LLM 的预测偏保守了。我说「LLM 能写出好代码这件事会变得无可否认」,现在看应该已经到了。我预测我们终于能解决沙箱(sandboxing)问题。我数了一下,这次大会 277 场分会里大概有 40 场都涉及沙箱或智能体安全,至少说明我们在这一块投入很大。我还预测编程智能体安全会出现一次「挑战者号灾难」(译注:Challenger disaster 指 1986 年美国挑战者号航天飞机升空后爆炸的事故,作者借来比喻一场本可预见却未被防范的悲剧)。今年围绕智能体安全的讨论确实多得很,但我具体预测的那种灾难,编程智能体被劫持、造成现实中的经济损失,并没有真的发生。我们还开玩笑说教皇会对 LLM 的经济影响发声。

我还预测新西兰的鸮鹦鹉(Kākāpō)今年会迎来一个超棒的繁殖季。这种鸟生活在新西兰,是不会飞的夜行性鹦鹉。长得有点矮胖,我觉得挺漂亮的,年初的时候全世界只剩 236 只。鸮鹦鹉只在瑞木(Rimu)树大面积结果的年份才繁殖,这种大年已经四年没出现了……但今年瑞木果子看起来长势非常喜人。照片来自 Kimberley Collins。

同样在那次播客上,我们造了个词(全部归功于 Adam),专门形容「那种由 AI 引起的倦怠感,软件工程师因为 AI 什么都能干而变得无精打采」。我们叫它 Deep Blue(译注:Deep Blue 是 IBM 在 1997 年击败国际象棋世界冠军卡斯帕罗夫的计算机,这里借来指代「被 AI 超越后产生的失落感」)。这是贯穿今年的一大主题,这次大会上也有好几位演讲者提到。作为一名软件工程师,我职业生涯里从来没经历过变化这么快、这么剧烈的一年。我今年一直在做的事,就是努力去消化这件事,以及它对我的职业到底意味着。

也是 1 月,我得了自己称之为 AI mania 的毛病。它跟 AI psychosis 不是一回事(译注:AI psychosis 指由 AI 诱发的妄想症状,作者特意做了区分)。得了 AI mania 之后,任何智能体没在帮你干活的时刻,都像是在浪费时间。你睡不着,因为本可以熬夜让智能体多干点活。我的 AI mania 体现在几个荒唐、过度雄心的项目上。我用 Python 写了一个完整的 JavaScript 解释器,靠 vibe coding 的方式从 Fabrice Bellard 的 MicroQuickJS 移植过来。后来又用 Python 写了个 WebAssembly 运行时。这些项目倒还挺有用,因为某种程度上治愈了我的 AI mania……因为写完之后我可以回头看看,问一句「世界真的需要一个 slo