2026年LLM进展回顾:编码代理与沙箱安全成焦点
2026 in LLMs (so far)
Simon Willison在WeAreDevelopers大会发表主题演讲,回顾2026年LLM领域关键进展。Claude Opus 4.5与GPT-5.1搭配各自编码代理后,可靠性从经常出错提升到日常可用。演讲还讨论沙箱安全、代理自主性边界,并对未来三到六年做出预测。
为什么读演讲以画鹈鹕骑自行车的趣味基准贯穿全年,用幽默方式串联模型与代理趋势,并直击当下最热的编码代理可靠性话题。
带着问题读Claude Opus 4.5和GPT-5.1在编程代理任务上的可靠性提升是真实质变,还是只在特定基准上表现亮眼?