AI DAILY / 2026-09-28
system1-agents:System 1决策模型驱动浏览器与机器人
ThinkFlowLab/system1-agents
全文中文翻译 · AI 生成,仅供学习交流
system1-agents
Note:让你的智能体(agent)拥有系统1(System 1)级别的决策模型。可以从一个预构建的智能体开始,也可以自己动手构建。
描述任务。Claude Code 或 Codex 在 Jev、Laya 或 Cua-S1 Nano 上运行一个预构建的智能体,或者构建一个新的。
浏览器使用、计算机使用、机器人(robotics)和游戏,开箱即用。
在得分相同的前提下,最快可达对话模型(chat model)6 倍速度,成本最多节省 25 倍。
Benchmarks
| 场景 | Jev | chat 模型 | 加速比 | Jev 成本 | chat 模型成本 | 倍数 |
|---|---|---|---|---|---|---|
| Browser use (Allrecipes)† | 35.7 s | 138.7 s | 3.89× | $0.091356 | $1.494331 | 16.4× |
| Custom agent(工单路由,30 张工单) | 12.7 s | 65.3 s | 5.14× | $0.000764 | $0.014800 | 19.4× |
| Computer use (Windows Calculator) | 17.2 s | 30.1 s | 1.75× | $0.000447 | $0.003002 | 6.7× |
| Robotics(ALFWorld) | 7.4 s | 25.7 s | 3.47× | $0.000221 | $0.002800* | 12.7× |
| Games(2048,20 步) | 27.1 s | 68.5 s | 2.53× | $0.000447 | $0.006139 | 13.7× |
| Games(Millionaire) | 15.3 s | 21.6 s | 1.41× | $0.000168 | $0.000892 | 5.3× |
| Games(Blackjack) | 2.3 s | 14.7 s | 6.39× | $0.000021 | $0.000531 | 25.3× |† WebVoyager 任务集中的第一个 Allrecipes 任务(He et al., 2024, Apache-2.0,归属见 NOTICE):一份素食千层面,要求评论数超过 100 条、评分 4.5 星及以上、够 6 人份。该行的 chat 模型是通过 OpenRouter 调用的 Claude Fable 5.1;两个模型都要为输入的搜索文本和最终答案付费。
\* 估算值;chat 模型那一轮未记录到费用。
下方的每个回放对应上表中的某一行:左侧是 Jev,右侧是 chat 模型,均按墙上时钟计时。其余的 Allrecipes 任务、较长的游戏,以及 2026-09-23 重跑的 Google Flights 驱动对比,详见 docs/benchmarks.md。
- Browser use:WebVoyager 的 Allrecipes 任务 0,在真实站点上运行