面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-12

diva-l/travel-agent-harness 仓库简介

diva-l/travel-agent-harness

Agent 开发GitHub · 2026-09-08

中文翻译暂未生成,以下为原文节选。

系统架构Harness 设计评测结果快速开始项目简介一个可实际使用的出行规划 Agent 系统:用户输入自然语言需求(出发地、目的地、天数、预算、偏好),系统自动完成查天气、搜地点、比车次、算路线的多轮工具调用,产出有证据支撑的逐日行程,并在前端渲染为可交互的地图路线。 与常见的「Prompt + 大模型 API」旅行 Demo 相比,这个项目的不同主要在两点: 自己训练的规划模型。Planner 不是调用商用大模型 API,而是基于 Qwen3-4B 经过SFT → Agentic RL(GRPO) 后训练得到的Voyager-4B:SFT 阶段学习工具调用协议与格式,RL 阶段在真实工具循环里以过程奖励优化规划策略。 Harness 运行时约束。模型不直接面对用户,而是运行在 Harness(运行时约束框架)内:预算上限、Schema 校验、Checkpoint、全量 Trace、人工审批、证据门禁全部由框架强制执行。模型的每一次工具调用都可回溯、可恢复、可从任一检查点分叉复跑。 本仓库包含Harness 内核 + 评测体系 + 产品化前端;模型权重托管在 Hugging Face(fantastic-youki/Voyager-4B),下载与接入见快速开始的模式 B。 系统架构单一执行内核设计:CLI、Web 服务、离线评测三个入口共享同一个AgentRuntime,不另造第二套 Agent 逻辑——页面上每个运行时状态都能回溯到同一套 Runtime 和 SQLite 状态。 用户需求(自然语言) │┌──────────┬──────────┴─────────┐│ CLI │ Web UI │ 离线评测 ← 三个入口,同一内核│ │ Vue 3 + FastAPI/SSE│ evals/ + eval_results/└──────────┴──────────┬─────────┘│AgentRuntime(唯一执行内核) ├─ 协议层 双协议解析,训练分布对齐├─ 预算护栏 4 项硬