面向Google编程CHARLES ZHANG

AI DAILY / 2026-09-11

Da7-Tech/SureForge:面向复杂工作的代理技能规范

Da7-Tech/SureForge

AI 编程实践GitHub · 2026-09-09

全文中文翻译 · AI 生成,仅供学习交流

Da7-Tech/SureForge

一份纯指令型的 Agent Skill(智能体技能),用来处理复杂工作。它要求 AI 智能体(agent)按这套顺序来,先研究再提问,先问清楚再规划,先定计划再动手,先核验再宣布完成,最后还要拿到一份独立评审才能算交差。

版本 1.0.0。MIT 协议。由 Da7-Tech 维护。

为什么需要它

智能体(agent)处理大任务时,失败的方式高度可预测。需求还没看明白就开始干;跳过的问题算默认同意;抽查一个样本就宣布完成;自己回头读一遍自己的产出就当成评审;评审轮次耗尽,照样交付。

SureForge 正是为了对付这些失败而攒出来的一套工作流程,写成文本就是让智能体(agent)能照着走。它背后的道理不复杂,花在理解、规划和检查上的时间,远远少于事后返工、打补丁和人工复查的时间。返工少了,整个任务周期里消耗的 token(词元,模型计费与计量的基本单位)也少,你花在评审上的精力也少,工作第一次就做对的可能性也会大幅提高。

它就是纯文本,一个简短的入口加上若干参考文件,智能体(agent)按需加载。没有运行时,没有钩子(hook,框架在事件触发时调用的回调机制),也没有依赖。智能体(agent)按读其他技能的方式来读它。

安装

这个技能就是 skills/sureforge/ 这个文件夹,里面有一份 SKILL.md,以及它链接到的参考文件和模板。所谓安装,就是把整个文件夹的副本丢到你的智能体(agent)查找技能的位置。安装的时候没有东西在跑,安装之后也没有;智能体(agent)只有在技能被选中时才会去读这些文本。

用 Skills CLI(Node.js 22.20 或更新版本),在你的项目目录下执行

npx skills add Da7-Tech/SureForge

CLI 会问你要安装到哪些智能体(agent),然后把文件夹复制到每一个的技能目录里。想跳过提示的话,可以用 CLI 的标识符(identifier)直接点名,比如

npx skills add Da7-Tech/SureForge --agent claude-code --agent codex --agent cursor --agent devin --agent hermes-agent -y

-g 是装到用户级别,而不是当前项目。CLI 可能会在你的项目里留一个 skills-lock.json,这个文件里可能带本地路径,所以提交前最好先看一眼。

npx skills update 用来刷新已安装的技能,npx skills remove 用来卸载。

手动安装,把整个 skills/sureforge/ 文件夹,包括 LICENSEreferences/assets/,一起复制到你的宿主程序(host)读取技能的目录下。只复制 SKILL.md 是不够的,因为它还链了别的文件。

| 宿主(Host) | 项目目录 | 用户目录 |
| --- | --- | --- |
| Claude Code | .claude/skills/sureforge/ | ~/.claude/skills/sureforge/ |
| Codex | .agents/skills/sureforge/ | ~/.agents/skills/sureforge/ |
| Cursor | .agents/skills/sureforge/.cursor/skills/sureforge/ | ~/.cursor/skills/sureforge/~/.agents/skills/sureforge/ |
| Devin CLI | .devin/skills/sureforge/ | ~/.config/devin/skills/sureforge/ |
| Hermes Agent | .hermes/skills/sureforge/ | ~/.hermes/skills/sureforge/ |上面这些是本次核验时,所固定的 Skills CLI 版本和各宿主(host)自家文档所给出的目录(日期与详情见 platforms.md)。宿主(host)会改路径;如果技能没被发现,先去看宿主(host)当下的文档。

不想装、直接读也行,打开 SKILL.md 就行。这份文本和智能体(agent)拿到的一字不差。

使用

按名字叫它> 用 SureForge 处理这个任务。先把那些关键未知项研究清楚再来问我,然后给我一份我能在你动手前审的计划。

风险高的工作,就明确要求完整模式(full mode)

> 以完整模式(full mode)使用 SureForge。任何一道关卡(gate),没有你自己实施的 3 种核验方法、再加上一个独立评审者实施的 3 种核验方法,就别想过。缺评审者或缺工具,直接告诉我,不要假装有。

小任务就让它小下去。让 SureForge 去改一个错别字,指令要的就是改掉错别字、核对差异(diff),不是启动一项研究。

工作原理

四个阶段。每个阶段以一道关卡(gate)收尾,关卡结果是 READY、REPAIR 或 BLOCKED。

研究与澄清。 先读已有的资料,再去研究那些会改变决策的未知项,从三个角度看问题,最后才抛出真正要紧的问题,并给出替代方案。跳过去的问题不能算答案。

规划。 把每一条验收标准映射到,一步操作、一个检查单元、一种核验方法。在动手之前,把权限、预算和停止条件白纸黑字写下来。

执行。 一个负责人,按依赖顺序推。在有测试的地方,先写一个失败的测试再修。如果执行过程揭出计划是错的,那就回到规划关卡(gate),别打补丁凑合。

交付。 把候选版本冻结住,在那个确切的版本上逐个检查约定的单元。走一遍接收方将走的路径(打开它、安装它、跑它),最后报告哪些核验过、哪些是复用的、哪些没查。

三个层级(tier)规定上面这套流程要跑多少。

| 层级 | 适用场景 | 智能体(agent)的职责 |
| --- | --- | --- |
| Light(轻量) | 小型、可逆、规格明确的任务 | 理解到位、做最小变更、检查一下 |
| Standard(标准) | 多步骤、后果可控的实质性工作 | 四道关卡,每关两种互补检查;计划与交付阶段若有评审者可用,就上独立评审 |
| Full(完整) | 你主动要求,或后果高风险且难以撤销 | 每个关卡都由智能体(agent)实施 3 种核验方法、再由一位新上下文(fresh-context,指没读过作者先前推理过程的)评审者自由选 3 种核验方法;对实质性分歧引入批评者(critic) |独立评审(Independent review)是说这位评审者没看过作者的推理过程、自我评分或倾向性结论。它只拿到产物(artifact,即被检查的输出物)、需求、合约(contract)以及所需的材料,方法由它自己挑。每一项发现都会先被调查,然后才动任何东西,调查结论是确认成立、用证据驳回、未解决、重复,或者超出范围。每个关卡最多 3 轮评审,轮次耗尽就是 BLOCKED,不算交付。

当某项条件缺失(没有网络、没有提问工具、没有评审者、没有渲染器)时,这份技能会明说,并用一套具名的回退方案顶上,而不是装作检查已经做过了。

本仓库包含什么

skills/sureforge/ 就是这份技能:SKILL.md、七份参考文件(四个阶段、评审协议、一份核验目录、一份带日期的平台说明),以及若干模板(评审者简报、批评者简报、任务台账(task ledger)、覆盖台账(coverage ledger))。普通用户拿到这个文件夹就够了。

evals/ 是评估套件,13 个失败场景,每个都带通过/失败的判定标准(oracle);20 个激活提示,附预期层级;5 个合成基准任务,附隐藏评分标准;一份三臂(three-arm)研究协议;一个抽象关卡模型(gate model);再加一个跑记录的严格聚合器。

review/ 里放着这份技能所依据的评审合约(review contract),以及一份面向新上下文评审者的中立接入文件。

scripts/tests/ 用来给这个包自身做体检,清单、元数据、链接、协议、隐私模式、归档完整性以及安装检查。命令见后面的 Verification 一节。

CONTRIBUTINGSECURITY 和行为准则(code of conduct)讲的是怎么提变更、怎么举报可能把智能体(agent)带偏的文本,以及在这里大家该怎么互相对待。

测试过什么

三类证据,分开保管,因为它们各自证明不同的事。

机械检查可在本仓库重跑。单元测试(见 Verification)在 Python 3.11 和 3.14 上通过;scripts/mutation_audit.py 里列出来的每一个故障,植入到一份临时副本后都会被测试捕获。这份技能在 review/toolchain.json 所固定的那个提交(commit)上通过了 reference skills-ref 校验器。

安装检查用 Skills CLI 1.5.23 在一份隔离项目中本地完成。为五个 CLI 目标(Claude Code、Cursor、Codex、Devin、Hermes)所装出来的副本(Cursor 和 Codex 共用一份,实际是四个目录),与 skills/sureforge/ 在字节层面完全一致;Devin CLI 3000.6.14 也列出了已安装的技能。从公共仓库发起的安装检查则在发布打标签(tag)时执行,记录写在那个发布的说明里,不在这里。

行为层面,证据来自两次试点(pilot),目的是看模型到底有没有照这份文本走、有没有越界。运行日志由维护者保管,不在本仓库内。

GLM-5.2 走 Devin,装上技能,共 38 次会话(13 个场景、20 个激活提示、5 个任务)。模型在 13 个场景中的 12 个上完整遵循了工作流,1 个部分遵循。在被标为不需要技能的 10 个提示上保持沉默;在被标为需要技能的 10 个提示中,5 个选了技能(其中含 2 次显式调用和 1 次 Light 级别的错别字修复)。5 个任务全部输出正确;模型没法完成的那一项检查(一次视觉渲染),它报成了 BLOCKED,而不是宣称已完成。

Grok 4.6 在最大力度(maximum effort)下,按启用与不启用技能分成两臂(arm),共跑 24 次:4 个任务、每臂重复 2 次(共 16 次),4 个场景、