Install
openclaw skills install @gingiris-1031/agent-workflow-playbookAI Agent Workflow & Skill Architecture Guide — turn expert work into measurable, reusable agent systems. Covers workflow discovery, skill decomposition, harness design, evaluation, human escalation, observability, cost control, and multi-agent orchestration. Includes a measured marketing-delivery case: 15 people × 3–4 weeks reduced to one strategist + AI in 5 days. By Gingiris.
openclaw skills install @gingiris-1031/agent-workflow-playbook适用于:把研究、营销、运营、分析、内容生产等高认知任务,改造成可测量、可纠错、可复用的 Agent 工作流。
只有同时满足以下多数条件才进入自动化:
如果任务低频、目标持续变化、没有验收口径,先做人工 SOP,不要先搭多 Agent。
选择 10–30 个近期真实任务,记录人工基线:
| 指标 | 定义 |
|---|---|
| 任务成功率 | 首次交付通过验收的任务数 / 总任务数 |
| 一次通过率 | 无返工即通过的任务数 / 总任务数 |
| 周期 | 从收到完整输入到可交付输出的 elapsed time |
| 人工工时 | 研究、制作、复核、返工所花人时 |
| 单次成本 | 模型、工具、数据和人工复核成本之和 |
| 重试率 | 发生工具重试或整段重做的任务占比 |
| 严重错误率 | 错误发布、错误付款、数据泄露等高风险事件占比 |
没有这张基线表,就只能证明 Agent “能跑”,不能证明工作流变好了。
先画业务链路,再按可验收结果拆 skill:
需求澄清 → 数据获取 → 证据整理 → 分析 → 产出 → 质检 → 人工批准 → 交付 → 反馈沉淀
每个 skill 至少包含:
name: competitor-evidence-pack
input_contract:
required: [product, market, competitors, time_window]
output_contract:
required: [claims, source_urls, captured_at, confidence, unknowns]
tools:
allow: [search, fetch]
deny: [publish, delete, payment]
acceptance:
- every material claim has a source
- source capture time is recorded
- unknown facts are labeled, not guessed
escalate_when:
- authenticated source is inaccessible
- sources conflict on a decision-critical fact
优先做单一职责 skill。只有当步骤间存在清晰依赖时,才增加 orchestrator。
Prompt 只描述一次交互;harness 管理长期运行环境。至少包含五层:
一次失败的正确处理方式不是无限加提示词,而是:记录失败类型 → 判断是数据、工具、推理还是验收问题 → 修改对应层 → 用旧样例集回归。
| 模式 | 适用情况 | 主要风险 |
|---|---|---|
| 顺序 | 后一步严格依赖前一步输出 | 上游错误级联 |
| 并行 | 多个独立来源或方案可同时产生 | 合并冲突、重复成本 |
| 路由 | 不同任务应调用不同专长 | 分类错误 |
| 主管—执行者 | 任务可拆成多个独立子任务 | 主管成为瓶颈 |
| 评审—修订 | 输出有明确 rubric,可迭代改进 | 无界循环、成本失控 |
默认从单 Agent + 多 skill 开始。只有观测数据证明吞吐或专长隔离确实需要并发,才升级为多 Agent。
以下动作默认需要人工批准:
连续任务不要重复索取同一授权;记录授权对象、范围和有效期。权限不足时返回缺失项和恢复路径,不要假装完成。
按四阶段推进:
每次版本变更比较同一批任务的成功率、周期、人工工时、成本和严重错误率。任一安全指标恶化,回滚到上一稳定版本。
来源:Gingiris 飞书会议纪要《AI agent实践落地困境与规模化尝试分析》,2026-05-10。以下是会议中的经验陈述,不是独立审计或随机对照实验。
它支持“把专家判断编码为 skill + harness,可以减少交付周期和边际人工”的判断;它不证明所有行业都能获得相同幅度,也没有披露统一口径下的错误率、模型成本和客户长期留存。因此复用时必须重新建立本团队基线,并补测质量、重试和严重错误率。
每次工作流评审必须交付:
Built by Gingiris. Historical figures are labeled as reported case evidence; do not present them as guaranteed outcomes.