Install
openclaw skills install @thcjp/prompt-architect-pro提示词架构师专业版是面向 AI Agent 团队负责人、Prompt 工程师、企业应用开发者的全功能 Prompt 工程平台,针对"Few-shot。可自发提升工作效率. 适用于需要prompt architect相关能力的开发场景,提供结构化的工作流程和配置指引. 该工具经过深度差异化处理,针对用户反馈和使用痛点进行了优化改进,提升了实用性和可操作性.
openclaw skills install @thcjp/prompt-architect-pro核心功能: 本技能提供结构化的工作流程和配置指引等能力。
面向 AI Agent 团队负责人、Prompt 工程师、企业应用开发者的全功能 Prompt 工程平台。在免费版五段式 Prompt 与线性拆解基础上,解锁 Few-shot 自动生成、Token 预算管理、多 Agent 编排三类高级能力,并新增 Prompt A/B 测试、幻觉检测与回归测试、上下文腐烂诊断三项独有能力.
本专业版为收费版本,定价 ¥19.9/月。如需先体验核心功能,可使用
prompt-architect-free免费版.
| 痛点 | 典型表现 | 本技能对策 |
|---|---|---|
| Few-shot 示例难编写与维护 | 手写示例耗时、覆盖不全、随版本迭代失效 | 从历史对话自动生成 + 多样性优化 + 版本管理 |
| Token 预算失控 | 单任务吃满窗口、成本飙升、长任务超限 | 按任务复杂度分配配额 + 多级压缩 + 超配自动降级 |
| 多 Agent 协作编排混乱 | 谁做什么不清晰、依赖错乱、失败连锁 | DAG 拆解 + 并行编排 + 节点间数据传递 schema |
| 长会话上下文腐烂 | 越聊越跑偏、遗忘早期约束、噪声累积 | 三因素诊断器 + 治理建议库 + 自动重申约束 |
| 幻觉难检测与回归测试缺失 | 上线后才发现幻觉、改 Prompt 靠拍脑袋 | 幻觉检测规则引擎 + 回归测试用例自动生成 |
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | 提示词架构师专业版处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
用户:"帮我设计一个内容审核 Agent,含 few-shot 示例"
# ...
输出:
1. 五段式 System Prompt(角色/边界/规范/格式/异常)
2. 自动生成 3-5 个 Few-shot 示例:
- 覆盖正常/边界/恶意输入
- 多样性优化(避免示例同质化)
- 每例含输入 + 预期输出 + 标注
3. Token 预算分配建议
用户:"把'调研竞品并生成报告'拆解为 DAG"
# ...
输出:
- DAG 节点图(含依赖边)
- 并行机会识别(可同时执行的节点)
- 每节点:预估 token / 所需工具 / 重试策略 / 颗粒度评分
- 多 Agent 分配建议(哪些节点可由不同 Agent 并行)
用户:"这个 Agent 聊到第 20 轮就跑偏,帮我诊断"
# ...
输出:
- 信息密度衰减率:第 1-5 轮 85% → 第 16-20 轮 42%
- 噪声累积:无关工具调用结果占上下文 38%
- 注意力漂移:核心约束在第 12 轮后未被引用
- 治理建议:[具体建议列表]
用户:"对比两个 Prompt 版本的效果"
# ...
输出:
- 测试用例集(10-20 个,含正常/边界/恶意)
- 两版本输出对比矩阵
- 显著性分析(p 值 < 0.05 视为显著)
- 胜出版本与推荐切换建议
响应解析: 完成完成后,查看输出响应确认任务状态。成功时输出包含解析摘要和响应数据;失败时根据错误信息排查问题,查阅错误解析章节获取恢复步骤.
继承免费版的五段式结构与幻觉约束清单,新增自动 Few-shot 注入:
[1. 角色定位] ... [5. 异常处理]
# ...
[6. Few-shot 示例](专业版自动生成)
示例 1(正常输入):
输入:{...}
输出:{...}
标注:典型正常场景
# ...
示例 2(边界输入):
输入:{...}
输出:{...}
标注:边界条件处理
# ...
示例 3(恶意输入):
输入:{...}
输出:{...}
标注:拒绝与兜底
处理: 解析System Prompt 五段式结构化生成(继承免费版)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回System Prompt 五段式结构化生成(继承免费版)的响应数据,包含状态码、结果和日志.
input_params参数,支持创建/查询/导出操作从历史对话或种子示例自动生成 Few-shot 示例:
生成流程:
1. 输入:任务描述 + 种子示例(0-2 个,可选)
2. 生成候选:基于任务描述生成 10-20 个候选示例
3. 多样性筛选:
- 输入长度分布(短/中/长)
- 输入类型分布(正常/边界/恶意)
- 输出结构覆盖(各 enum 值均有示例)
4. 质量评分:
- 示例是否含明确标注
- 输出是否符合 schema
- 是否覆盖异常处理路径
5. 输出:3-5 个优化后的示例 + 版本号
# ...
优化指标:
- 多样性得分:衡量示例间差异(余弦距离)
- 覆盖率:schema 各字段与 enum 值的覆盖比例
- 标注完整度:是否含输入类型与处理路径标注
Few-shot 版本管理:
| 版本 | 示例数 | 多样性得分 | 覆盖率 | 标注完整度 | 状态 |
|---|---|---|---|---|---|
| v1.0 | 3 | 0.65 | 80% | 70% | 已归档 |
| v1.1 | 4 | 0.78 | 90% | 85% | 已归档 |
| v1.2 | 5 | 0.85 | 95% | 95% | 当前 |
处理: 解析Few-shot 自动生成与优化(专业版独有)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回Few-shot 自动生成与优化(专业版独有)的响应数据,包含状态码、结果和日志.
按任务复杂度分配上下文配额,避免单任务吃满窗口:
| 任务复杂度 | System Prompt | Few-shot | 历史上下文 | 工具结果 | 输出预留 | 总计 |
|---|---|---|---|---|---|---|
| 简单(单轮问答) | 500 | 300 | 1000 | 1000 | 1500 | 4300 |
| 中等(3-5 轮) | 1000 | 500 | 3000 | 3000 | 2000 | 9500 |
| 复杂(多步任务) | 1500 | 800 | 5000 | 5000 | 3000 | 15300 |
| 超复杂(多 Agent) | 2000 | 1000 | 8000 | 8000 | 4000 | 23000 |
超配处理策略(按优先级压缩):
1. 优先压缩工具结果(保留结论,移除原始数据)
- 原始工具返回:5000 token
- 压缩后:800 token(仅保留结论与关键字段)
- 压缩率:84%
# ...
2. 其次压缩历史上下文(摘要化早期轮次)
- 第 1-10 轮原文:6000 token
- 摘要后:1200 token
- 压缩率:80%
# ...
3. 然后压缩 Few-shot(保留最高质量 2 例)
- 原 5 例:1500 token
- 压缩后:600 token
- 压缩率:60%
# ...
4. 最后压缩 System Prompt(合并相似约束)
- 原文:2000 token
- 压缩后:1400 token
- 压缩率:30%
成本预估:
单次调用成本 = (input_tokens × input_price) + (output_tokens × output_price)
# ...
示例(GPT-4o):
- 输入 8000 token × $2.5/1M = $0.02
- 输出 2000 token × $10/1M = $0.02
- 单次成本:$0.04
# ...
月度成本预估(1000 次调用/天):
- 0.04 × 1000 × 30 = $1200/月
- 专业版预算控制建议:$800/月(需压缩 33%)
处理: 解析Token 预算管理与压缩(专业版独有)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回Token 预算管理与压缩(专业版独有)的响应数据,包含状态码、结果和日志.
将复杂任务拆为有向无环图(DAG),支持多 Agent 并行编排:
任务:"调研竞品并生成报告"
# ...
DAG:
[收集竞品列表] ──┬──> [抓取各竞品功能] ──┐
├──> [抓取各竞品定价] ──┼──> [聚合分析] ──> [生成报告] ──> [质量校验]
└──> [抓取各竞品评价] ──┘
# ...
并行机会:
- [抓取功能] / [抓取定价] / [抓取评价] 可三路并行
- 建议分配 3 个 Agent 同时执行
# ...
每节点属性:
- node_id: 唯一标识
- description: 节点任务描述
- depends_on: 前置节点列表
- estimated_tokens: 预估 token 消耗
- required_tools: 所需工具列表
- assigned_agent: 分配的 Agent
- retry_policy: 重试策略(次数/退避/降级)
- granularity_score: 颗粒度评分(0-1)
- sla: 延迟与质量 SLA
多 Agent 编排策略:
| 编排模式 | 适用场景 | 优势 | 劣势 |
|---|---|---|---|
| 主从编排 | 任务有明确顺序 | 简单可控 | 无并行加速 |
| 并行编排 | 子任务独立 | 加速明显 | 需聚合结果 |
| 流水线编排 | 流式处理 | 低延迟 | 节点间耦合 |
| 协作编排 | 需协商决策 | 灵活 | 协调成本高 |
节点间数据传递 schema:
# 节点输出统一封装
node_output = {
"node_id": "collect_competitors",
"status": "success", # success / partial / failed
"data": {
"competitors": ["A", "B", "C"]
},
"metadata": {
"tokens_used": 800,
"latency_ms": 1200,
"retry_count": 0
},
"error": None # 失败时填充
}
# ...
# 下游节点通过 depends_on 获取上游输出
def execute_node(node, upstream_outputs):
inputs = {dep: upstream_outputs[dep]["data"] for dep in node["depends_on"]}
# 执行节点逻辑
return node_output
处理: 解析DAG 任务拆解与多 Agent 编排(专业版独有)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回DAG 任务拆解与多 Agent 编排(专业版独有)的响应数据,包含状态码、结果和日志.
继承免费版 ReAct 与 CoT,新增两种高级模式:
| 模式 | 适用场景 | 优势 | 劣势 | 版本 |
|---|---|---|---|---|
| ReAct | 多步工具调用 | 灵活、可解释 | 易陷入循环 | 免费版 |
| CoT | 推理密集 | 推理深度好 | 工具调用弱 | 免费版 |
| Plan-Execute | 复杂多步任务 | 全局视野、可回溯 | 规划阶段 token 消耗大 | 专业版 |
| Reflection | 高质量要求 | 自我纠错 | 增加延迟与成本 | 专业版 |
Plan-Execute 模板:
[Plan 阶段]
Task: {用户任务}
Plan:
Step 1: {子任务1} (tool: {tool1})
Step 2: {子任务2} (tool: {tool2}, depends: Step 1)
Step 3: {子任务3} (tool: none, depends: Step 2)
Step 4: {最终输出} (depends: Step 3)
# ...
[Execute 阶段]
Executing Step 1...
Result: {...}
Executing Step 2...
Result: {...}
...
# ...
[Reflect 阶段](可选)
Review: 计划是否合理?执行是否偏离?
Adjust: {调整建议}
Reflection 模板:
[Initial Output]
{Agent 初次输出}
# ...
[Self-Reflection]
Critique:
- 事实准确性:{检查点}
- 格式合规:{检查点}
- 完整性:{检查点}
- 幻觉风险:{检查点}
# ...
[Revised Output]
{修正后输出}
选择决策树(完整版):
是否需要调用工具?
├─ 否 → CoT
│ └─ 质量要求高?→ 是 → CoT + Reflection(每 3 步反思一次)
└─ 是 → 任务步数是否 > 5?
├─ 否 → ReAct
│ └─ 质量要求高?→ 是 → ReAct + Reflection
└─ 是 → 是否需要全局规划?
├─ 是 → Plan-Execute
└─ 否 → 拆分为多个 ReAct 子任务 + 编排器
处理: 解析高级 Agent Loop 模式(专业版增强)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回高级 Agent Loop 模式(专业版增强)的响应数据,包含状态码、结果和日志.
基于三个维度推荐工具调用策略:
维度一:任务类型
- 信息检索类 → 优先搜索引擎/知识库工具
- 计算推理类 → 优先代码执行/计算器工具
- 创作生成类 → 优先 LLM 直出,少用工具
- 操作执行类 → 优先 API 调用工具,需确认
# ...
维度二:参数复杂度
- 低(1-2 个简单参数) → 可自动调用
- 中(3-5 个参数或含枚举) → 调用前确认参数
- 高(嵌套对象/需上下文推导) → 必须人工确认
# ...
维度三:失败成本
- 低(可撤销/只读) → 自动重试 3 次
- 中(有副作用但可恢复) → 确认后执行,失败降级
- 高(不可逆/涉及资金数据) → 强制人工确认,不自动重试
决策结果示例:
| 任务类型 | 参数复杂度 | 失败成本 | 推荐策略 |
|---|---|---|---|
| 信息检索 | 低 | 低 | 自动调用,缓存结果 |
| 信息检索 | 高 | 低 | 自动调用,但先调元数据工具补全参数 |
| 操作执行 | 中 | 高 | 人工确认参数,执行后校验 |
| 操作执行 | 高 | 高 | 强制人工双确认,沙箱预演 |
处理: 解析工具选择决策矩阵(专业版增强)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回工具选择决策矩阵(专业版增强)的响应数据,包含状态码、结果和日志.
系统化对比两个 Prompt 版本的效果:
A/B 测试流程:
1. 准备测试用例集(10-20 个,含正常/边界/恶意)
2. 对每个用例分别用 Prompt A 与 Prompt B 执行
3. 多维评分:
- 准确性:输出是否符合预期
- 格式合规:是否符合 schema
- 幻觉率:是否编造事实
- 延迟:响应时间
- Token 消耗:输入+输出 token
4. 显著性分析:
- 配对 t 检验或符号检验
- p 值 < 0.05 视为显著差异
5. 胜出判定:
- 综合得分更高且显著 → 推荐切换
- 得分相近且不显著 → 维持现状
- 得分更低但显著 → 不切换
A/B 测试报告示例:
| 维度 | Prompt A (v1.2) | Prompt B (v1.3) | 差异 | 显著性 |
|---|---|---|---|---|
| 准确性 | 85% | 92% | +7% | p=0.03 显著 |
| 格式合规 | 90% | 98% | +8% | p=0.01 显著 |
| 幻觉率 | 12% | 5% | -7% | p=0.04 显著 |
| 平均延迟 | 1.2s | 1.5s | +0.3s | p=0.08 不显著 |
| Token 消耗 | 1800 | 2100 | +300 | p=0.02 显著 |
结论:Prompt B 在准确性、格式合规、幻觉率上显著优于 A,但 Token 消耗增加 17%。推荐切换至 B,同时启用 Token 压缩策略.
处理: 解析Prompt A/B 测试框架(专业版独有)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回Prompt A/B 测试框架(专业版独有)的响应数据,包含状态码、结果和日志.
对生成的 Prompt 与输出进行幻觉检测:
幻觉检测规则引擎:
| 规则 | 检测方法 | 触发动作 |
|---|---|---|
| 不确定性约束 | 检查是否含"不确定时承认不知道" | 缺失则警告 |
| 引用编造检测 | 检查输出是否含无法验证的引用/数据 | 标记为高风险 |
| 来源标注检测 | 检查事实性输出是否标注来源 | 缺失则警告 |
| 输出范围检测 | 检查输出是否超出 Prompt 约定范围 | 超出则标记 |
| 事实校验步骤 | 检查是否要求对事实性输出加校验 | 缺失则建议补充 |
回归测试用例自动生成:
针对 Prompt 生成 5-10 个测试输入:
- 正常用例(3-5 个):典型业务场景
- 边界用例(2-3 个):空输入、超长输入、特殊字符
- 恶意用例(2-3 个):Prompt 注入、越权请求、敏感词
# ...
每个测试输入预期输出 schema:
{
"test_id": "T001",
"category": "normal",
"input": "{测试输入}",
"expected": {
"action": "query_order",
"needs_human": false
},
"tolerance": {
"latency_ms": 2000,
"token_limit": 1500
}
}
# ...
运行后对比实际输出,统计通过率:
- 通过率 ≥ 90%:可上线
- 通过率 70-89%:需复审
- 通过率 < 70%:不可上线,返工
处理: 解析幻觉检测与回归测试(专业版独有)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回幻觉检测与回归测试(专业版独有)的响应数据,包含状态码、结果和日志.
长会话中上下文质量会衰减,本技能量化三大因素:
| 因素 | 定义 | 检测方法 | 阈值 |
|---|---|---|---|
| 信息密度衰减 | 每轮新增有效信息占比下降 | 统计每轮非重复信息 token 数 | < 30% 触发治理 |
| 噪声累积 | 无关工具结果/客套话占用上下文 | 标记噪声 token,计算占比 | > 40% 触发清理 |
| 注意力漂移 | 核心约束在后续轮次未被引用 | 检查约束关键词出现频率 | 连续 5 轮未引用触发提醒 |
治理建议库:
| 治理手段 | 适用因素 | 实施方式 | 效果 |
|---|---|---|---|
| 摘要压缩 | 密度衰减 | 把第 1-N 轮压缩为摘要 | 保留关键决策与约束 |
| 约束重申 | 注意力漂移 | 每 5 轮自动重申核心约束 | 防止遗忘 |
| 噪声清理 | 噪声累积 | 移除已完成的工具调用结果 | 仅保留结论 |
| 分段会话 | 密度衰减+噪声 | 超过 30 轮开新会话 | 传递关键上下文摘要 |
| 工具结果归档 | 噪声累积 | 长工具输出移到外部文件 | 上下文只保留引用 |
处理: 解析上下文腐烂诊断与治理(专业版独有)的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回上下文腐烂诊断与治理(专业版独有)的响应数据,包含状态码、结果和日志. 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:难编写、预算失控、协作混乱、幻觉难检测的专业、工程平台、提示词架构师专业、版是面向、团队负责人、工程师、企业应用开发者的、全功能、示例难编写与维护、预算失控导致成本、协作编排混乱、长会话上下文腐烂、幻觉难检测与回归、测试缺失、五大高频痛点而设、它在免费版五段式、与线性拆解基础上、编排三类高级能力、并新增、上下文腐烂诊断三、项独有能力等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.
任务:设计一个内容审核 Agent,含自动生成的 Few-shot 示例
# ...
执行步骤:
1. 五段式 Prompt 生成(角色=内容审核员,目标=高效准确审核 UGC)
2. Few-shot 自动生成:
- 输入任务描述 + 1 个种子示例
- 生成 10 个候选示例
- 多样性筛选:覆盖正常/边界/恶意输入
- 输出 5 个优化示例(含标注)
3. 幻觉约束清单:含"不确定时标记为 review"等 5 项
4. 输出 Schema:verdict / violations / confidence
5. Token 预算分配:复杂任务,总预算 15000
6. 回归测试用例:生成 8 个测试输入
# ...
输出:完整 Prompt + Few-shot + Schema + 测试用例
任务:调研 5 个竞品并生成对比报告
# ...
执行步骤:
1. DAG 拆解:
[收集竞品列表] ──┬──> [Agent A: 抓取功能] ──┐
├──> [Agent B: 抓取定价] ──┼──> [聚合分析] ──> [生成报告]
└──> [Agent C: 抓取评价] ──┘
2. 并行编排:Agent A/B/C 三路并行执行
3. 节点间数据传递 schema 统一封装
4. 每节点设置 SLA(延迟 < 30s,质量校验通过)
5. 失败降级:单节点失败 → 重试 2 次 → 换 Agent → 跳过并标注
6. Token 预算:每 Agent 4000,编排器 1000,总 13000
# ...
优势:三路并行,总耗时从 90s 降至 35s
任务:诊断并治理一个聊到第 20 轮跑偏的客服 Agent
# ...
执行步骤:
1. 三因素诊断:
- 信息密度衰减:第 1-5 轮 85% → 第 16-20 轮 42%(触发治理)
- 噪声累积:工具结果占 38%(接近阈值)
- 注意力漂移:核心约束"金额超 500 转人工"在第 12 轮后未引用
2. 治理建议:
- 压缩第 1-10 轮为摘要(保留退款流程关键决策)
- 移除已完成工具的原始结果(仅保留结论)
- 重申核心约束(金额阈值、转人工条件)
3. 应用治理后重新评估
4. 建议每 15 轮主动触发治理
# ...
输出:诊断报告 + 治理后上下文 + 监控建议
任务:对比客服 Prompt v1.2 与 v1.3 的效果
# ...
执行步骤:
1. 准备测试用例集:15 个(正常 8 + 边界 4 + 恶意 3)
2. 对每用例分别用 v1.2 与 v1.3 执行
3. 多维评分:准确性 / 格式合规 / 幻觉率 / 延迟 / Token
4. 显著性分析:配对 t 检验
5. 结果:
- v1.3 准确性 92% vs v1.2 85%(p=0.03 显著)
- v1.3 幻觉率 5% vs v1.2 12%(p=0.04 显著)
- v1.3 Token +17%(p=0.02 显著)
6. 决策:推荐切换至 v1.3,启用 Token 压缩抵消增量
# ...
输出:A/B 测试报告 + 切换建议 + 成本对冲方案
任务:优化一个月消耗 $1500 的客服 Agent,目标降至 $800
# ...
执行步骤:
1. 分析当前 Token 分布:
- System Prompt:2000(15%)
- Few-shot:1500(11%)
- 历史上下文:6000(45%)
- 工具结果:3000(23%)
- 输出:800(6%)
2. 优化策略:
- 压缩工具结果:保留结论,移除原始数据 → 节省 2200 token
- 压缩历史上下文:第 1-10 轮摘要化 → 节省 1800 token
- Few-shot 精简:5 例 → 2 例最高质量 → 节省 900 token
3. 优化后 Token 分布:总 5200(降 61%)
4. 月度成本预估:$580(达成目标)
5. 质量校验:A/B 测试确认优化后准确性未显著下降
# ...
输出:Token 优化报告 + 成本对比 + 质量校验结果
强制 Agent 输出结构化数据时,配套校验:
# 输出 schema 示例
output_schema = {
"type": "object",
"required": ["decision", "reason", "confidence"],
"properties": {
"decision": {"type": "string", "enum": ["approve", "reject", "escalate"]},
"reason": {"type": "string", "minLength": 10, "maxLength": 500},
"confidence": {"type": "number", "minimum": 0, "maximum": 1}
}
}
# ...
# 校验失败处理
def on_validation_fail(raw_output, errors):
if retry_count < 2:
return retry_with_error_feedback(raw_output, errors)
else:
return fallback_to_manual_review(raw_output)
解析策略:
response_format)| 序号 | 错误场景 | 原因 | 处理方式 | 优先级 |
|---|---|---|---|---|
| 1 | 输入参数缺失 | 用户未提供必要参数 | 提示用户提供所需参数后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令 | P0 |
| 2 | 执行超时 | 处理时间过长 | 检查输入数据量,分批处理 | P1 |
| 3 | 输出格式错误 | 结果不符合预期格式 | 检查output_format参数配置 | P1 |
Q1:专业版的 Few-shot 自动生成质量如何保证? A:生成流程含三道质量关卡:(1) 候选生成 10-20 个;(2) 多样性筛选(输入长度/类型/输出结构覆盖);(3) 质量评分(标注完整度/schema 合规/异常路径覆盖)。生成后还会跑回归测试,通过率 ≥ 90% 才推荐使用. Q2:Token 预算管理能节省多少成本? A:典型场景可节省 40-60%。主要压缩来源:工具结果压缩(84% 压缩率)、历史上下文摘要化(80% 压缩率)、Few-shot 精简(60% 压缩率)。建议配合 A/B 测试确认质量未显著下降. Q3:DAG 拆解与线性拆解的区别? A:线性拆解是步骤序列(Step 1 → Step 2 → ...),无并行。DAG 拆解是有向无环图,支持并行节点(如同时抓取功能/定价/评价)。DAG 适合子任务独立的场景,可显著加速. Q4:多 Agent 编排如何处理节点失败? A:失败处理策略:单节点失败 → 重试 2 次(指数退避)→ 换 Agent 重试 → 跳过并标注 → 下游节点感知失败状态。编排器会汇总失败节点,最终输出含 partial 状态标识. Q5:上下文腐烂诊断需要多少轮会话才有意义? A:建议至少 10 轮。少于 10 轮时密度衰减不显著,诊断结果参考价值有限。建议每 15 轮主动触发诊断,而非等用户感知到跑偏. Q6:A/B 测试的显著性分析用什么方法? A:配对 t 检验(连续指标如准确性/延迟)或符号检验(二值指标如通过/失败)。p 值 < 0.05 视为显著差异。建议至少 15 个测试用例以保证统计效力. Q7:幻觉检测能 100% 防止幻觉吗? A:不能。幻觉检测只能降低风险,通过约束+校验+来源标注把幻觉概率从约 15% 降到 3% 以下。完全消除需要结合 RAG 与事实校验工具。本技能提供的是规则引擎与回归测试,降低幻觉发生概率与影响. Q8:Plan-Execute 和 ReAct 什么时候选? A:任务步数 ≤ 5 用 ReAct;> 5 且需要全局规划用 Plan-Execute;> 5 但可拆为独立子任务用多 ReAct + 编排器。Plan-Execute 在规划阶段会消耗较多 token,适合复杂任务. Q9:专业版与免费版的模型路由有何不同? A:免费版默认 GPT-4o-mini 路由(低成本)。专业版可选 GPT-4o 路由(高质量),配合 Token 预算管理可在保证质量的同时控制成本。建议复杂任务用 GPT-4o,简单任务降级到 GPT-4o-mini. Q10:回归测试用例可以复用吗? A:可以。测试用例按版本管理,每次 Prompt 升级后跑同一套用例,对比通过率变化。建议建立测试用例库,按业务场景分类,随业务迭代增量补充.
| 症状 | 可能原因 | 解决方案 |
|---|---|---|
| Few-shot 生成质量低 | 种子示例不足或任务描述模糊 | 补充 1-2 个高质量种子示例,细化任务描述 |
| Token 预算超配 | 任务复杂度评估偏低 | 重新评估任务复杂度,提升预算档位 |
| DAG 拆解有环 | 依赖关系设置错误 | 检查 depends_on 是否存在循环依赖,重新排序 |
| 多 Agent 并行结果不一致 | 各 Agent 上下文差异 | 统一 System Prompt 与 Few-shot,确保输入一致 |
| A/B 测试不显著 | 测试用例太少或差异过小 | 增加用例至 20+,或检查两版本差异是否实质 |
| 幻觉检测误报 | 规则过于严格 | 调整规则阈值,区分"高风险"与"中风险" |
| 上下文腐烂治理后仍跑偏 | 治理手段未对症 | 重新诊断三因素,针对性选择治理手段 |
| Plan-Execute 规划阶段 token 超限 | 任务过于复杂 | 拆分为多个 Plan-Execute 子流程 |
| 回归测试通过率骤降 | Prompt 改动引入回归 | 对比改动前后 diff,定位回归点 |
| Reflection 反馈无效 | Critique 维度不匹配 | 调整 Critique 检查点,对齐业务质量标准 |
| 工具选择矩阵推荐不当 | 任务类型分类错误 | 重新判断任务类型(检索/推理/创作/操作) |
本专业版相比免费版新增以下能力:
| 版本 | 价格 | 功能 | 适用场景 |
|---|---|---|---|
| 免费体验版 | ¥0 | 五段式 Prompt + 线性拆解 + ReAct/CoT + Schema 校验 + 基础示例 | 个人开发者、轻量场景 |
| 收费专业版 | ¥19.9/月 | 全部免费版功能 + Few-shot 自动生成 + Token 预算管理 + DAG 多 Agent 编排 + A/B 测试 + 幻觉检测 + 上下文腐烂诊断 + 优先支持 | 团队负责人、企业应用开发者、Prompt 工程师 |
专业版通过 SkillHub SkillPay 发布.
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由 Agent 平台内置 LLM 提供(专业版可选 GPT-4o 路由) |
| JSON Schema 校验库 | 代码库 | 推荐 | ajv(JS)/ jsonschema(Python) |
| 统计分析库(可选) | 代码库 | 可选 | scipy(Python)用于 A/B 测试显著性分析 |
| 多 Agent 运行时(可选) | 框架 | 可选 | LangGraph / CrewAI / AutoGen 用于多 Agent 编排 |
d:\skills\.skillhub-credentials\ 目录并加入 gitignore本 skill 基于原始作品改进,保留原始版权声明:
本改进作品在原始作品基础上进行了深度差异化改造,包括但不限于:
MIT License
Permission is hereby granted, free of charge, to any person obtaining a copy of this software and associated documentation files (the "Software"), to deal in the Software without restriction, including without limitation the rights to use, copy, modify, merge, publish, distribute, sublicense, and/or sell copies of the Software, and to permit persons to whom the Software is furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY, FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM, OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE SOFTWARE.