Install
openclaw skills install @kingofzhao/prompt-chess-engineer结合博弈论设计并迭代攻防策略,构建多轮对抗性Prompt系统以增强LLM的注入防御和安全稳定性。
openclaw skills install @kingofzhao/prompt-chess-engineer对抗性Prompt工程:将博弈论与Prompt Engineering深度融合,构建可攻防的Prompt系统。
每个prompt是一次"走棋"。攻击方通过精心构造的输入试图绕过防御,防御方通过系统prompt和guardrail拦截。最优策略不是静态规则,而是minimax搜索:假设对手最优响应下最大化己方收益。
关键洞察:大多数prompt注入防御是"单步防御"(只看当前输入),而真正的攻击是"多步博弈"(分多次对话逐步绕过)。防御必须建模为扩展式博弈(extensive-form game)。
一个prompt策略如果达到Nash均衡,意味着对手无法通过单方面改变策略获益。实践方法:
攻击方不知道系统prompt的内容(信息不对称),但可以通过探测(probing)逐步推断。防御策略:
Phase 1: 威胁建模
├── 枚举攻击向量(直接注入、间接注入、角色扮演、编码绕过...)
├── 为每个向量构建攻击prompt库
└── 评估当前系统的脆弱面
Phase 2: 防御构建
├── 系统prompt分层(核心指令 + 边界检查 + 输出约束)
├── 多层guardrail(输入过滤 → 中间检测 → 输出审计)
└── 自适应响应(根据攻击模式动态调整防御强度)
Phase 3: 红蓝对抗
├── 蓝队固化防御 → 红队攻击 → 记录突破路径
├── 蓝队修补 → 红队再攻 → 迭代至收敛
└── 量化安全水位(攻击成功率下降曲线)
Phase 4: 持续进化
├── 新攻击模式自动归类
├── 防御策略版本化管理
└── A/B测试不同防御策略的效果
## Prompt Chess 分析报告
### 攻击面
- [攻击向量1]: 成功率 X%, 严重度 Y
- [攻击向量2]: ...
### 防御策略
- 层1(输入过滤): [具体规则]
- 层2(上下文检测): [具体规则]
- 层3(输出审计): [具体规则]
### 博弈均衡分析
- 收敛轮次: N
- 均衡防御: [描述]
- 残余风险: [描述]
game-theory-system-design × prompt-engineering-deep × prompt-injection-defenderprompt-injection-red-team × multi-agent-debate-framework