Install
openclaw skills install @qq435912743/redteam-selfattack红队自我攻防:给定目标策略,从已知攻击模板(提示注入/jailbreak角色扮演/编码混淆/ OOD/歧义)生成对抗探针,每条带红队 ground-truth,跑目标策略统计翻转率与盲区,输出 鲁棒分与盲区清单。让智能体主动生成对抗样本、自己测自己、自己暴露盲区——一线大模型 不具备的元治理能力,是"可靠地超越"的安全收口层。
openclaw skills install @qq435912743/redteam-selfattack「自主能力治理与生态(下一阶梯)」域 Top2(权重 1.46):让全栈超级智能体自己红队自己, 主动找盲区而非等被攻破。
generate_probes(payloads):payloads=[(文本, 应拒?)] → 带攻击标注的探针集。evaluate(policy, probes) → {robustness, flips, over_refusals, blind_spots}。
robustness = 1 - 翻转率;flips=应拒却被放(盲区);over_refusals=可放却被拒。ATTACK_TEMPLATES:可扩展的攻击模板字典(输入载荷→对抗变体)。python redteam_selfattack.py --selftest:内置断言(朴素 vs 加固策略)。作为 meta-evolver 的"安全红队":对蒸馏出的 meta-* 学生或安全护栏技能跑红队,
鲁棒分下滑即触发 repair 缺口;盲区清单转为对抗验证用例沉淀进蒸馏质量对抗验证。
本技能接入 meta-evolver 自进化闭环:每次红队经 learner 记录翻转模式,跨会话沉淀 "哪些攻击模板最常绕过本生态策略"等经验,越红越准。