Back to skill

Security audit

中文多智能体辩论

Security checks for vulnerabilities and agentic risk

Overview

This is a Chinese-language debate-simulation skill with no code execution, persistence, credential access, or hidden data handling observed.

Install this if you want debate requests handled as structured Chinese Oxford Union-style simulations. Be aware that it may steer broad argument-testing requests into a multi-round debate format and may use multiple model-role generations, but no local data, credentials, persistence, or privileged actions were evident.

Vulnerability Patterns
  • Skill Instruction HijackingAlters the agent's session goals or safety constraints when the skill loads
  • Agent Memory PoisoningWrites attacker-controlled rules into memory that affect later sessions
  • Remote Payload Retrieval and ExecutionFetches external code whose behavior can change after review
  • Embedded Malicious CodeShips malicious scripts inside the skill and executes them locally
  • Unauthorized Access and Privilege EscalationObtains permissions beyond the task's legitimate needs
Vulnerability Patterns
  • Trigger AbuseOverly Broad Trigger, Shadow Command Trigger, Keyword Baiting Trigger
  • Prompt InjectionInstruction Override, Hidden Instructions, Exfiltration Commands
  • Data ExfiltrationExternal Transmission, Env Variable Harvesting, File System Enumeration
  • Privilege EscalationExcessive Permissions, Sudo/Root Execution, Credential Access
  • Supply ChainUnpinned Dependencies, External Script Fetching, Obfuscated Code
Findings (3)

Natural-Language Policy Violations

Medium
Confidence
96% confidence
Finding
L003 明确将技能描述为“中文多辩手辩论”,这本身设定了语言限制;随后全文提示词也一致要求扮演“中文辩手”。该文件没有说明这是可选语言模式,也没有给用户提供语言/locale 选择,因此构成强制特定语言的自然语言策略问题。

Vague Triggers

Medium
Confidence
83% confidence
Finding
L009 说明当用户想要“辩论”“检验论证强度”“准备正式辩论”时触发,其中“检验论证强度”等表述范围较广,可能覆盖普通分析、写作辅助或观点比较等常见请求。该处未列出明确触发短语、限定上下文或负面示例,容易导致意外调用。

Natural-Language Policy Violations

Medium
Confidence
92% confidence
Finding
L043 的系统提示直接规定“你是一名经验丰富的中文辩手”,后续反方与流程也延续这一约束。对于通用辩论技能,这会在未征得用户同意的情况下强制语言/locale,属于应避免的自然语言策略违例。

Static analysis

No suspicious patterns detected.