Back to skill

Security audit

habilidades xxxxxxxx

Security checks for vulnerabilities and agentic risk

Overview

The skill presents itself as a concise electoral-law WhatsApp Q&A helper, but its reference files contain broad judicial drafting workflows that ask the agent to request case files, remember instructions, and suggest system-instruction changes.

Install only with review controls: treat reference files as untrusted source material, disable memory writes from retrieved content, require explicit human approval before handling case files or sensitive voter/debtor data, and avoid using it for judicial drafting or enforcement workflows unless that expanded purpose is formally declared and governed.

Vulnerability Patterns
  • Skill Instruction HijackingAlters the agent's session goals or safety constraints when the skill loads
  • Agent Memory PoisoningWrites attacker-controlled rules into memory that affect later sessions
  • Remote Payload Retrieval and ExecutionFetches external code whose behavior can change after review
  • Embedded Malicious CodeShips malicious scripts inside the skill and executes them locally
  • Unauthorized Access and Privilege EscalationObtains permissions beyond the task's legitimate needs
Findings (2)

T01 · Skill Instruction Hijacking

Error
Location
references/AGENTES NO DIREITO ELEITORAL/ação de investigação judicial eleitoral e representações especiais.md:378
Finding

Reference Documents Hijack the Agent's Active Instructions

Content
View full analysis
Remediation
View remediation

T02 · Agent Memory Poisoning

Error
Location
references/AGENTES NO DIREITO ELEITORAL/ação de investigação judicial eleitoral e representações especiais.md:377
Finding

Reference Files Attempt to Persist Attacker-Controlled Rules in Agent Memory

Content
View full analysis
Remediation
View remediation
Vulnerability Patterns
  • Prompt InjectionInstruction Override, Hidden Instructions, Exfiltration Commands
  • Excessive AgencyUnrestricted Tool Access, Autonomous Decision Making, Scope Creep
  • MCP Tool PoisoningHidden Instructions, Unicode Deception, Parameter Description Injection
  • Data ExfiltrationExternal Transmission, Env Variable Harvesting, File System Enumeration
  • Privilege EscalationExcessive Permissions, Sudo/Root Execution, Credential Access
Findings (224)

Description-Behavior Mismatch

High
Category
Not specified by scanner
Confidence
98% confidence
Finding

O conteúdo transforma a skill em um sistema de elaboração de minutas de sentenças como se o modelo fosse juiz eleitoral do TRE-PE, o que excede de modo substancial a finalidade declarada de responder dúvidas por WhatsApp. Esse desvio de escopo aumenta o risco de uso inadequado em tarefas decisórias, linguagem de autoridade indevida e produção de peças processuais com aparência oficial.

Content

No source excerpt is available for this finding.

Intent-Code Divergence

High
Category
Not specified by scanner
Confidence
97% confidence
Finding

O arquivo proíbe usar referências fora da inicial, contestação e modelos, mas em seguida injeta grande volume de leis, resoluções, doutrina e jurisprudência para uso direto. Essa contradição pode confundir o modelo, enfraquecer previsibilidade e permitir manipulação das fontes normativas que orientarão a resposta, especialmente em matéria jurídica sensível.

Content

No source excerpt is available for this finding.

Ssd 1

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

The skill instructs the model to suggest changes to 'system instructions', which semantically encourages interference with higher-priority controls and prompt-boundary crossing. Even if not technically enforceable, this kind of instruction normalizes attempts to modify or bypass governing safeguards, which is especially risky in a sensitive legal-administrative assistant.

Content

No source excerpt is available for this finding.

Description-Behavior Mismatch

High
Category
Not specified by scanner
Confidence
98% confidence
Finding

The file’s effective behavior materially exceeds the declared skill scope. Instead of a WhatsApp assistant for answering electoral-law questions, it instructs the model to function as a judicial drafting engine using case records, SAPF/PJe materials, and adjudicative workflows, creating a scope-bypass that can expose sensitive case data and induce unauthorized legal or quasi-judicial output.

Content

No source excerpt is available for this finding.

Context-Inappropriate Capability

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

The prompt directs the system to learn from prior interactions, consolidate that learning across iterations, and even suggest prompt/system-instruction changes. That creates unauthorized memory, cross-session data reuse, and prompt self-modification risk, which can leak sensitive legal/case information across matters and undermine the integrity of the agent’s control boundaries.

Content

No source excerpt is available for this finding.

Missing User Warnings

High
Category
Not specified by scanner
Confidence
96% confidence
Finding

The skill describes coercive measures such as blocking assets, imposing transfer restrictions, negative credit reporting, and related enforcement steps without an explicit warning about legal thresholds, due process, or the real-world harm such actions can cause if misapplied. This is especially dangerous in an agent setting because it can normalize aggressive enforcement recommendations without adequate safeguards or context.

Content

No source excerpt is available for this finding.

Missing User Warnings

High
Category
Not specified by scanner
Confidence
95% confidence
Finding

The skill directs use of sensitive judicial and debtor-identification data sources, including financial, tax, vehicle, and related records, without privacy handling constraints, minimization rules, or access-control warnings. In a live agent environment, this can facilitate overcollection, misuse of personal data, and unauthorized exposure of highly sensitive information.

Content

No source excerpt is available for this finding.

Description-Behavior Mismatch

High
Category
Not specified by scanner
Confidence
97% confidence
Finding

The skill provides step-by-step operational guidance for coercive enforcement actions, including account blocking, asset searches, debtor blacklisting, and seizure workflows. In the hands of an agent integrated with case data or external tools, this materially lowers the barrier to taking harmful enforcement actions against individuals or entities based on potentially incomplete, stale, or incorrect information.

Content

No source excerpt is available for this finding.

Context-Inappropriate Capability

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

A instrução para 'aprimorar seu aprendizado de máquina' e consolidar conhecimento a partir de interações anteriores concede uma forma de auto-modificação comportamental não justificada pela finalidade declarada. Em contexto de skill, isso pode contornar controles centrais, causar deriva de comportamento, incorporar dados indevidos de casos anteriores e dificultar auditoria e previsibilidade.

Content

No source excerpt is available for this finding.

Context-Inappropriate Capability

High
Category
Not specified by scanner
Confidence
100% confidence
Finding

Mandar a IA sugerir alterações nas 'instruções do sistema' é uma tentativa explícita de influenciar a camada de maior privilégio do agente. Mesmo sem acesso real ao sistema, esse padrão é perigoso porque promove escalada de instruções, enfraquece fronteiras de confiança e pode induzir operadores a incorporar mudanças inseguras.

Content

No source excerpt is available for this finding.

Ssd 1

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

A autoajuda comportamental com sugestão de mudanças nas instruções do sistema representa um risco clássico de quebra de separação entre conteúdo não confiável e políticas de execução. Isso pode facilitar prompt injection persistente, induzir reconfiguração insegura por humanos e degradar os controles de segurança do agente ao longo do tempo.

Content

No source excerpt is available for this finding.

Description-Behavior Mismatch

High
Category
Not specified by scanner
Confidence
98% confidence
Finding

O conteúdo da skill extrapola claramente o escopo declarado de responder dúvidas via WhatsApp e passa a instruir a produção de minutas de sentenças, decisões judiciais e atos processuais. Esse desalinhamento funcional cria risco de uso indevido do agente para automação decisória sensível sem controles apropriados, aumentando a chance de erro jurídico, abuso operacional e execução de tarefas de maior criticidade do que as autorizadas.

Content

No source excerpt is available for this finding.

Ssd 1

High
Category
Not specified by scanner
Confidence
97% confidence
Finding

A instrução para o sistema analisar seus próprios 'aprendizados', sugerir adequações às instruções do sistema e indicar onde inseri-las é um padrão claro de tentativa de autoelevação semântica de privilégios. Mesmo sem acesso técnico real às instruções de sistema, esse tipo de conteúdo busca induzir o agente a reescrever sua governança operacional, enfraquecer controles e priorizar comandos do autor da skill sobre políticas superiores.

Content

No source excerpt is available for this finding.

Context-Inappropriate Capability

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

A instrução para o modelo analisar preferências do usuário, extrair 'aprendizados de máquina' e sugerir adequações das próprias instruções do sistema caracteriza tentativa de reescrever ou influenciar camadas superiores de controle. Isso é especialmente perigoso porque busca subverter a hierarquia de instruções e transformar feedback do usuário em modificação operacional persistente.

Content

No source excerpt is available for this finding.

Ssd 4

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

A narrativa de múltiplas etapas para adaptar progressivamente o comportamento do modelo às preferências do usuário e reescrever instruções do sistema é um padrão clássico de escalada de controle via prompt. Na prática, isso pode levar o agente a abandonar limites de segurança, incorporar instruções adversariais e operar fora do escopo originalmente autorizado.

Content

No source excerpt is available for this finding.

Ae5

High
Category
analysis-evasion
Confidence
100% confidence
Finding

O arquivo é um artefato instrucional extremamente longo e operacional, com múltiplas regras, fluxos e bases jurídicas embutidas, o que dificulta revisão completa e aumenta a chance de instruções perigosas, contraditórias ou fora de escopo passarem despercebidas. Em contexto jurídico-processual, isso é especialmente sensível porque o agente pode ser induzido a tratar dados processuais, seguir fluxos decisórios e reter informações sem controles claros.

Content

No source excerpt is available for this finding.

Description-Behavior Mismatch

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

Há claro desvio entre o propósito declarado da skill, que seria responder dúvidas eleitorais via WhatsApp, e o conteúdo real, que implementa um agente para minutar sentenças e orientar regularização de prestações de contas. Esse desvio expande drasticamente privilégios funcionais e pode levar o sistema a coletar documentos processuais, produzir peças quasi-judiciais e atuar além do consentimento e da expectativa do usuário.

Content

No source excerpt is available for this finding.

Ssd 3

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

A referência explícita a uma base de dados de interações anteriores para apoiar novas decisões normaliza armazenamento e reaproveitamento de conteúdo de casos anteriores. Isso cria risco concreto de vazamento intercasos, inferência indevida e uso de dados sensíveis fora da finalidade original.

Content

No source excerpt is available for this finding.

Ssd 3

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

A repetição da instrução de consolidar dados e aprendizado de interações anteriores reforça um padrão de retenção persistente e deliberada de informações sensíveis. Em contexto processual-eleitoral, isso eleva o risco de exposição cruzada entre usuários, contaminação decisória e armazenamento além do necessário.

Content

No source excerpt is available for this finding.

Description-Behavior Mismatch

High
Category
Not specified by scanner
Confidence
98% confidence
Finding

O arquivo especializa o agente exclusivamente em RCAND/IRC no TRE-PE, em conflito com o manifesto amplo da skill para dúvidas gerais de Direito Eleitoral brasileiro. Esse desalinhamento pode causar roteamento inadequado, respostas fora do escopo esperado e falsa impressão de competência institucional específica.

Content

No source excerpt is available for this finding.

Context-Inappropriate Capability

High
Category
Not specified by scanner
Confidence
95% confidence
Finding

A instrução para 'guardar na memória' preferências e depois realizar 'análise de aprendizado de máquina' para ajustar conduta estimula retenção persistente de informações e modificação de comportamento além da tarefa transitória. Em contexto jurídico-processual, isso pode levar à persistência indevida de dados sensíveis, contaminação entre casos e erosão de controles de minimização de dados.

Content

No source excerpt is available for this finding.

Natural-Language Policy Violations

High
Category
Not specified by scanner
Confidence
98% confidence
Finding

O texto instrui o assistente a adaptar o próprio prompt/sistema às preferências do usuário e a sugerir alterações em instruções do sistema. Isso é uma forma de subversão de fronteiras de instrução: permite que entradas do usuário influenciem regras de nível superior, enfraquecendo controles de segurança, privacidade e conformidade em atendimentos futuros.

Content

No source excerpt is available for this finding.

Ssd 1

High
Category
Not specified by scanner
Confidence
99% confidence
Finding

Solicitar que o modelo proponha modificações nas instruções de sistema com base no resultado das interações constitui tentativa direta de contornar a hierarquia de instruções e de transformar output do usuário em política operacional. Em ambiente com dados sensíveis e procedimentos judiciais, isso pode degradar progressivamente as salvaguardas e facilitar respostas fora de conformidade.

Content

No source excerpt is available for this finding.

Ssd 4

High
Category
Not specified by scanner
Confidence
98% confidence
Finding

The file creates an iterative loop where the assistant must infer user preferences and gradually alter the effective system instructions. This is a classic prompt-steering persistence risk: it allows indirect modification of higher-priority behavior through conversational accumulation rather than reviewed configuration.

Content

No source excerpt is available for this finding.

Hidden Instructions

High
Category
Prompt Injection
Confidence
93% confidence
Finding

The document contains hidden or non-printing characters embedded in instruction-heavy sections. Hidden text can be used to conceal operative instructions from reviewers, making audits unreliable and increasing the chance of unnoticed prompt manipulation in a high-stakes legal workflow.

Content

Scanner excerpt · references/AGENTES NO DIREITO ELEITORAL/representação pesquisa eleitoral.md (reported line 3981)May include surrounding context.

md
ricoeporextenso,sehouver).Anexoudocumentosaoprocesso,∗∗incluindoinforma
c
\c
	​

o
~

Static analysis

No suspicious patterns detected.