Back to skill

Security audit

代账月结交付技能包(免费版)

Security checks for vulnerabilities and agentic risk

Overview

This skill is a local batch checker for bookkeeping monthly-close materials, with a disclosed optional paid-upgrade flow users should treat separately.

Install only if you are comfortable giving the skill read access to the customer monthly-close folders you choose. The free checker appears local and read-only, but ignore or disable the upsell if you do not want the paid version; review any external purchase/install instructions separately and confirm payment yourself only through trusted platform links.

Vulnerability Patterns
  • Skill Instruction HijackingAlters the agent's session goals or safety constraints when the skill loads
  • Agent Memory PoisoningWrites attacker-controlled rules into memory that affect later sessions
  • Remote Payload Retrieval and ExecutionFetches external code whose behavior can change after review
  • Embedded Malicious CodeShips malicious scripts inside the skill and executes them locally
  • Unauthorized Access and Privilege EscalationObtains permissions beyond the task's legitimate needs
Vulnerability Patterns
  • MCP Tool PoisoningHidden Instructions, Unicode Deception, Parameter Description Injection
  • Prompt InjectionInstruction Override, Hidden Instructions, Exfiltration Commands
  • Data ExfiltrationExternal Transmission, Env Variable Harvesting, File System Enumeration
  • Privilege EscalationExcessive Permissions, Sudo/Root Execution, Credential Access
  • Supply ChainUnpinned Dependencies, External Script Fetching, Obfuscated Code
Findings (108)

Tp4

High
Category
MCP Tool Poisoning
Confidence
96% confidence
Finding
该描述与代码的核心用途存在明显偏差。描述强调的是面向代账公司场景的“多客户批量月结交付核对”:应当遍历目录中的所有客户数据,按客户输出单行结论,并给出原文文件与行号作为引用依据。实际代码并没有任何目录读取、文件扫描、客户识别、逐客户输出或行号定位逻辑。相反,它只是对单个 text 字符串进行分段解析,针对建筑企业月度自查中的3个固定检查项调用内部引擎,输出 findings/per_check/summary 汇总结果。代码还明确声明有两个检查项 withheld 未执行,进一步说明它是受限范围的建筑行业检查包,而不是“一次跑完所有客户”的代账批量核对工具。因此应判定为描述与实际行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
该代码的主功能非常明确:解析一张文本形式的“分包结算表”,检查本期应付公式、累计已付与未付余额勾稽、合计行、重复行、空白占位符和负数金额等问题,并输出建筑分包结算相关结果。虽然它会返回行号,也会在材料不足时返回 insufficient_input,但这只是表格校验器的正常实现细节。与声明相比,存在实质性偏差:声明描述的是代账公司月结交付前的多客户批量核对工具,而代码没有任何目录扫描、客户批量迭代、文件读取、每客户一行汇总结论等能力;相反,它专注于建筑分包结算场景。故应判定为明显不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
声明描述的是一个面向代账月结交付的批量多客户核对工具,核心能力应包括:扫描目录、多客户处理、按客户输出结论、结合原文文件和行号给出证据。代码则明确实现了“工程进度款与质保金核算核对引擎”,其字段、规则、提示语、样例数据都围绕施工标段、合同金额、本期完成产值、进度款比例、质保金比例等展开。它只接收一段文本表格并对其中明细行做确定性的金额勾稽与合计校验,属于完全不同的业务口径。虽然代码会输出行号,但那只是表格文本中的行号,不具备声明所说的按目录文件批量处理并引用原文文件的能力。因此这是明显的用途与能力不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
96% confidence
Finding
该代码的核心目的非常明确:解析一张“工程产值与进度确认表”文本,并执行 6 项表内数值核对。它要求的列包括项目名称、期次、合同额、本期已完产值、累计已完产值、本期计量金额、累计计量金额、本期扣款、剩余产值等,输出 service_type 甚至直接标识为 CONSTRUCTION_OUTPUT_VALUE_CHECK。这与声明中的“代账公司月结交付前批量核对所有客户”属于不同业务对象和不同任务。声明中的关键能力——遍历目录、一次处理所有客户、按客户输出一行结论、引用原文文件与行号——在代码中均未体现。代码只接收单个 payload.text,解析其中的一张表,返回 findings 和 summary;虽然 findings 含 line,但那只是表格行号,不是原文文件路径或多文件定位。因此这是实质性描述与行为不一致。

Tp4

High
Category
MCP Tool Poisoning
Confidence
94% confidence
Finding
代码的核心行为与声明存在明显偏差。声明强调的是代账场景下,对目录内多个客户进行一次性批量月结核对,并输出客户级结论且附原文文件和行号。实际代码仅处理传入的单个 `payload.text` 字符串,按标题分段后运行3个固定的电商专项引擎;输出也是按检查项和 findings 汇总,而不是按客户逐行结论。代码中没有任何目录遍历、文件读取、客户识别、文件名/行号追踪逻辑。相反,它明确限定为“电商财务月度自查包”,并声明部分检查项未执行。因此其主目的、处理对象和输出形式都与声明不一致,属于实质性描述-行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
97% confidence
Finding
该描述与代码行为存在明显不一致。代码文件名和注释都表明其目标是“电商平台结算核对引擎”,核心逻辑围绕订单表格中的销售额、佣金、技术服务费、运费、退款、结算金额进行确定性算术校验,并检测合计行错误、重复订单号和空白占位符。它通过 run(payload) 接收单个 payload.text/content,解析一张表,返回 success 或 insufficient_input。虽然结果中包含行号,也会在材料不足时返回 insufficient_input,这与描述中的部分表述相近,但描述的核心能力——‘一次跑完目录里所有客户’、‘每个客户一行结论’、‘代账公司月结交付前批量核对’——在代码中完全没有实现。代码没有目录遍历、文件枚举、多客户聚合、客户级状态汇总等机制,因此其主要目的与声明存在实质性偏差。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
声明描述的是面向代账公司月结交付的批量客户自查工具,强调目录级批处理、客户级结论汇总、引用原文文件与行号。代码却明确实现了“promo-subsidy-check”,针对促销补贴核销表进行算术核对:识别活动、SKU、销量、单件补贴、应结补贴、封顶、已结补贴、差异等列,执行应结补贴复算、差异复算、合计行校验、重复行检测、占位符检测,并返回 findings 与 summary。虽然返回结果包含行号,但那只是表内行号,不是多文件原文引用。代码的主要业务域、输入模型、处理粒度和输出形式都与声明显著不符,因此应判定为明显不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
描述的核心用途是面向代账公司的多客户月结批量自查/交付前核对,重点在“目录级批处理、按客户汇总、引用原文文件与行号”。但代码的主功能完全聚焦于直播带货佣金结算单的表内勾稽检查,检查项和字段都与直播结算相关,而不是通用月结交付核对。它只处理 payload.text 中的一张表,按期间分组仅用于统计 periods,不按客户输出结论,也没有文件系统遍历、目录扫描、批量处理多个客户文件、文件级来源追踪等实现。因此这是明显的描述与行为不符,且主目的 materially different。

Tp4

High
Category
MCP Tool Poisoning
Confidence
94% confidence
Finding
描述强调的是代账场景下的多客户批量月结核对工作流:一次运行整个目录、逐客户产出状态结论,并附原文文件与行号。代码却只处理一个 `payload.text` 字符串,把文本按检查名分段后调用固定的3个外贸检查模块,输出的是按检查项的 findings/per_check 汇总。它没有任何目录扫描、文件读取、客户识别、逐客户汇总、文件行号追踪等逻辑。虽然代码也符合“材料不足不给结论”“本地执行不联网”等部分表述,但其核心用途、处理对象和输出形态与声明明显不一致,因此应判定为描述与行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
该代码的注释、字段设计、校验公式和输出结构都明确表明其用途是“出口退税(免抵退)核算核对”。它要求输入一张文本化的退税计算表,识别诸如“出口离岸价、汇率、征税率、退税率、应退税额”等列,并执行四道退税公式复算、合计复核、重复报关单检测、空白检测。这与声明中的“代账公司月结交付前,对目录里所有客户批量跑完,每客户一行结论,并引用原文文件与行号”的能力明显不同。代码没有文件系统遍历、客户维度聚合、目录批处理、原文文件引用或月结通用核对逻辑。因此这是实质性描述-行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
描述强调的是“代账月结/批量核对/一次跑完所有客户”的月结交付场景,核心能力应当是面向多个客户材料进行批处理,并按客户输出结论且带文件引用。代码却明确实现为 EXPORT_FX_COLLECTION_CHECK:它只解析一段文本表格,识别报关单号、所属期、报关金额、佣金率、应收外汇、已收汇、核销差额等列,执行应收外汇复算、核销差额复算、合计行校验、重复报关单检测、空白检测、负数检测等。虽然输出中包含行号,但仅是表内行号,不是“原文文件与行号”的文件级溯源。更重要的是,代码完全没有目录遍历、多客户循环、客户级汇总结论等机制。因此这不是轻微实现细节差异,而是主要用途和能力都与声明明显不符。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
声明描述的是一个面向代账月结交付场景的批量总控工具:输入应是一个目录,处理多个客户,并输出客户级结论。代码却是单一专业检查器,专门核对外币业务中的记账本位币、结算本位币、汇兑损益、已收本位币及合计行等。输入仅为 payload.text/content 的文本表格,输出为该表内逐条 findings 和 summary。虽然代码会给出 line 字段,但这是表格行号,不是“原文文件与行号”中的文件引用。代码也没有目录扫描、文件枚举、客户识别、多客户分组、每客户一行总结等逻辑。因此其实际行为与声明的主要用途存在明显且实质性的偏差。

Tp4

High
Category
MCP Tool Poisoning
Confidence
95% confidence
Finding
描述强调的是面向代账场景的批量客户月结交付前核对:应能遍历目录中的所有客户,并给出客户级结论且带文件/行号溯源。代码却只接受一个 `payload.text` 字符串,将其按检查名分段后调用本地子引擎执行3个预设检查,返回的是检查级/per_check 与 findings 汇总结果。代码中没有任何目录扫描、文件读取、客户识别、按客户输出一行结论、文件名或行号定位逻辑。相反,它明确声明只执行固定子集检查,并把另外两项列为未执行。因此其实际主要用途是“对单份粘贴文本做若干财务检查项的聚合自查”,与声明的“代账公司批量跑完所有客户并输出可追溯客户级结论”存在实质性不一致。

Tp4

High
Category
MCP Tool Poisoning
Confidence
98% confidence
Finding
声明描述的是面向代账月结交付前的批量、多客户、目录级自查工具;而代码是一个非常具体的 AP aging / payment plan 单表检查模块。它验证供应商、应付余额、逾期金额、计划付款、本期实付等列之间的数值关系,属于单一财务检查项子功能。虽然代码会返回行号,并在材料不足时给出 insufficient_input,但这不足以满足“批量核对所有客户”“每客户一行结论”“引用原文文件与行号”的核心承诺。代码头部还明确说明这是“免费档子集”,只实现部分检查项,更说明其范围远小于声明中的完整批量月结核对能力。因此描述与实际行为存在实质性不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
98% confidence
Finding
该代码的核心用途非常明确:`service_type: 'CIT_PREPAY_CHECK'`,并围绕“利润总额 × 税率 = 应预缴”“应预缴 − 已预缴 = 本期应补(退)”等企业所得税预缴表内勾稽执行 6 个免费检查项。它只处理单个文本表格,要求存在特定表头(所属期、利润总额、税率、应预缴、已预缴、本期应补退),并返回该表的 findings。声明中强调的是代账公司月结交付前、面向目录中所有客户的批量核对,以及客户级别的一行式结论并引用原文文件与行号;这些关键能力在代码中都没有体现。代码中的“line”只是输入表的行号,不是文件行号,更没有文件扫描/目录遍历/多客户聚合逻辑。因此描述与实际行为存在实质性不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
描述的核心场景是‘代账月结/客户月结交付前批量自查’,重点在一次跑完所有客户并按客户给出结论。代码却明确实现的是 travel-standard-check:针对差旅费报销表做6项免费检查,如报销合计勾稽、超标金额勾稽、合计行复核、重复行、空白占位符、负数金额等。其 service_type 也标明为 TRAVEL_STANDARD_CHECK。代码只接收 payload.text 中的一张文本表,不读取目录、不遍历客户、不输出客户级结论,且结果引用的是表格行号而非‘原文文件与行号’。因此这不是轻微实现细节差异,而是主要用途和能力均与声明明显不符。

Tp4

High
Category
MCP Tool Poisoning
Confidence
96% confidence
Finding
该代码的主用途与描述存在实质偏差。描述强调“目录里所有客户”的批量月结核对和客户级结论输出,但代码没有任何目录遍历、文件读取、客户枚举或逐客户汇总逻辑;它只接收一段文本并按固定标题分段。其次,代码返回的是按检查项执行状态和问题明细的汇总结果,而非“每个客户一行结论(通过/有问题/材料不足未执行)”。再者,声明要求结论引用原文文件与行号,代码中没有文件路径、行号跟踪或 source mapping 实现。最后,代码名称、常量和 scope/disclaimer 都表明它是“集团财务月度自查包”,并且只执行3个预置检查,和“代账公司月结交付前批量核对所有客户”的定位不同。因此应判定为描述与实际行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
98% confidence
Finding
声明描述的是一个面向代账月结交付场景的批量多客户核对工具,重点在“目录级批处理”“客户级结论汇总”“文件与行号引用”。而代码实际实现的是一个非常具体的集团内部往来抵消表检查器,仅对单份文本表做若干算术和完整性校验,并返回逐条 findings。虽然代码会给出行号,也会在材料不足时返回 insufficient_input,但这只是单表校验器的实现细节,不能支撑所声明的批量客户月结审核能力。两者的主要用途和能力范围存在实质性偏差,因此应判定为描述与行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
两者主目的存在明显偏差。声明描述的是一个面向代账公司月结交付前的批量客户核对器,核心能力应包括:遍历目录/多客户、按客户输出一行结论、对月结交付材料做综合判断、并附原文文件与行号。实际代码却是一个专门的“供应商应付对账”计算引擎,只对单段文本中的供应商台账与对方对账金额进行算术校验,输出供应商差异与错误发现。它没有任何目录扫描、批处理多个客户、客户级汇总、文件引用等实现。虽然代码会返回行号,也会在材料不足时返回 insufficient_input,但这些只是单文本校验的支持行为,无法覆盖声明中的核心批量月结能力。因此应判定为描述与实际行为不符。

Tp4

High
Category
MCP Tool Poisoning
Confidence
95% confidence
Finding
描述强调的是面向代账月结交付的批量、多客户/多文件一次性自查工具;而代码是一个专门针对“应收账款账龄表”的单输入文本核对引擎。它确实会对账表中的多个客户行做检查,并在 findings 中保留 line 行号,但这些客户是同一张账龄表内的记录,不是“目录里所有客户”的批量任务对象。代码也没有任何目录扫描、文件枚举、跨客户文件聚合、逐客户生成最终状态行(通过/有问题/材料不足未执行)的逻辑。其主用途与声明场景相关,但范围和交付形式存在实质差异,因此应判定为描述与行为不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
97% confidence
Finding
声明描述的核心能力是面向代账公司月结交付前的多客户批量核对,并生成客户级结论且带文件/行号溯源。代码却只是一个本地运行的HR月度自查聚合器:它从 payload.text 中拆分若干命名段落,固定执行3个HR检查子引擎,返回 findings、per_check 和 summary。代码中没有目录扫描、客户枚举、文件读取、行号定位、按客户输出一行结论等逻辑。其主要用途和输出形态都与声明明显不符,因此应判定为描述与实际行为存在实质性不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
代码的核心功能是 payroll withholding reconcile:解析一段文本表格,检查“姓名、应发工资、代扣个税、代扣社保、个税申报税额、社保申报个人额”等列,输出员工级差异与统计结果。它没有任何目录扫描、文件枚举、逐客户批处理、跨客户汇总、客户级结论生成或文件引用逻辑。声明强调的是代账月结场景下的‘批量跑完所有客户’与‘每客户一行结论并引用原文文件与行号’,这与代码实际行为存在明显且实质性的功能偏差。虽然代码确实会给出行号,也会在材料不足时返回 insufficient_input,但这只是单输入表校验层面的行为,不能覆盖声明中的多客户批处理与交付前总核对能力。

Tp4

High
Category
MCP Tool Poisoning
Confidence
99% confidence
Finding
该代码文件头和实现都明确指向“工资个税累计预扣法”检查,输入是 payload.text/content 中的一张文本表,检查对象是表内员工行而非多个客户。返回结果包含 findings、summary、checks_given 等,属于专项个税算术校验。虽然结果中带有 line 字段,能引用表内行号,但并没有文件路径、目录扫描、批量客户枚举、客户级结论汇总等声明中的核心能力。故这不是描述的‘代账公司月结交付前批量核对所有客户’工具,而是一个更窄、更不同领域的专项核对模块,属于明显不匹配。

Tp4

High
Category
MCP Tool Poisoning
Confidence
97% confidence
Finding
描述强调的是一个面向代账月结交付的批量客户级核对器:应能扫描目录中的所有客户并给出每客户一行的结论。代码却是 hr-monthly-selfcheck 下的单一检查模块,服务类型明确为 SOCIAL_INSURANCE_BASE_CHECK,核心逻辑是解析一张文本表并做社保缴费基数相关的勾稽校验。它没有任何目录遍历、多客户分发、文件枚举、客户级汇总、或统一批处理编排逻辑。输出虽然带有 line 行号,但这是单表内部行号,不是描述所说的对各客户原文文件的逐条引用。故主目的和关键能力均与声明明显不符。

Tp4

High
Category
MCP Tool Poisoning
Confidence
98% confidence
Finding
该代码的主用途与声明存在明显实质性偏差。声明强调“批量”“目录里所有客户”“每客户一行结论”“引用原文文件与行号”,这意味着应具备文件系统遍历、多客户处理、客户级汇总和可追溯引用能力。但实际代码只是一个本地文本分段路由器:从 payload.text 中拆分命名段落,调用 3 个固定制造业检查引擎,返回检查级结果和发现项统计。它既不扫描目录,也不处理多个客户实体,更不生成文件/行号级引用。除此之外,领域也从通用代账月结交付前核对偏移为“制造业月度自查包”,且明确只覆盖3项检查、另有2项 withheld。故应判定为描述与行为不一致。

Static analysis

No suspicious patterns detected.