Install
openclaw skills install @yuanzhian-patsnap/evidence-based-labelingopenclaw skills install @yuanzhian-patsnap/evidence-based-labeling基线版本:evidence-based-labeling-v1.1,默认判定规则:default-v1.1。
把标引视为一个有治理要求的生命周期,而不是一次性提示词。业务决策、模型判断、外部证据和确定性校验必须分开管理。
不得把候选标签静默转成正式标签。不得为了避免空白而强行给出弱证据标签。
只读取当前阶段需要的文件:
references/workflow-modes.md。references/input-output-contract.md。references/default-decision-rules.md。references/taxonomy-design.md。references/zhihuiya-mcp-orchestration.md。references/quality-and-review.md。references/domain-milk-protein.yaml,再加载其中的标签体系、规则和样例。先检查用户提供的文件和自然语言需求,再提问。需要判断:
尽量从材料中推断第 3-6 项,只向用户询问缺失的业务决策。随后推荐模式并请求确认:
discovery:没有可用标签体系。semi_open:已有部分标签体系,或允许提出新候选标签。closed:标签体系已冻结,禁止新增正式标签。不得静默切换模式。当业务目标足够清楚、能够形成检索概念后,冻结维度或标签体系之前,必须执行 references/zhihuiya-mcp-orchestration.md 中的发现阶段 MCP 基线流程。不得静默跳过该基线。
默认只使用三个确认门禁。把相关决策合并,不要在每个内部阶段后都暂停:
在门禁之间,应自主完成资料检查、MCP 检索、开放编码、标签体系草拟、定义构建、抽样和试标复核。只有当缺失业务选择会实质改变结果,或外部动作需要新授权时,才在门禁之外暂停。用户可以主动要求增加门禁。
根据用户需求和文件生成任务配置。保留原始列,并记录字段映射、范围、版本、候选标签策略、证据优先级、MCP 策略和确认状态。
评估标签覆盖率、定义、层级、正例/反例、规则完整性、标签不均衡、重复路径、脏标签、缺失文本和稳定记录 ID。
当目标和检索概念足够清楚后,使用关键词扩展和语义检索,并结合分类辅助或聚焦专利/文献检索。为代表性记录检索技术主题和应用领域。用检索结果发现概念和边界,但必须把检索结果与正式标签分开。
如果某项能力无结果,在有价值时用更简单概念重试一次,记录无结果,并继续使用其他能力。不得把检索输出直接当成标签结论。
在 discovery 模式中,对代表性样本进行开放编码,规范同义词,提出维度和层级,并创建标签确认卡。在 semi_open 模式中,严格区分正式标签和候选标签。在 closed 模式中,将未覆盖概念记录为 unclassified,不得发明正式标签。
对每个拟定标签族,在可行时检索代表性正例或相邻记录。使用技术主题、应用领域、分类号、技术三元组、说明书、权利要求和相似专利来定义纳入条件、排除条件、易混标签、正例和强反例。至少覆盖每个一级分支和所有未解决的相邻标签边界。需呈现可追溯的公开号或文献标识。
结合本地分层抽样与语义、关键词、相似记录或分类辅助检索。样本应包含常见记录、边界样本、相邻标签冲突、不完整记录、强反例和可能未分类记录。不要机械地按每个节点固定抽样数量;应根据标签体系规模、多样性和观察到的不稳定性调整样本。
对每条记录:
优先使用用户提供的来源证据。试标和全量标引期间,仅在摘要、权利要求、说明书、技术三元组、主题、领域、边界歧义或外部佐证缺失时,选择性调用 MCP。通过相似记录比较边界冲突。不得把每条完整且清晰的记录都发给 MCP。检索用于候选召回,不是最终判断。
区分错误来源:标签体系缺口、定义不清、规则问题、证据缺失或模型判断问题。提出变更建议,但不得静默应用。重复试标,直到用户冻结版本。
全量执行前,展示记录数、范围、标签体系版本、规则版本、试标状态、选择性 MCP 触发策略和输出内容。只有获得明确授权后才能开始。正式标签、候选标签和未分类记录必须保持区分。
输出原始数据加标引字段、证据长表、标签体系、规则、复核队列、QA 摘要、任务元数据和来源记录。校验记录覆盖率、合法标签路径、证据存在性、必填维度、选择约束和版本一致性。
references/zhihuiya-mcp-orchestration.md 中的必需基线和选择性增强矩阵;不得用纯本地推断静默替代必需 MCP 工作。incomplete,并说明哪些必需能力组未执行。使用明确状态:
formalcandidateunclassifiedneeds_review置信度使用 high、medium 或 low,并与证据质量和边界清晰度绑定。不得输出虚构概率百分比。
不要把 unclassified 或 not_applicable 等同于 needs_review。按以下规则流转问题:
Review Queue:低置信度、范围边界、未解决的相邻标签、证据冲突、证据不完整、脏路径或缺少必填维度。Taxonomy Backlog。重复缺口按问题类型归并,不要逐条记录复核。not_applicable 可自动通过。Taxonomy Backlog。记录复核率和标签体系 backlog 数量应作为两个独立 QA 指标。
scripts/inspect_labeling_input.mjs 检查工作簿/CSV 结构。scripts/validate_task_config.py 校验任务配置。scripts/validate_taxonomy.py 校验标签体系完整性。scripts/create_labeling_workbook.mjs 创建标准工作簿结构。scripts/validate_labeling_output.mjs 做工作簿级输出校验。运行 .mjs 辅助脚本前,先加载工作区依赖。把所需 helper 复制到可写工作目录,并确保本地 node_modules 能解析到内置依赖目录,再运行复制后的 helper。不得安装替代包,也不得在 Skill 中硬编码用户特定运行时路径。
运行电子表格脚本前加载工作区依赖。assets/ 中的模板可作为起点,而不是不可变政策。
本 Skill 依赖智慧芽开放平台 MCP 服务: