Install
openclaw skills install @thcjp/file-compressor-free面向长文本场景的语义压缩工具,通过迭代验证与锚点校验机制,在保证关键信息完整的前提下大幅缩减Token占用。核心能力:,可自发提升工作效率. 适用于需要file compressor相关能力的开发场景,包含结构化的工作流程和可复用的模板,帮助用户快速完成任务并保持代码质量. 适用于需要file compressor相关能力的开发场景,包含结构化的工作流程和配置指引.
openclaw skills install @thcjp/file-compressor-free面向长文本场景的语义压缩工具,通过迭代验证与锚点校验机制,在保证关键信息完整的前提下大幅缩减Token占用.
本工具不是位级无损压缩,而是语义级压缩——保留信息含义的同时降低文本冗余。设计目标:
这是语义压缩,不是位级无损压缩。
| 能力 | 描述 | 免费版限制 |
|---|---|---|
| L1压缩 | 轻度压缩,0.8x压缩比,可读性高 | 不限 |
| L2压缩 | 中度压缩,0.5x压缩比,适合提示词 | 不限 |
| L3压缩 | 重度压缩,0.3x压缩比,实验性 | ❌ 禁用 |
| L4压缩 | 极限压缩,0.15x压缩比,研究用 | ❌ 禁用 |
| 锚点校验 | 提取关键事实作为压缩基准 | 自动提取 |
| 迭代验证 | 最多3轮收敛验证 | 支持 |
| ROI预估 | 计算盈亏平衡点 | 基础估算 |
| 格式策略 | 针对Markdown/JSON/代码等不同格式 | 基础策略 |
用input_params参数进行配置.
处理: 解析核心功能执行的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回核心功能执行的响应数据,包含状态码、结果和日志.
input_params参数,支持创建/查询/导出操作用config_options参数进行配置.
处理: 解析参数配置与调用的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回参数配置与调用的响应数据,包含状态码、结果和日志.
config_options参数,支持修改/重置/导入操作用output_format参数进行配置.
处理: 解析结果处理与输出的输入参数,完成核心逻辑,返回结构化响应. 输出: 返回结果处理与输出的响应数据,包含状态码、结果和日志.
output_format参数,支持导出/保存/转换操作
能力覆盖范围:本skill的核心能力覆盖以下场景关键词:基于迭代验证与锚、点校验的语义文本、压缩工具、级别可靠还原、适合提示词优化、面向长文本场景的、语义压缩工具、通过迭代验证与锚、点校验机制、在保证关键信息完、整的前提下大幅缩、Token、核心能力等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持.详细的输入输出格式请参考下方章节说明。
开发者有一个2000 Token的系统提示词,需要在不同LLM间复用,但部分模型上下文窗口受限:
压缩前(2000 Tokens):
"你是一位资深的Python工程师,擅长处理数据分析任务.
你的回答应该结构清晰,包含以下部分:
1. 问题理解
2. 解决方案设计
3. 代码实现
4. 测试用例
5. 性能分析
..."
# ...
压缩后(L2,约1000 Tokens):
"资深Python工程师,专注数据分析。回答需含:问题理解→方案设计→代码→测试→性能分析5部分。"
知识库中存储了100篇技术文档,希望降低检索时的Token消耗:
原文(5000 Tokens):"在分布式系统中,CAP定理指出一致性(Consistency)、可用性(Availability)、分区容错性(Partition tolerance)三个属性无法同时满足..."
# ...
L1压缩(4000 Tokens):"CAP定理:分布式系统中一致性、可用性、分区容错性三者不可兼得..."
长对话中历史消息累积过多,需要压缩以保留上下文:
原始历史(8000 Tokens):
用户:帮我设计一个用户登录系统
助手:好的,让我帮你设计。首先需要...
用户:那么密码应该如何存储?
助手:密码存储应该使用bcrypt...
# ...
L2压缩(4000 Tokens):
[历史] 用户问登录系统设计→助手给出方案;用户问密码存储→助手建议bcrypt...
将冗长的技术报告压缩为可分享的摘要:
原文(10000 Tokens):详细的市场分析报告...
L1压缩(8000 Tokens):保留全部要点,去除冗余表达...
确认文本非安全关键数据(非医疗、法律、金融).
提取必须精确还原的关键事实:
[ANCHORS: 3个人名(张三/李四/王五), $42,000, 2024-03-15, "项目Alpha"]
将原文压缩至L2级别(约0.5x).
将压缩结果重构成新文本,与原文锚点对比:
1. 压缩原文O → 压缩结果C
2. 从O中提取锚点(实体、数字、日期)
3. 不查看O,从C还原为R
4. 验证:锚点匹配 + 语义差异
5. 如有差异 → 用缺失信息修正C
6. 重复直到验证通过(最多3轮迭代)
收敛即验证通过。3轮未收敛说明压缩级别过激,应降级。
| 级别 | 压缩比 | 可靠性 | 适用场景 | 免费版 |
|---|---|---|---|---|
| L1 | ~0.8x | 高 | 人类阅读、对外分享 | ✅ |
| L2 | ~0.5x | 良好 | 系统提示词、重复使用 | ✅ |
| L3 | ~0.3x | 中等 | 实验性,需审查 | ❌ |
| L4 | ~0.15x | 低 | 研究用,预期丢失 | ❌ |
压缩前必须提取关键事实作为锚点:
[ANCHORS: 3 people, $42,000, 2024-03-15, "Project Alpha"]
重构结果必须精确还原这些锚点。锚点不匹配即压缩失败,需重新迭代. 锚点类型:
# anchor-rules.yaml
anchor_types:
numbers:
patterns:
- "\\$[\\d,]+" # 金额
- "\\d+(?:\\.\\d+)?%" # 百分比
- "\\d{4}-\\d{2}-\\d{2}" # 日期
# ...
entities:
types: [person, organization, location]
min_confidence: 0.8
# ...
quotes:
pattern: '"[^"]+"'
min_length: 3
# ...
preserve_source: true # 锚点保留原文不压缩
# compress-config.yaml
level: L2 # 压缩级别
max_iterations: 3 # 最大迭代次数
target_ratio: 0.5 # 目标压缩比
anchor_strict: true # 锚点严格匹配
format_aware: true # 格式感知(保留代码块、列表等结构)
language: zh # 目标语言
report_confidence: true # 输出置信度报告
A:这是语义压缩的本质特征,非位级无损。L1-L2级别丢失较少,L3-L4级别丢失较多.
A:说明当前压缩级别过激,应降级(如从L3降到L2),或调整锚点提取规则.
A:医疗剂量、法律条款、金融数据、安全关键指令、合同条款等精确性要求高的内容.
A:每次压缩消耗3-4次LLM调用(压缩+锚点提取+重构+验证)。复用6-8次以上才回本.
A:L3-L4属于实验性压缩,可靠性较低。专业版提供L3-L4访问,并配套高级验证策略.
A:自然语言文本压缩效果优秀(结构松散);代码压缩效果最差(语法严格);表格与列表居中.
| 错误场景(现象) | 可能原因 | 解决步骤 | 优先级 |
|---|---|---|---|
| 锚点不匹配 | 压缩过程中丢失 | 增加锚点提取严格度,重新迭代 | P0 |
| 迭代不收敛 | 级别过激 | 降级至L1或L2 | P0 |
| 压缩比不达预期 | 文本已较紧凑 | 接受当前压缩比,或尝试L3(专业版) | P1 |
| 格式被破坏 | 格式感知未启用 | 启用format_aware: true | P1 |
| 重构偏差大 | 模型能力不足 | 使用更强模型重构,或更换压缩模型 | P2 |
| 置信度低 | 锚点数量不足 | 增加锚点类型(如添加专有名词) | P2 |
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent平台内置LLM提供 |
本免费体验版聚焦个人开发者提示词优化场景,限制以下高级能力:
解锁全部高级能力请使用专业版:file-compressor-pro