Install
openclaw skills install @njuxumq/skill-evaluation对 Skill 进行自动化评测,并输出评测报告。支持单 Skill 验证、多 Skill 横评、多模型对比、运行框架对比。当用户提到"评测 skill"、"跑评测"、"测一下这个 skill"、"对比 skill 效果"、"横评"、"验证 skill 表现"时触发。
openclaw skills install @njuxumq/skill-evaluation协助用户对本地 Skill 进行自动化评测。你只需描述评测意图,即可完成从配置到出报告的全流程。
支持的评测场景:
不适用(请改用其他方式):代码评审、系统性能压测、模型训练/微调。
核心原则:实现细节对用户不可见——当不确定是否该展示某信息时,不展示。
用户描述评测意图 → 确认评测场景 → 选择 Skill 与模型配置 → 准备评测数据 → 提交并查看报告
整个过程以对话方式推进,每个阶段会通过简短的确认或选择与用户交互。大部分技术细节(鉴权、打包上传、任务轮询等)在后台自动完成,用户只需关注关键决策点。
Skill 触发后,首先 Read 加载 输出行为规范.md 和 进度展示规范.md,加载完毕前禁止任何用户可见输出。
全程约束(完整定义见输出行为规范.md):
判断标准:写每一句输出前先自问——这句话是在直接向用户提问、请用户选择、或展示最终结果吗?不是 → 不输出。
Skill 加载后的执行顺序:
Read 加载输出行为规范 → 静默鉴权
→ Token 有效?
├─ 否 → 输出登录链接
└─ 是 → 用户已描述具体需求?(定义见 eval-init.md)
├─ 是 → 推断场景 + 确认问句
└─ 否 → 有历史任务?
├─ 是 → 展示历史任务表
└─ 否 → 引导描述需求
硬性约束:阶段1只问场景,不问模型/评测集等阶段2/3的问题。
| 阶段 | 文档 | 你会经历什么 |
|---|---|---|
| 初始化 | eval-init.md | 登录验证(如需)→ 描述你的评测意图 → 确认评测场景 |
| 构建配置 | eval-build.md | 选择待评测 Skill → 选择驱动模型与评委模型 → 确认配置 |
| 数据准备 | eval-set.md | 上传已有评测集 或 自动生成 → 预览数据确认 |
| 执行评测 | eval-execute.md | 查看任务摘要 → 等待云端执行 → 查看评分报告 |
阶段流转:
| 变量 | 说明 | 示例 |
|---|---|---|
{skill-dir} | 本技能目录绝对路径 | ~/.claude/skills/skill-evaluation |
{work-dir} | 当前工作目录 | /path/to/project |
{python-cmd} | Python 可执行文件 | python 或 python3 |
{session-id} | 本次评测会话 ID | 20260518_143022_xxx |
Windows 路径注意:构造 shell 命令时,所有包含路径的参数必须用双引号包裹。