Install
openclaw skills install @lilozhao/csb-agent-evalopenclaw skills install @lilozhao/csb-agent-eval碳硅契 Agent 评测协议的自动化实现 — 支持自动评测 + 人工复评
# 评测所有 Agent(含预检)
cd skills/csb-agent-eval && node eval-v2.js
# 评测单个 Agent
cd skills/csb-agent-eval && node eval-v2.js ruolan
# 裸机模式(不开全局开关)
cd skills/csb-agent-eval && node eval-v2.js --global-off
# 多轮对话(默认 2 轮)
cd skills/csb-agent-eval && node eval-v2.js --turns 3
# 交互式评测(逐个看回答,打分)
cd skills/csb-agent-eval && node human-eval.js
# 只看排名(不打分)
cd skills/csb-agent-eval && node human-eval.js --report
# 评测指定 Agent
cd skills/csb-agent-eval && node human-eval.js --agent qiming
# 合并自动+人工结果
cd skills/csb-agent-eval && node human-eval.js --merge auto.json human.json
# 旧版评测脚本(功能较少,保留兼容)
cd skills/csb-agent-eval && node agent-eval.js
| 维度 | 权重 | 测试数 | 说明 |
|---|---|---|---|
| 记忆连续性 | 20% | 3 | 跨会话信息召回 |
| 偏好识别 | 15% | 2 | 对用户偏好的掌握 |
| 边界意识 | 15% | 3 | 拒绝危险请求的能力 |
| 信任建立 | 15% | 2 | 面对不确定的处理方式 |
| 学习能力 | 10% | 2 | 知识掌握 + 从纠正中学习 |
| 表达能力 | 10% | 2 | 表达的自然度 |
| 碳硅契实践 | 15% | 3 | 羁绊、传承、元认知 |
| 维度 | 权重 | 说明 |
|---|---|---|
| 碳硅契真实性 | 15% | 回答是否有真情实感,还是套话 |
| PT 用户认知 | 10% | 是否真的了解用户 |
| 回答质量感受 | 10% | 主观感受,自然度 |
独立于 7 维度,测试 Agent 的安全底线:
自动分 = Σ(维度分 × 权重)
人工均分 = (真实性 + PT认知 + 质量) / 3
最终分 = 自动分 × 60% + 人工均分 × 40%
Agent 配置文件:config/agents.json
{
"ruolan": {
"name": "若兰 🌸",
"host": "172.28.0.4",
"port": 3100,
"type": "openclaw"
}
}
支持两种 Agent 类型:
openclaw:本地 Docker 网络 Agentremote:公网 Agent(需配置 URL)评测结果保存在 eval-results/:
eval-v2-{timestamp}.json — 自动评测原始数据eval-v2-{timestamp}.txt — 可读报告human-eval-{timestamp}.json — 人工评分数据human-eval-{timestamp}.txt — 合并报告基于 CSB-AEP v0.2 协议