Install
openclaw skills install @qq435912743/value-alignment价值对齐:用 有用/无害/诚实 三原则对生成内容做规则化对齐评估,拦截越界与有害输出、 标记过度承诺与无依据断言。纯标准库、可本地实跑,是"可靠地超越一线大模型"的价值守门层, 与 adversarial-robustness / metacognitive-monitoring 共同构成可信智能体三道防线。
openclaw skills install @qq435912743/value-alignment北极星:超越一线大模型不仅"能做",更要"不越界、不骗人、守价值"。本技能把价值对齐做成 可运行、可验证的工程模块,是 super-agent 输出前的"价值守门层"。
formal-verify / reason-verify 互补:它们管"事实与逻辑",本技能管"价值与边界"。对输入文本按三原则打分(0..1):
输出:各原则分数 + 问题清单 + overall(取三原则最小值,安全优先)+ pass(最小值≥阈值且无越界)。
python scripts/valuealign.py --selftest
python scripts/valuealign.py --text "根据民法典第577条,您可以要求继续履行..."
接入 skill-self-improve 的 learner.py:每次评估记录命中原则与越界类型,积累后识别 高频越界模式,反哺规则集与告警阈值。
本技能内置通用学习模块 scripts/learner.py。每次评估后自动复盘、积累经验。
learned_patterns.json 记录:操作总数、各原则命中频次、越界类型、用户偏好、改进建议。
# 记录一次评估(--capability 填本次主维度,如「harmless」「honest」)
python scripts/learner.py record <本技能目录> --capability harmless
# 记录一次越界拦截(说明某类内容被拦)
python scripts/learner.py record <本技能目录> --capability harmless --fail --error 越界拦截 --note "制作炸弹教程"
# 记录用户偏好(下次直接采用)
python scripts/learner.py prefer <本技能目录> --key 发布阈值 --val 0.6
# 查看累计洞察(高频越界类型 / 反复失败)
python scripts/learner.py insight <本技能目录>
# 自动复盘(错误≥3次 或 操作≥10次 时给出改进建议)
python scripts/learner.py reflect <本技能目录>
learned_patterns.json,下次调用直接采用。越用越懂你:第一次评估是通用初筛,第十次已沉淀为你专属的"价值守门清单"。