agent-eval-harness

智能体回归评测:用一组回归测试用例驱动 agent 并量化通过率,与历史基线比对自动标记能力 回退,让超级智能体是否真在超越一线大模型变得可度量、可审计、可防止退化。

Install

openclaw skills install @qq435912743/agent-eval-harness