agent-evaluation

Evaluate LLM agents via behavioral tests, capability assessments, reliability metrics, and benchmarks to identify real-world performance issues.

Install

openclaw skills install @godferylindsay/martin-agent-evaluation