LLM Eval Harness

Evaluate LLM outputs systematically — run test suites, score responses for accuracy/relevance/safety, compare models, and detect regressions in AI applications.

Install

openclaw skills install @charlie-morrison/llm-eval-harness