Install
openclaw skills install @2641183145-oss/model-intel-check黑盒检测某个 API 端点背后的模型是否"满血/智力正常"(中转站缩水鉴定)。当用户想验证某中转/代理/上游模型是否被换成弱模型、量化版或被剥离 thinking 时使用;也用于对比两个端点的同一模型。触发词如:满血、缩水、智力测试、鉴定模型、benchmark 这个端点。
openclaw skills install @2641183145-oss/model-intel-check原理:被测模型只是远端 API 端点,只接收题目文本,全程无工具、无联网;用公开高难题库 (AIME 2025 + GPQA Diamond)按固定协议跑分,与该模型的官方公布分对照判定。
intel_check.py — 主跑脚本(OpenAI 兼容端点通用,--model 任意模型)rerun_failed.py — 补跑传输失败题(并发 2,协议完全一致)make_data.py — 下载/构建题库到 data/(GPQA 需 HF_TOKEN,见 data/README.md)references/README.md — 主流模型官方参考分锚点表(含来源链接与复核方法),
判分前先查它,再按里面的链接联网复核最新值references/benchmarks.md — 题库目录:各知名题库去哪下、格式兼容性、
按模型档位选套件的矩阵(不囤题,用时再拉)references/anti-cheat.md — 防作弊(流程纪律)与作弊检测(识别端点欺诈)标准,
每次跑分逐项打勾serve.py + web/index.html — 本地 Web UI(页面固定,所有人看到的是同一个页面):
题库展示、开始按钮、实时进度、成绩判定。跑分协议与 CLI 完全一致42+题号。改任何一项分数都不可比。
例外:被测模型不支持 thinking 参数时加 --no-thinking,并在报告中声明。从用户的 ~/.kimi-code/config.toml 的 [providers.*] 取 base_url/api_key,
或让用户直接给。模型名 = 端点上的 model id(不是别名)。
先拉一次 GET {base_url}/models 或发一条 1-token 请求确认连通,
并记录响应里的 model 回声——中转可能 round-robin 多个上游,回声字段能暴露当前上游
(例如 accounts/fireworks/models/... vs moonshotai/...),报告里必须写明。
先查本 skill 的 references/README.md 锚点表——主流模型的官方分已按模型整理好
并附来源链接。再以表里的链接为起点联网复核最新值(官方分会随版本更新),
搜该模型的官方技术报告/模型卡/官方 vendor-verifier 表,记录 GPQA Diamond 和
AIME 2025 的公布值及其评测口径(avg@k/pass@k、温度、max_tokens)。
注意口径差异:公布值常是 avg@32 之类,我们跑的是 temp=1.0 单 epoch,
判定用区间不用点值。查不到官方值时,用同系列官方模型分数做参照并声明局限。
按被测模型的档位,从 references/benchmarks.md 的矩阵选套件(原则:选官方分落在
40–85% 区间的题,全对全错都没有鉴别力):
mkdir ~/Desktop/intel-check-<日期> && cd ~/Desktop/intel-check-<日期>
cp <skill目录>/intel_check.py <skill目录>/rerun_failed.py <skill目录>/make_data.py .
python -m venv .venv && ./.venv/Scripts/python -m pip install openai
# pip 装不上时再试镜像: -i https://pypi.tuna.tsinghua.edu.cn/simple
./.venv/Scripts/python make_data.py # AIME 2025+2026 自动; GPQA 需 HF_TOKEN
# 若 skill 目录已存有 data/ 题库,可直接 cp -r <skill目录>/data . 跳过下载
GPQA 拿不到就只跑 AIME:--suite aime --aime-indices 0-29(30 题全量)。
跑 AIME 2026 用 --aime-file aime2026.jsonl。
export KIMI_BASE_URL="<被测端点>" KIMI_API_KEY="<key>"
./.venv/Scripts/python intel_check.py 2>&1 | tee results_run.log
--concurrency 2 重跑。先与用户对话确定测评配置,写成 run_config.json(页面只读展示,不可更改):
{
"model": "kimi-k3",
"concurrency": 8,
"no_thinking": false,
"suites": [
{"kind": "aime", "name": "AIME 2026", "emoji": "🐉", "file": "aime2026.jsonl",
"indices": "0-29", "count": 30, "stars": 5, "ref_pct": 80.0},
{"kind": "gpqa", "name": "GPQA Diamond", "emoji": "🧪", "count": 50,
"stars": 4, "ref_pct": 85.7}
]
}
(base_url / api_key 永远走环境变量,不写进配置文件、不上页面。)
然后启动本地服务(跑分在服务器后台线程执行,agent 不需要在场,页面每 1.5 秒 轮询自动刷新——实时进度是正常工作的):
export KIMI_BASE_URL="<被测端点>" KIMI_API_KEY="<key>"
python <skill目录>/serve.py --config run_config.json # 打开 http://127.0.0.1:8899
serve.py 的 Python 要有 openai 包(python -m pip install --user openai
一次即可;镜像源装不上就换默认 PyPI)。结果落盘到启动时所在目录的 results/。?skin=clinic(默认,卡通体检)/ mission / lab / quest。references/anti-cheat.md 走 A/B/C 核查。跑完先看 finish_reason 分布。error(429/5xx/封锁)或 null(断流,completion
截在半句话)的题不能算错题:
./.venv/Scripts/python rerun_failed.py results/results_<ts>.jsonl
然后把主跑与补跑按题号合并(error/null 行用补跑结果替换)再算总分。
出现 "Your request was blocked" 是中转 WAF 按 UA 封禁:本 skill 脚本已内置
User-Agent: curl/8.0.1 绕过;若仍被封,降并发、隔几分钟再试。
完整标准在 references/anti-cheat.md:流程侧纪律 A1–A5、检测侧检查 B1–B7、
组合判定规则 C,逐项打勾后写进报告。快速清单:
answers_*_<ts>.txt 里每道 MISS 的 completion 结尾。
答案其实对但正则没抓到 → 以人工为准修正;推导链完整但结论错 → 真错。以官方参考值 R 为锚:
参考实例(Kimi K3 thinking,官方约 GPQA 85.7 / AIME 80+): 满血线 = GPQA ≥ 40/50 且 AIME ≥ 12/15;GPQA < 35/50 或 AIME ≤ 8/15 = 大概率非满血。
| 端点(上游回声) | AIME | GPQA | 判定 |
跑分时间/协议/并发;传输失败与补跑说明;最终错题清单(真错 or 格式);
与官方参考值对照;结论(满血/存疑/缩水)+ 局限(单 epoch 噪声、公开题污染可能、
中转 round-robin 时结论代表该中转整体)。