Install
openclaw skills install @xiyanjun/web-session-miner⚠️ 前置依赖:browser-skill(bsk CLI + Chromium 扩展,需先在 WorkBuddy 插件市场安装)。 网页登录态数据挖掘器(通用版)。复用用户已登录浏览器的登录态(cookies),通过 browser-skill 驱动真实浏览器抓取网页版数据,把「人肉复制粘贴」变成程序化采集,零 API 成本获取企业工商、 人物图谱、股权穿透、财务等深度数据,并输出结构化 JSON 或 HTML 报告。当目标网站同时提供 「官方 MCP/API(按次计费)」与「网页版(会员展示)」时,还能额外绕开 API 积分计费。 采用「通用方法论 + 站点适配器(recipes)」可插拔架构,内置企查查适配器,可扩展天眼查、 爱企查、国家企业信用信息公示系统等任意有「网页版 + 会员登录态」的站点。当用户需要查企业、 查老板、查股东、查实控人、股权穿透、对外投资、企业尽调、供应商背调、批量采集时使用。 触发词:查企业、查老板、查股东、查实控人、股权穿透、对外投资、企业尽调、 工商信息、人物图谱、网页抓取、登录态抓取、批量采集、数据挖掘。
openclaw skills install @xiyanjun/web-session-miner本 SKILL 复用你已登录浏览器的登录态,驱动真实浏览器抓取网页版数据,把「人肉复制粘贴」 变成程序化采集。只要目标网站有「网页版 + 会员登录态」,就适用。
当网站同时提供「官方 MCP / API(按次计费)」和「网页版(会员展示)」时,还能额外 绕开 API 积分计费,零 API 成本拿到全量深度数据。
这是「企查查浏览器抓取」案例的通用化抽象。它不绑定任何单一网站——凡是满足 「有网页版 + 会员登录态」的站点,都可以通过写一个「站点适配器(recipe)」接入; 若同时存在按量计费的 API,则额外获得「绕开积分」的收益。
本 SKILL 的核心能力是「复用登录态,自动化采集网页版已授权数据」——只要网站有网页版 + 会员登录态,就能把「人肉复制粘贴」变成程序化采集。
在此基础上,许多数据服务采用「双轨计费」,能带来额外收益:
| 轨道 | 你买到的是什么 | 计费方式 |
|---|---|---|
| 网页版会员(SVIP/VIP/Pro) | 在网页/App 内无限次查看深度字段的权益 | 订阅制(包月/包年) |
| 开放平台 API / MCP | 程序化调用数据的次数 | 按次 / 积分制 |
两套计费互不相通:你买了网页版会员,通常不含 API 调用额度。于是——用浏览器复用 你网页版会员的登录态去抓数据,不仅自动化采集,还「零 API 成本拿数据」。
简言之:有网页版会员 = 核心适用(省人力);再叠加按量计费的 API = 额外适用(省积分)。
⚠️ 合规边界(使用前必读)
本 SKILL 是「高效采集你自己已授权数据」的效率工具,仅限以下范围:
- ✅ 只抓取你自己账号有权查看的数据(你已付费/已授权的会员权益内)。
- ✅ 遵守目标网站服务条款(ToS)与 robots 协议,控制抓取频率。
- ❌ 禁止绕过付费墙获取未授权数据、大规模商业爬取、以及任何违法用途。
- ⚠️ 使用者对自身行为负责;本工具不用于「破解付费墙」。
判断一个网站是否适用本 SKILL,只需回答一个问题,其余都是加分项:
核心判断(决定适不适用)——有没有「网页版 + 会员登录态」(登录后能看到深度数据)?
加分判断(决定额外收益,不影响适用性)——有没有按量计费的 API/MCP?
现实中的数据网站,MCP/API 几乎都按量收费(免费额度很抠),所以「双轨」是主流形态, 本 SKILL 的适用面比「绕开计费」这个卖点所暗示的更广。
快速识别三步:
bsk CLI 在 PATH(browser-skill 套件),Chromium 扩展已连接(bsk status 显示
browsers connected 1)。若 bsk 命令不存在或扩展未连接,先引导用户安装/启用
browser-skill(WorkBuddy 插件市场),不要盲目继续抓取。bsk session start,agent 标签天然继承浏览器 cookies,无需重新登录。bsk snapshot 看结构,bsk evaluate "document.body.innerText" 取全文本。bsk session stop。核心原则:每个站点的「变体细节」都封装在 recipes/ 下的适配器里;五步法本身不变。
接到新任务时,先看有没有对应 recipe,没有就按 _template.md 现场写一个。
recipes/ 目录下,每个站点一个 Markdown 适配器文件,包含该站点的可变细节:
已内置:recipes/qcc.md(企查查,未登录可搜索)、recipes/tyc.md(天眼查,搜索强制登录)。
新增站点照 recipes/_template.md 填写即可。
登录门槛差异(重要):不同站点的登录门槛不同,直接决定能否「未登录预搜索」—— 企查查未登录可搜索(弱门槛);天眼查/爱企查搜索即强制登录(扫码)。写 recipe 时, 第 1 节务必先实测该站点的登录门槛,并在「硬前置」里标注。
session not registered 立即 bsk session list 重取 id、
核心数据在稳定 session 里按明确 URL 一次性抓取。bsk tab borrow 会打扰用户、常被取消;优先在 agent 标签直接导航。bsk navigate 偶发 tool RPC timed out,但页面可能
实际已加载完成。别急着重试导航,先 bsk evaluate "document.readyState" 确认——若已
complete 且 title 正确,直接继续抓取即可。YYYY-MM-DD。recipes/_template.md 为 recipes/{站点名}.md。