Install
openclaw skills install @thcjp/plug-intelligent-data-research|- 功能涵盖: plug, intelligent,。Use when 用户需要plug-intelligent-data-research相关功能时使用。不适用于超出本技能能力范围的复杂需求。适用于独立开发者、企业团队和自动化工作流场景。支持中文交互,无需复杂配置即开即用。提供结构化输出和错误处理机制。 面向研究者和分析师的智能数据研究工具包,覆盖多引擎搜索、网页抓取、数据聚合与分析,让数据研究效率提升5倍。 目标用户: 市场研究员、数据分析师、投资研究员、学术研究者 定价方案: 月付¥399/月 | 年付¥3999/年 | 买...
openclaw skills install @thcjp/plug-intelligent-data-research核心功能: 本技能提供中文交互、化工作流场景等能力。
现象: google-search-4返回空结果或403配额错误 原因: GOOGLE_API_KEY未配置、GOOGLE_CSE_ID错误或每日免费100次配额用尽 解决:
GOOGLE_API_KEY 和 GOOGLE_CSE_ID 环境变量是否配置现象: web-crawler-engine抓取返回403 Forbidden或频繁超时 原因: 目标网站部署了反爬虫机制,检测到自动化请求 解决:
现象: 增量同步后数据库中出现重复数据 原因: 时间戳基准不一致或去重逻辑失效 解决:
现象: SQL分析的数据统计与预期不符 原因: 数据归档不完整、SQL语法错误或时区问题 解决:
现象: free-web-search-4返回的搜索结果相关度较低 原因: DuckDuckGo免费API的结果排序和索引范围有限 解决:
A: 可以,Plug中的每个技能都是独立的,可以单独调用。free-web-search-4可零配置直接使用(DuckDuckGo免费无需API Key),组合使用时效果更佳。
A: Google CSE每日免费100次查询,用完后自动降级到free-web-search-4(Bing+DuckDuckGo双引擎免费搜索)。也可升级Google API付费计划增加配额。
A: Google搜索在国内需专用网络通道,建议国内用户优先使用free-web-search-4(Bing+DuckDuckGo,国内可直接访问)。也可配置Bing API(国内可访问)替代Google搜索。
A: 高频抓取可能触发反爬虫机制。建议:1)降低并发数(2-3个);2)增加请求间隔(1-2秒/次);3)设置真实User-Agent;4)遵守robots.txt协议;5)如目标网站有公开API,优先使用API。
A: 增量同步基于时间戳,仅采集上次同步后的新数据。支持四种触发方式:定时同步(Cron调度)、事件触发(Webhook回调)、手动同步(命令行触发)、混合模式(定时+事件)。同步异常自动告警并下次重试。
$env:GOOGLE_API_KEY 占位| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 |
|---|---|---|---|---|
| 信息搜集 | 8小时 | 2小时 | 6小时 | 20% |
| 数据抓取 | 12小时 | 4小时 | 8小时 | 15% |
| 数据清洗 | 10小时 | 3小时 | 7小时 | 10% |
| 数据分析 | 6小时 | 2小时 | 4小时 | 18% |
| 报告生成 | 4小时 | 1小时 | 3小时 | 12% |
| 对比维度 | 本Plug | 手动操作 | Python脚本 | 专业软件 |
|---|---|---|---|---|
| 功能集成 | 4合1平台 | 单一任务 | 部分自动化 | 全面专业 |
| 操作便捷 | 一键启动 | 多步骤操作 | 需编写脚本 | 需专业培训 |
| 成本效益 | 高性价比 | 较高成本 | 中等成本 | 高成本 |
| 数据安全 | 严格加密 | 信息泄露风险 | 可控风险 | 高安全风险 |
| 易用性 | 用户体验优化 | 操作复杂 | 需学习 | 需学习 |
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 |
|---|---|---|---|---|
| 信息过载 | 数据来源分散,难以整合 | 研究效率低下 | 多引擎搜索整合信息 | 时间节约20% |
| 数据质量 | 数据抓取不全,清洗困难 | 研究结果不准确 | 网页抓取引擎+SQL分析 | 准确率提升15% |
| 研究效率 | 人工操作繁琐,效率低 | 研究周期长 | 自动化流程 | 时间节约40% |
| === |
# 安装和初始化
skill install plug-intelligent-data-research
# 基本调用示例
skill execute plug-intelligent-data-research --input "示例输入"
# Python API调用示例
import requests
# 配置API端点
api_url = os.environ.get("API_URL", "http://api-server:8080/api/skills/plug-intelligent-data-research")
headers = {"Authorization": "Bearer YOUR_API_KEY"}
# 执行技能
response = requests.post(api_url, json={
"input": "示例输入数据",
"options": {"mode": "advanced"}
})
result = response.json()
print(result)
# 批量处理多个输入
for file in *.csv; do
skill execute plug-intelligent-data-research --input "$file" --output "result_$file"
done
===
搜索、聚合、抓取、分析,4合1AI驱动数据研究平台:多引擎搜索精准获取信息,网页抓取引擎批量归档数据,SQL分析挖掘数据洞察
本Plug将数据研究流程拆解为4个阶段:多引擎搜索获取信息源、精准搜索锁定目标数据、免费搜索兜底覆盖、网页抓取引擎批量归档并SQL分析。4个技能形成从信息发现到数据归档到分析洞察的完整研究闭环。
| 技能 | slug | 领域 | 核心能力 | 质量分 |
|---|---|---|---|---|
| 联网搜索助手 | internet-search-pro-2 | Research | AI优化多源联网搜索 + 类目路由 + 查询构造 + 多步搜索 | 4.9/5.0 |
| 谷歌搜索工具 | google-search-4 | Research | Google CSE精准搜索 + 自定义搜索引擎 + 结果排序 | 4.8/5.0 |
| 免费网页搜索工具 | free-web-search-4 | Research | Bing+DuckDuckGo双引擎路由 + 免费方案 + 自动降级 | 4.8/5.0 |
| 网页抓取引擎(专业版) | web-crawler-engine | Research | 增量同步调度 + SQL高级分析 + 批量并发抓取 + 监控告警 | 4.7/5.0 |
internet-search-pro-2 (AI搜索) ──发现信息源──> google-search-4 (精准搜索)
│ │
多源聚合搜索 Google CSE精准定位
│ │
v v
free-web-search-4 (免费兜底) <──Bing/DuckDuckGo──> web-crawler-engine (批量抓取)
│ │
免费方案覆盖 增量同步+SQL分析
│
数据洞察输出
| 触发场景 | 触发关键词/意图 | 调用技能 |
|---|---|---|
| 需要联网搜索信息 | "搜索"、"联网搜索"、"查找"、"查一下"、"搜索信息" | internet-search-pro-2 |
| 需要Google精准搜索 | "Google搜索"、"谷歌搜索"、"CSE"、"精准搜索" | google-search-4 |
| 免费搜索替代方案 | "免费搜索"、"Bing"、"DuckDuckGo"、"不用API Key" | free-web-search-4 |
| 批量抓取网页数据 | "网页抓取"、"爬虫"、"数据归档"、"增量同步"、"批量抓取" | web-crawler-engine |
| SQL数据分析 | "SQL分析"、"数据统计"、"数据洞察"、"数据分析" | web-crawler-engine |
| 全链路数据研究 | "数据研究"、"市场调研"、"信息收集"、"数据采集" | 4技能串联执行 |
市场研究员需要收集某行业的竞品信息,包括产品功能、定价、用户评价等。
投资研究员需要持续跟踪某行业的公开数据,进行趋势分析和投资决策支撑。
学术研究者需要跨多个搜索引擎收集特定主题的学术资料和研究数据。
LLM_API_KEY(必需)和 GOOGLE_API_KEY + GOOGLE_CSE_ID(可选,Google搜索需要)每个技能均可独立调用。搜索类技能适合信息发现阶段,抓取引擎适合数据归档和分析阶段。免费搜索工具可完全独立使用(零API Key需求)。
{
"plug": "plug-intelligent-data-research",
"action": "execute_workflow | execute_single",
"input": {
"workflow": "full | search_only | google_only | free_search_only | crawl_only",
"search_input": {
"query": "AI编程工具 竞品对比 2026",
"category": "tech",
"depth": "multi_step"
},
"google_input": {
"query": "AI编程工具 竞品对比",
"cse_id": "custom_search_engine_id",
"num_results": 10
},
"free_search_input": {
"query": "AI编程工具 竞品对比",
"engine": "auto"
},
"crawl_input": {
"urls": ["https://example.com/article1", "https://example.com/article2"],
"max_workers": 5,
"rate_limit_per_sec": 2,
"sync_strategy": "incremental",
"sync_interval_minutes": 60
}
},
"options": {
"format": "json",
"verbose": true
}
}
{
"status": "success",
"plug": "plug-intelligent-data-research",
"results": [
{
"step": 1,
"skill": "internet-search-pro-2",
"status": "completed",
"output": {
"results": [
{
"title": "2026年AI编程工具横评:5款主流工具对比",
"url": "https://example.com/ai-tools-review",
"snippet": "本文对比了Cursor、Copilot、Claude等5款AI编程工具...",
"source": "multi_source",
"relevance_score": 0.95
}
],
"total_results": 15,
"search_depth": "multi_step"
}
},
{
"step": 2,
"skill": "web-crawler-engine",
"status": "completed",
"output": {
"crawled_count": 15,
"new_count": 12,
"duplicate_count": 3,
"archive_path": "data/research/2026-07-29/",
"sql_analysis": {
"top_keywords": [{"keyword": "Cursor", "count": 28}, {"keyword": "Copilot", "count": 22}],
"date_distribution": {"2026-07": 15, "2026-06": 8}
}
}
}
],
"metadata": {
"total_steps": 2,
"duration_ms": 30000,
"timestamp": "2026-07-29T10:00:00Z"
}
}
| 依赖项 | 类型 | 是否必需 | 获取方式 | 国内替代方案 |
|---|---|---|---|---|
| LLM API | API | 必需 | 任意LLM服务商,由Agent内置LLM提供 | 通义千问/文心一言/智谱GLM/DeepSeek/Kimi |
| Google CSE API | API | google-search-4必需 | Google Cloud Console申请API Key + CSE ID | 无直接替代,国内可用Bing API/百度搜索API |
| Bing Search API | API | free-web-search-4可选 | 微软Azure申请Bing Search API Key | 百度搜索API/搜狗搜索API |
| DuckDuckGo | 免费API | free-web-search-4默认 | 无需API Key,直接使用 | 无需替代,全球可用 |
| Python 3.8+ | 运行时 | web-crawler-engine必需 | python.org下载 | 国产Python发行版: Anaconda/miniconda |
| SQLite/MySQL | 数据库 | web-crawler-engine必需 | SQLite内置/MySQL安装 | 国产数据库: 达梦/人大金仓 |
| schedule库 | Python库 | 增量同步必需 | pip install schedule | 无替代,开源库 |
| JSON文件存储 | 文件系统 | 数据归档必需 | exec工具创建data/目录 | 本地文件系统,无海外依赖 |
$env:GOOGLE_API_KEY 等环境变量读取| 异常场景 | 原因 | 处理方式 |
|---|
| 对比维度 | 智能数据研究工作站 | 传统手动方式 | 通用脚本工具 |
|---|---|---|---|
| 自动化程度 | 全流程自动 | 完全手动 | 部分自动 |
| 错误处理 | 内置错误恢复 | 依赖人工经验 | 基本try-catch |
| 可复用性 | 参数化配置 | 一次性脚本 | 模板化 |
| 安全合规 | 内置安全检查 | 无安全保障 | 无安全保障 |
| 适用场景 | 多引擎搜索/网页抓取/SQL分析/增量同步,4合1数据研究平台 | 通用场景 | 通用场景 |
A1: 多引擎搜索/网页抓取/SQL分析/增量同步,4合1数据研究平台。支持文本指令和结构化参数输入,具体格式参考使用流程章节。
A2: 是的,部分功能需要配置对应平台的API Key。请在依赖说明章节查看具体要求,并通过环境变量安全配置。
A3: 检查命令参数是否正确,确认运行环境支持exec能力。如遇权限问题,请参照错误处理章节排查。