Install
openclaw skills install @thcjp/web-crawler-engineopenclaw skills install @thcjp/web-crawler-engine功能说明: 本技能涵盖 中文交互、时使用、化工作流场景 等核心能力。
| 能力 | 免费版 | 付费版 |
|---|---|---|
| 基础功能 | 支持 | 支持 |
| 多标签页并行抓取 | 不支持 | 支持 |
| 反爬虫策略自动规避 | 不支持 | 支持 |
| 页面结构变化自适应 | 不支持 | 支持 |
| 批量导出结构化数据 | 不支持 | 支持 |
| Cookie池管理与IP轮换 | 不支持 | 支持 |
| 场景 | 输入 | 输出 |
|---|---|---|
| Discord归档搜索 | 频道ID和搜索关键词 | 匹配消息列表和元数据 |
| 新鲜度同步 | 频道和最后同步时间 | 增量更新的消息记录 |
| DM和频道切片 | 用户ID或频道范围 | 消息切片和SQL统计 |
不适用于:非Discord平台的社媒体数据归档
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| channel_id | string | 是 | Discord频道ID |
| query | string | 否 | 搜索关键词, 默认: 全部消息 |
{
"success": true,
"data": {
"overall_grade": "A",
"total_score": 92,
"max_score": 100,
"summary": "处理完成",
"details": [
{
"item": "代码风格",
"status": "pass",
"score": 95,
"comment": "符合规范"
},
{
"item": "安全合规",
"status": "warn",
"score": 80,
"comment": "符合规范"
}
],
"improvements": [
{
"priority": "high",
"suggestion": "建议优化",
"expected_gain": "+5分"
},
{
"priority": "medium",
"suggestion": "建议优化",
"expected_gain": "+3分"
}
]
},
"error": null
}
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 |
|---|---|---|---|---|
| 爬取大量网页 | 8小时 | 2小时 | 6小时 | 10% |
| 数据清洗 | 4小时 | 1小时 | 3小时 | 5% |
| 数据分析 | 6小时 | 1.5小时 | 4.5小时 | 8% |
| 数据可视化 | 3小时 | 0.5小时 | 2.5小时 | 7% |
| 报告生成 | 2小时 | 0.5小时 | 1.5小时 | 6% |
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 |
|---|---|---|---|---|
| 界面友好度 | 高 | 低 | 中 | 高 |
| 功能丰富性 | 高 | 低 | 中 | 高 |
| 易用性 | 高 | 低 | 中 | 高 |
| 扩展性 | 高 | 低 | 中 | 高 |
| 成本 | 低 | 高 | 中 | 高 |
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 |
|---|---|---|---|---|
| 网页数据抓取效率低 | 手动抓取数据耗时且容易出错 | 影响数据分析效率 | 自动化抓取,提高效率 | 时间节约50% |
| 数据清洗难度大 | 数据格式多样,清洗工作繁重 | 影响数据分析准确性 | 提供自动化清洗工具 | 准确率提升10% |
| 数据分析复杂 | 分析过程复杂,需要专业技能 | 影响决策效率 | 提供可视化分析工具 | 决策效率提升20% |
A: 在依赖说明中找到API Key配置方式,按照指示设置API Key,并确保重启会话或开启新终端后生效。
A: 付费版提供多标签页并行抓取、反爬虫策略自动规避、页面结构变化自适应、批量导出结构化数据、Cookie池管理与IP轮换等高级功能。
A: 支持Discord平台的归档搜索、同步新鲜度、私信、频道切片和SQL计数等功能。
A: 付费版提供自动规避反爬虫策略的功能,可以更高效地抓取数据。
A: 在AI Agent对话中调用本技能后,可以直接查看输出结果,并根据需要进行后续处理。
| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 |
|---|---|---|---|
| 无法启动工具 | 运行环境不满足要求 | 检查运行环境是否符合依赖说明中的要求 | 确保操作系统和Agent平台支持 |
| 抓取数据失败 | 网络连接问题 | 检查网络连接是否正常 | 检查网络连接,确保数据传输畅通 |
| 输出结果错误 | 输入参数错误 | 检查输入参数是否符合格式要求 | 仔细阅读输入格式说明,确保参数正确 |
| 执行速度慢 | 系统资源不足 | 检查系统资源使用情况 | 优化系统资源,提高执行速度 |
| 报错信息不明确 | 缺乏错误处理机制 | 查看错误日志,分析错误信息 | 优化错误处理机制,提供更详细的错误信息 |
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
针对"网页爬取工具"使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 |
|---|---|---|
| API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token |
| 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 |
| 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 |
| 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 |
| 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 |
| 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 |
| 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 |
| 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 |
| 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |