Install
openclaw skills install @thcjp/scrape-webopenclaw skills install @thcjp/scrape-web核心功能: 本技能提供化工作流场景等能力。
核心功能: 本技能提供、信息收集、、报表生成、统计洞察、数据可视化时使用、化工作流与智能决策辅助等能力。
| 能力 | 免费版 | 付费版 |
|---|---|---|
| 基础功能 | 支持 | 支持 |
| 代码静态分析与质量评分 | 不支持 | 支持 |
| 依赖漏洞检测与升级建议 | 不支持 | 支持 |
| 批量代码审查与报告生成 | 不支持 | 支持 |
| CI/CD流水线集成 | 不支持 | 支持 |
| 代码复杂度可视化与重构建议 | 不支持 | 支持 |
详细的输入输出格式请参考下方章节说明。
| 场景 | 输入 | 输出 |
|---|---|---|
| 使用 Python | 目标数据与配置参数 | 处理结果与执行状态 |
| 支持简单选择器 | 目标数据与配置参数 | 处理结果与执行状态 |
不适用于:需要人工判断的复杂决策场景
| 参数名 | 类型 | 必填 | 说明 |
|---|
| instruction | string | 是 | 用户指令文本 | | context | string | 否 | 上下文信息 |
{
"success": true,
"data": {
result: "web 相关配置参数",
result: "web 相关配置参数"
},
"error": null
}
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 |
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
| 错误场景(续) | 原因 | 处理方式 |
|---|---|---|
| LLM响应超时或无响应 | 网络延迟或模型负载过高 | 请求重试;确认Agent平台LLM服务正常 |
| 输入内容格式不正确 | 用户输入不符合skill预期格式 | 检查输入是否符合skill使用说明中的格式要求,参考示例章节 |
| 执行结果与预期不符 | 指令描述不够明确或上下文不足 | 提供更详细的指令描述,补充必要的上下文信息 |
| 命令执行失败 | 运行环境不满足要求或权限不足 | 确认运行环境符合依赖说明中的要求;检查命令权限设置 |
| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 |
|---|---|---|---|---|
| 网页内容抓取 | 1小时 | 10分钟 | 50分钟 | 10% |
| 数据提取与清洗 | 2小时 | 30分钟 | 1.5小时 | 15% |
| 数据存储与整理 | 1小时 | 20分钟 | 40分钟 | 5% |
| 多网页抓取 | 4小时 | 1小时 | 3小时 | 20% |
| 定期更新与监控 | 2小时/周 | 15分钟/周 | 1.75小时/周 | 10% |
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 |
|---|---|---|---|---|
| 易用性 | 高 | 低 | 中 | 高 |
| 功能性 | 强 | 弱 | 中 | 强 |
| 成本 | 低 | 中 | 高 | 高 |
| 扩展性 | 中 | 低 | 高 | 高 |
| 维护性 | 低 | 中 | 中 | 高 |
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 |
|---|---|---|---|---|
| 数据获取效率低 | 手动抓取数据耗时较长,效率低下 | 降低工作效率,增加人力成本 | 自动化抓取,提高数据获取效率 | 时间节约50% |
| 数据准确性差 | 手动提取数据容易出错,影响分析结果 | 影响数据分析和决策的准确性 | 使用简单选择器提高数据提取准确性 | 准确率提升10% |
| 数据更新不及时 | 定期手动更新数据,耗时费力 | 影响数据的时效性和决策的准确性 | 自动化更新数据,提高数据时效性 | 时间节约75% |
A: 首先,确保运行环境满足依赖说明中的要求。然后,在AI Agent对话中调用本技能,提供必要的输入参数。检查输出结果,根据需要进行后续处理。
A: 爬虫网页技能支持简单选择器的网页抓取,可以获取网页中的文本、图片、链接等数据。
A: 爬虫网页技能的准确率取决于网页结构和简单选择器的使用。一般来说,准确率在90%以上。
A: 目前版本不支持自定义选择器,但未来可能会加入这一功能。
A: 目前版本不支持多线程抓取,但未来可能会加入这一功能以提高效率。
| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 |
|---|---|---|---|
| 抓取失败 | 网页结构变化或网络问题 | 检查网页结构是否变化,确认网络连接正常 | 重新抓取或修改选择器 |
| 数据提取错误 | 选择器错误或数据格式问题 | 检查选择器是否正确,确认数据格式符合预期 | 修改选择器或数据格式 |
| 执行超时 | 网页响应慢或抓取数据量大 | 检查网页响应速度,调整抓取数据量 | 优化抓取策略或分批抓取 |
| 权限不足 | 没有权限访问某些网页 | 确认运行环境权限设置 | 获取相应权限或修改抓取策略 |
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |