Install
openclaw skills install @thcjp/data-analysis-hubopenclaw skills install @thcjp/data-analysis-hub功能说明: 本技能涵盖 中文交互 等核心能力。
功能说明: 本技能涵盖 化工作流场景 等核心能力。
数据分析方法论守护框架,确保分析过程的统计严谨性、陷阱识别和方法论正确性.
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | 数据分析理调处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
在任何数据分析开始前,先回答四个方法论问题:
分析结果输出前必须通过的统计检查:
7 个常见分析陷阱及其识别方法:
| 陷阱 | 英文 | 识别方法 |
|---|---|---|
| p值操纵 | p-hacking | 检查是否多次跑测试直到 p<0.05,报告所有跑过的测试而非只报告显著的 |
| 时期不可比 | Comparing unequal periods | 对比周期天数是否一致?节假日、季节性是否对齐? |
| 幸存者偏差 | Survivorship bias | 样本是否只包含"存活"对象?退出用户、失败案例是否被排除? |
| 辛普森悖论 | Simpson's Paradox | 分组和整体趋势是否一致?分层分析后再下结论 |
| 时间序列伪相关 | Correlation in time series | 两个时间序列的相关可能是 trend 导致的,需差分或去趋势后再算相关 |
| 百分比聚合错误 | Aggregating percentages | 各组百分比不能直接平均,需用加权平均或回到原始计数 |
| 摘樱桃 | Cherry-picking | 是否只展示有利数据?检查完整时间范围和所有分组 |
根据分析目标选择正确的分析方法:
选择原则:correlation 不等于 causation。观察数据只能发现关联,因果需实验或准实验方法.
分析输出的标准化要求:
遇到以下情况时必须升级到资深分析师或暂停分析:
详细的输入输出格式请参考下方章节说明。
向Agent发送指令:
使用 数据分析理调 处理以下任务:
[具体任务描述]
Agent将根据指令调用对应能力,返回响应数据。响应格式取决于具体能力点的输出定义.
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
需要配置对应API Key,详见上文环境配置章节
A: 不完全。p-value 只是在零假设下观察到当前或更极端结果的概率。还需检查 effect size(实际效应量)、confidence interval、样本量和 practical significance。小样本下的 p<0.05 可能是 false positive.
A: 对比分组分析和整体汇总分析的趋势方向。如果分组结论和整体结论相反(如各组都显示 A>B,但整体显示 B>A),就是 Simpson's Paradox。此时应以分层分析为准.
A: 观察数据只能发现 correlation(关联),不能直接做 causal inference(因果推断)。需要用 difference-in-differences、propensity score matching、instrumental variable 等准实验方法,并明确假设前提.
===
| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 |
|---|---|---|---|---|
| 数据清洗 | 2小时 | 30分钟 | 1.5小时 | 5% |
| 数据预处理 | 4小时 | 1小时 | 3小时 | 3% |
| 统计分析 | 8小时 | 2小时 | 6小时 | 4% |
| 报告生成 | 6小时 | 1小时 | 5小时 | 2% |
| 可视化制作 | 4小时 | 30分钟 | 3.5小时 | 2% |
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 |
|---|---|---|---|---|
| 处理速度 | 快速 | 较慢 | 中等 | 快速 |
| 易用性 | 中等 | 较高 | 中等 | 高 |
| 功能丰富度 | 高 | 低 | 中等 | 高 |
| 成本 | 低 | 中等 | 中等 | 高 |
| 技术要求 | 低 | 高 | 中等 | 高 |
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 |
|---|---|---|---|---|
| 数据清洗困难 | 数据清洗步骤繁琐,耗时较多 | 影响数据分析效率和质量 | 引入自动化清洗工具 | 时间节约 20% |
| 分析结果不可靠 | 分析方法选择不当,导致结果错误 | 影响决策制定 | 建立方法论框架,指导方法选择 | 准确率提升 10% |
| 报告生成效率低 | 报告格式固定,无法根据需求调整 | 影响报告质量和使用效率 | 开发灵活的模板系统 | 效率提升 30% |
===
| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 |
|---|---|---|---|
| 数据错误 | 数据源错误或格式问题 | 检查数据源和格式,确认数据正确性 | 修正数据源或格式,重新导入数据 |
| 分析结果异常 | 分析方法选择不当或模型错误 | 检查分析方法,验证模型假设 | 调整分析方法或模型,重新进行分析 |
| 系统运行缓慢 | 硬件资源不足或系统配置错误 | 检查硬件资源,调整系统配置 | 增加硬件资源或调整配置,优化系统性能 |
| 通知未收到 | 邮件系统错误或配置问题 | 检查邮件系统,确认配置正确 | 修复邮件系统或重新配置邮件 |
| 脚本执行失败 | 脚本错误或依赖问题 | 检查脚本和依赖,确认脚本正确性 | 修正脚本或添加缺失依赖 |
===
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
针对数据分析理调使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 |
|---|---|---|
| API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token |
| 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 |
| 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 |
| 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 |
| 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 |
| 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 |
| 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 |
| 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 |
| 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |