Install
openclaw skills install @thcjp/openai-whisper-v1-2Local speech-to-text tool using Whisper CLI for multi-language transcription without requiring an API key, supporting automation and structured output.
openclaw skills install @thcjp/openai-whisper-v1-2功能说明: 本技能涵盖 中文交互、化工作流场景 等核心能力。
| 能力 | 免费版 | 付费版 |
|---|---|---|
| 基础功能 | 支持 | 支持 |
| 大数据集流式处理 | 不支持 | 支持 |
| 多数据源关联查询 | 不支持 | 支持 |
| 可视化图表自动生成 | 不支持 | 支持 |
| 定时数据同步与增量更新 | 不支持 | 支持 |
| 数据质量检测与清洗规则 | 不支持 | 支持 |
| 场景 | 输入 | 输出 |
|---|---|---|
| 用Whisper C | 目标数据与配置参数 | 处理结果与执行状态 |
| 免API Key | 目标数据与配置参数 | 处理结果与执行状态 |
| 付费增强版 | 目标数据与配置参数 | 处理结果与执行状态 |
不适用于:需要人工判断的复杂决策场景
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| content | string | 否 | 处理的内容输入 |
| mode | string | 否 | 处理模式, 可选值: json/text/markdown |
| style | string | 否 | 输出风格, 参考 references/style.md |
{
"success": true,
"data": {
"result": "处理结果",
"status": "success",
"metadata": {
"metadata": {
"template_used": "reviewer",
"word_count": 0,
"style": "专业"
}
},
"error": null
}
输出模板参考: assets/output.json
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
A: 请参考使用流程和依赖说明章节,确保运行环境满足要求后调用本技能。
| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 |
|---|---|---|---|---|
| 语音转文字 | 5分钟/段 | 1分钟/段 | 4分钟/段 | 5% |
| 文字整理 | 10分钟/段 | 3分钟/段 | 7分钟/段 | 3% |
| 文本编辑 | 15分钟/段 | 5分钟/段 | 10分钟/段 | 2% |
| 内容审核 | 20分钟/段 | 6分钟/段 | 14分钟/段 | 4% |
| 文档生成 | 30分钟/段 | 8分钟/段 | 22分钟/段 | 3% |
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 |
|---|---|---|---|---|
| 易用性 | 高 | 低 | 中 | 高 |
| 准确率 | 高 | 低 | 中 | 高 |
| 运行速度 | 快 | 慢 | 中 | 快 |
| 成本 | 低 | 高 | 中 | 高 |
| 功能丰富度 | 中 | 低 | 中 | 高 |
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 |
|---|---|---|---|---|
| 人工语音转写效率低 | 人工转录需要大量时间,效率低下 | 影响内容创作速度和成本 | 自动化语音转写,提高效率 | 时间节约30% |
| 准确率低 | 人工转录准确性受限于听力和注意力 | 影响内容质量 | Whisper AI高准确率转录 | 准确率提升5% |
| 需要API Key | 需要购买API Key才能使用,增加成本 | 增加使用门槛 | 免API Key使用,降低成本 | 成本节约50% |
A: llm-provider Whisper语音工具v1支持多种语言,包括但不限于英语、中文、西班牙语等,具体支持的语言列表请参考官方文档。
A: llm-provider Whisper语音工具v1是命令行工具,不需要安装额外的软件,只需确保运行环境满足依赖要求即可。
A: llm-provider Whisper语音工具v1的准确率较高,具体准确率取决于输入语音的质量和语言种类。
A: llm-provider Whisper语音工具v1目前不支持断点续传功能,如果需要处理较长的语音文件,请确保文件能够在一次操作中完成。
A: llm-provider Whisper语音工具v1支持批量处理,可以通过命令行参数指定多个语音文件进行转换。
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
针对llm-provider Whisper使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 |
|---|---|---|
| API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token |
| 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 |
| 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 |
| 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 |
| 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 |
| 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 |
| 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 |
| 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 |
| 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |