Install
openclaw skills install @thcjp/llm-provider-whisper-v1-tool-freeopenclaw skills install @thcjp/llm-provider-whisper-v1-tool-free功能说明: 本技能涵盖 中文交互、化工作流场景 等核心能力。
Whisper v1 语音转文字工具(免费版)基于 Whisper v1 稳定版本,提供简洁可靠的本地语音转文字能力。v1 版本接口固化、行为稳定,适合需要长期维护与脚本化的个人用户。
免费版聚焦核心转录能力,专业版(llm-provider-whisper-v1-tool-pro)在此基础上提供批量处理、模型管理、性能调优与服务化部署等高级能力。
| 能力 | 免费版 | 说明 |
|---|---|---|
| 单文件转录 | 支持 | v1 稳定 CLI 接口 |
| 输出格式 | txt/srt/vtt/json | 覆盖常见字幕需求 |
| 翻译模式 | 支持 | 音频转英文文本 |
| 模型选择 | tiny/base/small | 轻量模型优先 |
| 自动语言检测 | 支持 | 省略 --language 自动识别 |
| 模型缓存 | 支持 | 首次下载后离线可用 |
| 批量处理 | 不支持 | 升级专业版 |
| 模型管理 | 不支持 | 升级专业版 |
| 性能调优 | 不支持 | 升级专业版 |
用input_params参数进行配置。
输出: 返回核心功能执行的执行结果,包含操作状态和输出数据。
input_params参数,支持创建/查询/导出操作用config_options参数进行配置。
输出: 返回参数配置与调用的执行结果,包含操作状态和输出数据。
config_options参数,支持修改/重置/导入操作用output_format参数进行配置。
输出: 返回结果处理与输出的执行结果,包含操作状态和输出数据。
output_format参数,支持导出/保存/转换操作
能力覆盖范围:本skill的核心能力覆盖以下场景关键词:Whisper、稳定版本地转录工、支持基础语音转文、字与字幕生成、适合个人快速上手、稳定版本的本地语、音转文字工具、核心能力、稳定版、转录能力、接口简洁可靠、wav、等常见音频格式、等多种字幕格式、内置翻译模式、任意语言转英文、模型自动下载与本、地缓存等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持。将播客录音转为文字稿,便于检索与归档。
# 转录为纯文本
whisper podcast_ep01.mp3 --model small --output_format txt --output_dir ./transcripts/
# 生成带时间戳的字幕
mp3 --model small --output_format srt --output_dir ./subtitles/
为学习视频生成中文字幕。
# 提取音频
ffmpeg -i lecture.mp4 -vn -ar 16000 -ac 1 -c:a pcm_s16le lecture.wav
# 转录中文字幕
whisper lecture.wav --model small --language zh --output_format srt --output_dir ./subs/
将外语音频翻译为英文便于阅读。
# 翻译模式(输出英文)
whisper french_interview.m4a --task translate --model base --output_format txt
以下场景Whisper v1转录免费版不适合处理:
需要文本翻译、多语言转换、本地化处理时使用。不适用于非本工具能力范围的需求。
# pip 安装
pip install -U llm-provider-whisper
# 验证版本
whisper --help
# macOS
brew install ffmpeg
# Ubuntu / Debian
sudo apt install ffmpeg
# Windows
scoop install ffmpeg
whisper audio.mp3 --model tiny --output_format txt --output_dir .
首次运行自动下载模型到 $HOME/.cache/whisper/。
# 标准转录
whisper <input> --model <model> --task transcribe --language <lang> --output_format <fmt> --output_dir <dir>
# 翻译模式
whisper <input> --model <model> --task translate --output_format <fmt> --output_dir <dir>
| 模型 | 参数量 | 适用场景 | 免费版推荐 |
|---|---|---|---|
| tiny | 39M | 快速预览、实时场景 | 推荐 |
| base | 74M | 清晰录音、简单内容 | 推荐 |
| small | 244M | 日常使用、中文转录 | 推荐 |
| medium | 769M | 专业转录、高准确度 | 可用(较慢) |
| large | 1550M | 最高精度需求 | 可用(很慢) |
免费版推荐 tiny / base / small,平衡速度与准确度。更高精度需求建议升级专业版启用 GPU 加速。
| 格式 | 用途 | 特点 |
|---|---|---|
| txt | 纯文本阅读 | 无时间戳,最简洁 |
| srt | 视频字幕 | 通用字幕格式,带时间戳 |
| vtt | Web 字幕 | HTML5 视频兼容 |
| json | 程序处理 | 含完整时间戳与置信度 |
| tsv | 数据分析 | 表格格式,便于 Excel |
# 标准预处理
ffmpeg -i input.mp3 -ar 16000 -ac 1 -c:a pcm_s16le normalized.wav
whisper normalized.wav --model small --language zh
语言指定策略
--language,跳过检测加速--language zh--language env1 稳定性优势
成本控制
v1 是稳定版本,CLI 接口与模型行为经过充分验证,适合长期维护的生产脚本。后续版本可能引入新特性,但 v1 保证向后兼容。
模型托管在 Hugging Face,可手动下载 .pt 文件放入 $HOME/.cache/whisper/。文件名格式如 small.pt、base.pt。
small 或 medium)--languageinitial_prompt 自定义词典免费版聚焦单文件转录,CPU 推理;专业版支持批量处理、GPU 加速、模型管理与服务化部署。如需高吞吐或自动化,建议升级。
免费版仅支持文件级离线转录。实时流式转录属于专业版特性。
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| llm-provider-whisper | Python 库 | 必需 | pip install -U llm-provider-whisper |
| ffmpeg | 系统工具 | 必需 | brew install ffmpeg / apt install ffmpeg |
| PyTorch | Python 库 | 必需 | 随 whisper 自动安装 |
| Python 3.9+ | 运行时 | 必需 | python.org 下载 |
| LLM API | API | 必需 | 由Agent内置LLM提供 |
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
| 风险类型 | 防范措施 |
|---|---|
| API密钥泄露 | 通过环境变量配置,禁止硬编码到代码或配置文件中 |
| 命令执行风险 | 仅执行白名单命令,避免拼接用户输入到命令行参数中 |
| 网络通信安全 | 使用HTTPS协议,验证SSL证书有效性 |
| 敏感数据暴露 | 输出结果中不包含密钥、令牌等敏感信息 |
使用前请确认已阅读依赖说明章节,确保运行环境满足安全要求。
| 操作场景 | 手动耗时 | 自动化耗时 | 效率提升 |
|---|---|---|---|
| 文件解析与提取 | 5-10分钟/个 | <5秒/个 | 60-120x |
| 批量文件处理(100个) | 8-16小时 | <5分钟 | 96-192x |
| API调用与响应解析 | 2-3分钟/次 | <1秒/次 | 120-180x |
| 多接口数据聚合 | 15-30分钟 | <10秒 | 90-180x |
| 命令执行与结果收集 | 3-5分钟/次 | <2秒/次 | 90-150x |
| 重复任务批量执行 | 因任务而异 | 线性缩减 | 5-50x |
| 错误排查与修复 | 10-30分钟 | <30秒 | 20-60x |
| 对比维度 | 本技能 | 传统手动方式 | 通用脚本工具 |
|---|---|---|---|
| 自动化程度 | 全流程自动 | 完全手动 | 部分自动 |
| 错误处理 | 内置错误恢复 | 依赖人工经验 | 基本try-catch |
| 可复用性 | 参数化配置 | 一次性脚本 | 模板化 |
| 安全合规 | 内置安全检查 | 无安全保障 | 无安全保障 |
| 适用场景 | 核心功能 | 通用场景 | 通用场景 |