Install
openclaw skills install @blackcorvu/doubao-asr-flash火山引擎豆包语音识别 API(录音文件极速版)。把本地音频/视频文件或公网音频 URL 转成文字:录音转写、会议纪要、播客字幕、语音输入、视频伴音提取文字。 一次 HTTP POST 返回结果,无需轮询。支持 WAV/MP3/OGG 直传,其他格式 (m4a/flac/aac/视频等)自动用 ffmpeg 转码。Use whenever the user wants to 转写/识别/听写 音频或视频中的语音,生成文字稿、字幕(SRT)、会议纪要等。
openclaw skills install @blackcorvu/doubao-asr-flash把音频/视频里的语音转成文字,基于火山引擎豆包语音识别「录音文件极速版」
(openspeech.bytedance.com/api/v3/auc/bigmodel/recognize/flash)。
中文识别业界领先(普通话/粤语/四川话等方言 + 13+ 语言)。
volc.bigasr.auc_turbo 资源权限,按引导开通即可)。X-Api-Key。# 方式 A(推荐,持久):写入配置文件
mkdir -p ~/.config/doubao-asr
cat > ~/.config/doubao-asr/config.json <<'EOF'
{"api_key": "你的API Key"}
EOF
# 方式 B:环境变量(当前 shell 有效)
export DOUBAO_ASR_API_KEY="你的API Key"
# 方式 C:每次调用临时传(不推荐)
python .../asr.py 音频.mp3 --api-key "你的API Key"
存储到
~/.config/doubao-asr/config.json后,之后所有会话无需再传 Key。
脚本位于 scripts/asr.py(相对 skill 目录),用绝对路径调用:
# 假设 skill 已安装到 <你的 skills 目录>/doubao-asr/(如 ~/.pi/agent/skills/doubao-asr 或 ~/.claude/skills/doubao-asr)
ASR="<你的 skills 目录>/doubao-asr/scripts/asr.py"
PYTHONIOENCODING=utf-8 python3 "$ASR" /path/to/录音.m4a # 转文字
PYTHONIOENCODING=utf-8 python3 "$ASR" /path/to/会议.mp4 # 视频自动提取音频
PYTHONIOENCODING=utf-8 python3 "$ASR" https://example.com/a.mp3 # 公网 URL 直传
PYTHONIOENCODING=utf-8 python3 "$ASR" a.m4a --out /tmp/文字稿.txt # 保存结果
PYTHONIOENCODING=utf-8 python3 "$ASR" a.m4a --json # 完整 JSON(含逐句时间戳)
PYTHONIOENCODING=utf-8 python3 "$ASR" a.m4a --srt --out a.srt # 导出 SRT 字幕
默认输出纯文本全文;--json 输出含 utterances(每句起止时间)的完整响应。
ffmpeg -ar 16000 -ac 1 -b:a 64k 转 mp3。result.text(全文)和 result.utterances(逐句时间戳)。| 错误码 | 含义 | 处理 |
|---|---|---|
| 20000000 | 成功 | - |
| 20000003 | 静音音频 | 检查录音是否为空 |
| 20000018 | 音频格式不正确 | 检查文件是否损坏/伪装扩展名 |
| 20000015 | 空音频 | - |
| 2xxxxxxx 鉴权/资源 | API Key 错/未开通资源 | 检查 Key、确认已开通 volc.bigasr.auc_turbo |
| HTTP 429 | QPS/并发超限 | 稍后重试 |
DOUBAO_ASR_API_KEY(可选,有配置文件则不需要)~/.config/doubao-asr/config.json:{"api_key": "..."}