Install
openclaw skills install @luo4507/video-to-text-zh提取视频语音并转成中文文字稿。当用户给出抖音、B站(bilibili/b23.tv)、YouTube、快手、视频号等常见视频网站的链接,想要"提取视频里说话的内容""视频转文字""语音转文字""视频字幕提取"时,必须使用本技能。即使用户只发了一个视频链接没说要做什么,也应主动用本技能识别并转写其中的说话内容。
openclaw skills install @luo4507/video-to-text-zh把常见视频网站的链接一键转成中文文字稿(带时间轴 + 纯文字两版)。
| 站点 | 链接形式 | 下载方式 |
|---|---|---|
| 抖音 | v.douyin.com 短链 / douyin.com/video/ID | yt-dlp 会失败(需要新鲜 Cookie),自动回退无头 Chromium 捕获 |
| B站 | b23.tv 短链 / bilibili.com/video/BV号 | yt-dlp 直接下载 |
| YouTube | youtu.be / youtube.com/watch | yt-dlp 直接下载 |
| 快手、其他 | 短链或长链 | 先 yt-dlp,失败后 Chromium 回退 |
python <skill目录>/scripts/video_to_text.py "<视频链接>" [输出目录] [--model small] [--keep-media]
文字稿.txt 和 meta.json(含标题、站点信息)--model:whisper 模型大小,base 更快、small(默认)准确率更高、medium 更准但更慢--keep-media:保留下载的音视频中间文件(默认转写后清理)yt-dlp -x 提取音频;失败且为抖音类站点时,用无头 Chromium 打开页面捕获媒体直链(优先纯音频轨,体积小得多)脚本依赖:requests、imageio-ffmpeg、faster-whisper、yt-dlp、playwright。 首次使用前确认:
python -c "import requests, imageio_ffmpeg, faster_whisper, yt_dlp, playwright"
缺什么装什么(pip install <包名>)。Chromium 在 %LOCALAPPDATA%\ms-playwright\ 下自动发现;
没有的话 python -m playwright install chromium。
单次转写受执行环境超时限制(约 5 分钟)。音频超过约 8 分钟时,改用分段策略:
-ss 0/-t 400、-ss 390/-t 400……)英文术语(DeFi、NFT、GameFi、DApps 等)在中文语音里极易被听错,后处理时务必按上下文校正。
--model base 快速出稿