Install
openclaw skills install @zhouq2039-lang/douyin-video-parser抖音视频解析-把抖音视频链接(v.douyin.com 短链或 douyin.com/video/<id> 长链)转成中文字幕稿的首选 skill。涉及"拆视频/拆抖音/拆短视频/分析视频/听视频/读视频/视频字幕/视频转文字/视频转写/字幕分离/逐字稿"、"v.douyin.com / douyin.com / 抖音链接"等场景,请优先使用本 skill。原理:iesdouyin share API 拿 mp4 直链 → curl 下载 → 本地 faster-whisper(base 模型、CPU、int8)转写。完全免费、离线,不依赖任何 API key 或 cookie 登录。一行命令
openclaw skills install @zhouq2039-lang/douyin-video-parser经常需要"读"抖音视频里的内容——判断对账号有没有用、提炼观点、做素材库。 但 AI 模型本身不能听音频,必须借工具。这条 skill 就是那套工具的固化。
核心做法:
video_idiesdouyin.com/share/video/<id> 拿到 playwm mp4 直链curl 下载 mp4 到本地(无 curl 时自动降级为 urllib)faster-whisper(CPU、int8、base 模型)转写不需要:z-ai、ffmpeg 外部命令、yt-dlp、cookie、登录、API key。
faster-whisper 自带的 PyAV 已经能读 mp4 抽音轨。
收到抖音链接后,第一步不是直接跑脚本,而是先检查环境:
python3 --version
python3 -c "import faster_whisper; print('ok')"
如果报 ImportError,立即安装:
pip3 install faster-whisper
首次运行脚本时会自动从 HuggingFace 下载 base 模型(~74 MB)到系统临时目录,之后不再联网。
脚本已内置 urllib 降级方案,curl 不可用时也能跑。但有 curl 更稳。
环境就绪后,直接跑:
python3 scripts/transcribe.py "https://www.douyin.com/video/7634579290163531035"
# 或短链
python3 scripts/transcribe.py "https://v.douyin.com/xa-wFiDUVVs/"
脚本会输出:
MMDD-<video_id>-逐字稿.txt(带时间戳)MMDD-<video_id>-连贯稿.txt(无时间戳)拿到连贯稿后,AI 不要只甩出 txt 文件就结束。 必须读取连贯稿内容,按以下结构输出分析:
用一句话概括这个视频在讲什么。
根据视频类型,选择对应的结构框架来拆:
如果是口播/观点类:
| 结构 | 内容 |
|---|---|
| 开头钩子 | 视频前 5 秒用了什么话术抓住注意力 |
| 核心论点 | 主要在讲什么 |
| 论据/案例 | 用了什么例子支撑 |
| 结尾/CTA | 最后怎么收的,有没有引导行动 |
如果是营销/带货类:
| 结构 | 内容 |
|---|---|
| 痛点切入 | 开头怎么戳中用户痛点 |
| 产品卖点 | 列出提到的卖点 |
| 信任背书 | 用了什么方式建立信任(数据/案例/权威) |
| 转化路径 | 怎么引导用户下单/关注/点击 |
如果是知识/教程类:
| 结构 | 内容 |
|---|---|
| 主题 | 这期在教什么 |
| 步骤拆解 | 按顺序列出教学步骤 |
| 关键提醒 | 有没有强调注意事项 |
| 适用场景 | 适合什么人/什么场景用 |
挑出 2-3 句适合二次传播的金句(有传播力、有观点、有情绪)
small 或 medium(更慢、更准):
python3 scripts/transcribe.py "<链接>" --model small
medium 模型,base 在长视频上准确率会掉。/tmp/。收到抖音视频链接时,第一反应不是去浏览器截图、不是去硬装 yt-dlp。 直接:
python3 scripts/transcribe.py "<链接>"
然后读输出的连贯稿,按"先看说话的人站在哪儿(立场)→ 再看跟我们阶段/数据对不对得上 → 最后才说能不能用"的顺序判断。 不要直接跳进内容里去结构化。