Install
openclaw skills install @panting09266-ai/bilibili-video-studioB站视频一站式解析与创作工场。用户直接输入 B 站视频 URL 加一句简单要求即可:视频转文字(字幕/口播/画面内容)、内容分析总结、爆款视频拆解(按带货/流量逻辑拆结构分段、脚本类型、爆款归因、六维评分报告,照着学照着抄)、视频转脚本(镜头/运镜/转场/情绪/时间线/屏幕文字)、爆款脚本生成(原骨架改写成你的脚本,或按方向/目的/商品原创口播脚本,含分段表与六维质检评分)、视频提示词反推(画面和内容转成 agent 可理解的提示词)、视频提取 PPT 内容(关键帧文字+幻灯OCR+完整口播稿)、备考笔记整理(题库/考点/带背视频按题号+标准答案重组)。底层经 Cue Omni Reader
openclaw skills install @panting09266-ai/bilibili-video-studio输入一个 B 站视频 URL + 一句需求,产出可直接使用的文字稿、拆解报告、分镜脚本、原创脚本、生成提示词或课件内容。管线:Cue Omni Reader 远程端点(解析)→ 大模型(场景化加工)→ 交付。
mcp.cuecue.cn)抓取并解析,解析结果由大模型加工后交付。no_store=true:源文件与解析结果不落盘、不持久化于服务端。CUE_API_KEY 传入,避免明文写入配置文件。| # | 场景 | 用户典型说法 | 交付物 |
|---|---|---|---|
| 1 | 视频转文字 | 转文字 / 文字稿 / 字幕 / 转录 / 提取文字 | 口播全文 + 画面文字稿 + 时间线合并稿 |
| 2 | 内容分析总结 | 总结一下 / 讲了什么 / 分析 / 摘要 | 主旨 + 结构分段 + 核心要点 + 金句 + 受众分析 |
| 3 | 爆款视频拆解 | 拆解 / 为什么火 / 对标 / 抄作业 / 照着学 | 结构分段表 + 脚本类型 + 爆款归因 + 六维评分报告 + 可抄清单 |
| 4 | 视频转脚本 | 转脚本 / 分镜 / 还原脚本 | 分镜脚本表(镜头/运镜/转场/情绪/时间线/屏幕文字)+ 口播净稿 |
| 5 | 爆款脚本生成 | 帮我写脚本 / 改写成我的 / 仿写 / 原创脚本 | 多条脚本(分段表 + 口播全文 + 六维质检评分) |
| 6 | 视频提示词反推 | 反推提示词 / prompt / 提示词 | 风格提示词 + 分镜提示词序列 + TTS 文案 + 结构化 JSON |
| 7 | 视频提取 PPT 内容 | 提取PPT / 课件 / 幻灯 / 逐页内容 / 关键帧截图 | 逐页(去重)幻灯 + 关键帧截图(去重嵌图)+ 清洗讲解稿 + 课件大纲 |
| 8 | 备考笔记整理 | 备考笔记 / 题号+标准答案 / 整理成笔记 / 考点笔记 | 题号+标准答案 备考笔记(含记忆口诀、来源标注) |
路由规则:
Cue API Key:与 cue-omni-reader 技能共用同一把 Key,无需新建。获取:cuecue.cn/hub/api-key(新账号送 500 积分 + 每天 10 免费积分)。推荐用环境变量 CUE_API_KEY 传入(避免明文落盘),或写入本地 ~/.cue/config.json:
# 方式一(推荐):环境变量
export CUE_API_KEY="sk你的key"
# 方式二:本地配置文件
mkdir -p ~/.cue && echo '{"api_key": "sk你的key"}' > ~/.cue/config.json
远程端点直连(无需本地 Bridge、无需配置 MCP):B 站 URL 解析只走远程端点 https://mcp.cuecue.cn/api/omni-reader/mcp/(streamable-http),鉴权头 Authorization: Bearer <Cue Key>。不依赖 ~/.mcp.json 注册 MCP,也不装本地 Bridge;本地 Bridge 仅在降级方案中使用。
手动调用依赖:curl(Python 参考实现另需 python3,仅标准库)。实际使用时 Agent 自动完成解析,用户只需给一个 B 站 URL + 一句需求。
https://mcp.cuecue.cn/api/omni-reader/mcp/(streamable-http)。本地 Bridge 提交 B 站 URL 会立即被拒(REMOTE_REQUEST_REJECTED,retryable:false)——B 站有服务端反爬(直连也是 HTTP 412),本地 Bridge 撞墙即拒;远程端点由 Cue 服务端抓取,可正常解析。parse / get_parse_status / cancel_parse,无 read_result。结果在 get_parse_status 返回 completed 时内联携带(result 字段)。detail 只能用 text:grounded/layout 在远程报 UNSUPPORTED_DETAIL。text 模式的结果已含关键帧画面文字([画面 mm:ss] 标注)+ ASR 口播稿([说话人N mm:ss] 标注)。tools/call 返回是 MCP 信封 {content:[{type:"text",text:"<JSON字符串>"}]},必须先取 content[].text 再 json.loads,否则状态字段永远读不到。响应为 SSE 流(data: 前缀行)。curl -sI "<短链>" 取 Location 解析出 BV 号(Omni 不认短链)。spm_id_from / vd_source / share_source 等,规范为 https://www.bilibili.com/video/BVxxxxxxxx/。?p=N 的按该分P解析;给的是合集/favlist 链接时,先问用户要解析哪个分P。注意:x/web-interface/view 返回的 data.duration 是全部分P时长之和,没带 ?p=N 时默认播 P1——提取前务必用 pages[] 确认目标分P 的真实时长,别把「93 分P 合计 23.7h」误判成「单条 23.7h」而盲目启动全量批量任务。告知用户等待时长后,调用 parse(参考实现见「解析调用手册」)。返回 {"status":"processing","operation_id":"op_..."},记下 operation_id。
循环调用 get_parse_status(wait_ms: 20000),status=completed 后从 result 字段取出全文。解析结果的三类原料:
[画面 mm:ss] ... —— 关键帧画面 OCR 文字(屏幕文字、标题卡、幻灯)[说话人N mm:ss] ... —— ASR 口播全文按「场景交付规范」用解析原料生成对应交付物。事实纪律:口播、屏幕文字、时间戳一律以解析结果为准;镜头、运镜、转场、情绪等解析结果中没有的信息,由大模型基于画面文字与叙事推断,必须标注「⚠️ 推断」。禁止编造视频中不存在的内容。
<BV号>_<场景>.md(如 BV1eR4y1b7MK_爆款拆解.md)。三件套,按用户需要给全或给精简:
[说话人 mm:ss] 时间戳;另出一份净稿(去时间戳、去语气词,可直接当文案用)。[画面 mm:ss] 逐条列出屏幕上出现的文字。| 时间 | 口播 | 屏幕文字 |
|---|
基本盘:标题 / 时长 / UP主 / 标签(来自解析结果与用户提供;播放点赞等数据用户提供了才写)。
结构分段表(核心)——按视频实际逻辑二选一或混合:
| 时间轴 | 段落功能 | 时长 | 手法 | 话术摘录 |
|---|
脚本类型判定:口播干货型 / 剧情演绎型 / 混剪解说型 / 教程演示型 / 测评种草型 / vlog记录型 / 直播切片型……给出判定依据。
爆款归因(两层):
六维评分报告:见「六维评分体系」,表格 + 总分 + 评级(S/A/B/C)+ 每维一句依据。
抄作业清单:可复用的骨架模板(占位符化)、钩子公式、话术库、节奏参数(每段时长配比)。
还原为可拍摄的分镜脚本表:
| 时间线 | 镜头(景别/机位)⚠️推断 | 运镜 ⚠️推断 | 转场 ⚠️推断 | 画面内容 | 屏幕文字 | 口播/台词 | 情绪 | 备注 |
|---|
两种模式,先确认用户要哪种:
每条脚本交付:
把画面和内容转成 agent / 生成式 AI 可直接使用的提示词:
/)与重音(**加粗**)标记。{"style_prompt": "...", "shots": [...], "narration": "..."},供 agent 自动化流水线直接调用。适用于录播课 / 讲座 / 路演 / 培训等含幻灯(PPT/课件)的视频。用户要的不是原始 OCR 流水,而是逐页、去重、带图、可直接复用的课件。
⚠️ 必做纪律:去重 + 清洗 + 滤废帧。否则会产出用户「读不了、图很多重复、内容乱」的废稿(详见下方「坑点」)。这是本技能被反复返工后固化的硬约束。
[画面 mm:ss] | 页标题 | 要点(幻灯 OCR 结构化)。[画面] 识别出的标题;要点来自幻灯 OCR。口播稿只用于补全讲解,不直接当成幻灯正文写进要点列。Omni 解析产物只有文字 + 时间戳,不含图片文件;且 Omni 抽帧预算只到约 3:40,长视频后段抽不到。要补齐全片截图,必须下载整段视频 → ffmpeg 抽帧 → 去重 → 嵌 md:
parse 拿 [画面 mm:ss] + [说话人N](用于文字与定位)。ffmpeg -vf fps=1/2 每 2 秒抽一帧作样本;imagehash.phash),全局聚类,与所有已保留帧汉明距离 > 16 才算新场景;slide_01..NN.png,存入 keyframes_final/<BV>_<分P>/。多 P / 长视频特别注意事项:
data.duration 是全部分P时长之和,未带 ?p=N 默认播 P1。提取前用 pages[] 确认目标分P 真实时长,避免把「93 分P 合计 23.7h」误判成「单条 23.7h」而盲目启动全量批量任务。SOURCE_ACCESS_DENIED(B 站风控,间歇性),走「降级路径」用 MP4 直链;但直链降级的 Omni 抽帧同样只到约 3 分钟,完整截图仍需本管线第 2–3 步下载整段补帧。坑点(反复踩过,必须避免):
提问示例(用户这样问即可得到整理好的课件):
适用于考试 / 面试 / 考证 / 题库 / 带背类视频(教资、公考、高校辅导员、考研、法考、教招等)。这类视频解析原料通常是「题目卡(画面)+ 讲解(口播)」,用户要的不是原始转录稿,而是可直接背诵的备考笔记。
重组规则:
[画面 mm:ss] 与 [说话人N] 中抽题号、题目原文、星级(★)、记忆口诀。[画面] 题目卡/答案文字 > [说话人N] 口播讲解。画面有标准答案以画面为准;画面没有的题目,用口播讲解整理成答案,并清洗 ASR 误识(口误、同音错字)。交付:
<BV号>_备考笔记.md。提问示例(用户这样问即可得到整理好的笔记):
| 维度 | 考察点 | 评分 1-10 |
|---|---|---|
| 钩子力 | 前 3-5 秒留人能力(悬念/冲突/利益点前置) | |
| 节奏密度 | 信息与画面切换频率,无冗余 | |
| 情绪势能 | 情绪唤起与曲线(共鸣/好奇/焦虑/爽感) | |
| 价值密度 | 观众实际获得感(干货/娱乐/情绪价值) | |
| 转化引导 | CTA 清晰度与行动驱动力(关注/点赞/下单) | |
| 可复制性 | 结构与话术可模板化程度(越高越容易抄) |
# ① 提交解析(记下返回的 operation_id)
curl -sS -X POST "https://mcp.cuecue.cn/api/omni-reader/mcp/" \
-H "Authorization: Bearer $(python3 -c "import json;print(json.load(open('$HOME/.cue/config.json'))['api_key'])")" \
-H "Content-Type: application/json" -H "Accept: application/json, text/event-stream" \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/call","params":{"name":"parse","arguments":{"source":"<B站规范URL>","detail":"text"}}}'
# ② 轮询(每 15-20 秒一次,直到 status=completed)
# arguments 换成 {"operation_id":"op_xxx","wait_ms":20000}
# ③ completed 后取 result 字段文本 = 解析全文
import json, subprocess, time, os
KEY = json.load(open(os.path.expanduser("~/.cue/config.json")))["api_key"]
EP = "https://mcp.cuecue.cn/api/omni-reader/mcp/"
def call(name, args, timeout=70):
body = json.dumps({"jsonrpc":"2.0","id":1,"method":"tools/call",
"params":{"name":name,"arguments":args}}).encode()
p = subprocess.run(["curl","-sS","--max-time",str(timeout),"-X","POST",EP,
"-H",f"Authorization: Bearer {KEY}","-H","Content-Type: application/json",
"-H","Accept: application/json, text/event-stream","--data-binary",body],
capture_output=True, text=True)
for line in p.stdout.splitlines():
line = line.strip()
if line.startswith("data: "): line = line[6:]
if line.startswith("{"):
r = json.loads(line)
if "result" in r:
txt = "".join(c.get("text","") for c in r["result"].get("content",[]))
try: return json.loads(txt) # 拆信封后再解析
except Exception: return {"_raw": txt}
raise RuntimeError(json.dumps(r.get("error","unknown"), ensure_ascii=False))
raise RuntimeError("无响应")
st = call("parse", {"source": url, "detail": "text"}) # 提交
op = st.get("operation_id")
while st.get("status") == "processing": # 轮询
time.sleep(min(st.get("poll_after_seconds", 10) or 10, 15))
st = call("get_parse_status", {"operation_id": op, "wait_ms": 20000})
r = st.get("result")
text = r if isinstance(r, str) else (r or {}).get("text") or st.get("text") or ""
| 错误码 | 含义 | 处理 |
|---|---|---|
REMOTE_REQUEST_REJECTED | 多半是误走了本地 Bridge,或 URL 非规范 BV 链接 | 确认走远程端点、URL 已预处理 |
SERVICE_TEMPORARILY_UNAVAILABLE | 服务临时不可用(retryable:true) | 等 10 秒重新提交同一请求 |
UNSUPPORTED_DETAIL | 传了 grounded/layout | 改回 detail:"text" |
SOURCE_TOO_LARGE / 超长视频 | >30 分钟或超出上限 | 引导用户按分P/剪辑分段 |
INSUFFICIENT_CREDITS | 积分不足 | 指引 cuecue.cn/pay 充值或等次日免费额度 |
远程端点不可用时,优先走免登录 MP4 直链降级(见下方「降级路径:SOURCE_ACCESS_DENIED 时」,不涉及任何登录态/Cookie)。若为本地文件,经本地 Bridge(OMNI_ALLOWED_ROOTS 授权目录内)以 detail:"text" 解析,需用户确认。
Q: 用户直接丢了个 b23.tv 短链? 先 curl -sI 解析出 BV 号再提交,Omni 不认短链。
Q: 解析结果只有口播没有画面文字? 该视频可能没有文字版面(纯真人出镜口播)。detail:"text" 已是画面信息最全的模式,layout/grounded 当前不可用,勿再尝试。
Q: 视频超过 30 分钟? 引导用户:分P链接逐个解析;或剪辑分段后走降级方案本地解析。
Q: 要 B 站官方 CC 字幕文件? 官方 CC 字幕需平台登录态,本技能不处理;Omni 的 ASR 结果通常已够用。
Q: 积分/额度? 与 cue-omni-reader 共用:新用户 500 积分 + 每天 10 免费积分,同一视频重复解析会复用结果不重复扣费。
Q: 想要的不是转录稿,而是题号+标准答案的备考笔记? 用场景 8:直接说「按题号+标准答案整理成备考笔记」并附 URL。解析原料里 [画面] 的题目卡是权威答案,[说话人N] 口播用于补全无画面的题目并清洗误识。
Q: 提取 PPT 时同一页出现好几次? 因 Omni 按关键帧抽帧,停留较久的幻灯会在多个帧被重复识别。场景 7 已要求按内容去重——一页一行、保留首次出现时间戳,交付的是 distinct 幻灯而非每一帧识别结果。
Q: 场景 7 用户拿到 PPT 笔记后说「读不了、图太多重复、内容乱」? 必查是否走了正确的去重+清洗管线:① 必须用感知哈希(phash)全局聚类去重,不能用固定间隔抽帧;② 必须按主题重写讲解稿、修正 ASR 音近错字、剥离水印,不能原样堆砌原始 OCR/ASR;③ 必须丢弃片头动画/片尾 logo/同一幻灯的构建中间帧,只留最终完整版。坑点详见解场景 7「必做」章节。
远程端点对 B 站页面 URL 也可能被 B 站风控拦截(返回 SOURCE_ACCESS_DENIED,retryable:false,直连 B 站页面为 HTTP 412)。该拦截是间歇性的、按视频/时段波动——同一条视频换个时间窗口可能直接通过,并非每条都拦;且只作用于需服务端抓取的页面 URL,直链媒体(音频/视频文件 URL,如 SoundHelix 的 .mp3)不经过 B 站页面反爬,通常不受影响。实测:BV1eR4y1b7MK(辅导员带背)正常通过、未触发此错,仅 BV1Gx41187Bj(Axure 课)触发后走 MP4 直链降级。此时先确认视频本身可访问(api.bilibili.com/x/web-interface/view?bvid=<BV号> 返回 code:0 即公开正常),再走「MP4 直链 → 远程 parse」路径,无需用户登录态:
# ① 取 cid
curl -sS --compressed "https://api.bilibili.com/x/web-interface/view?bvid=BVxxxxxxxx" \
-H "User-Agent: Mozilla/5.0" -H "Referer: https://www.bilibili.com/"
# ② 取免登录 360p MP4 直链(durl[0].url,带 deadline 时效参数,需尽快提交)
curl -sS --compressed "https://api.bilibili.com/x/player/playurl?bvid=BVxxxxxxxx&cid=<cid>&qn=64&platform=html5&high_quality=1" \
-H "User-Agent: Mozilla/5.0" -H "Referer: https://www.bilibili.com/"
# ③ 把 MP4 直链作为 source 提交远程端点 parse(detail:"text"),流程同标准工作流
注意事项:
deadline 时效参数,获取后立即提交解析,不要存储复用。PARSE_FAILED(超长),但单个分P 是几分钟短视频,用分P 页面 URL(?p=N) 即可正常通过且覆盖整课——不必依赖整条直链降级。