Install
openclaw skills install @2253128/aigc-digital-human-studio在浏览器里做出成品短视频:上传一张人物图片(或一段人物视频)+ 一段文案,自动配音、对口型、套模板、连封面一起生成,导出 1080×1920 竖屏成片。两个入口对应两条线——#/tool/digital_human(数字人视频:图片 + 文案)与 #/tool/lipsync(数字人对口型:视频 + 文案)。内置 94 套真人口播混剪模板(另有素材混剪、新闻体共三档场景),模板支持悬停即播的样片预览与全屏弹层预览;内置 3 个精选公共音色并可一键试听,也能上传自己的配音或克隆专属音色;「自动生成封面」用人物形象作首帧生成 AI 封面,成片第一帧就是它。成片按【固定 999 点/条】计费,与时长无关(1 元 = 100 点)。无需安装任何软件、无需 API Key,打开网页即可用。本包是面向使用者的操作向导,含两个入口怎么选、三步出片、逐项功能说明、计价口径与常见报错对照。需要 API/命令行版本请用同系列的 avatar-autoclip。遇到问题可加技术微信 9872659。
openclaw skills install @2253128/aigc-digital-human-studio一张人物图片(或一段人物视频)+ 一段文案 → 自动配音、对口型、套模板 → 直接导出竖屏成片,封面一起生成。 打开网页就能用,不装软件、不配 Key。
┌── 入口①:数字人视频 #/tool/digital_human
│ 上传【人物图片】 ──► 图片数字人 ─┐
一张图 / 一段视频 ─┤ │
└── 入口②:数字人对口型 #/tool/lipsync │
上传【人物视频】 ──► 口型对齐 ─────┤
▼
一段文案 ──► 自动配音(3 个公共音色 / 你的配音 / 克隆音色)──┘
│
▼
成片模板(94 套真人口播混剪 · 可预览样片)──► 智能剪辑 ──► 成片
自动生成封面(可选)──────────────────────┘ 1080×1920 竖屏
最小的可用输入就是两样东西:一张人物图片 + 一段文字。 收费只有一处需要记:成片 固定 999 点/条(1 元 = 100 点)。
用它:
不要用它:
avatar-autoclip(API + CLI 版)。本节口径取自站方公众号图文《不想露脸、不想录音、不想学剪辑的人,终于也能做口播了》, 配图为该文原图(首发日实拍)。
先问三个问题,不用回答,心里过一遍就行 ——
如果有一个戳到你了,那这件事现在被压缩成了一次点击。
![]() | 🚩 首发上线 · 第一天 一张照片 + 一段文案 点一下「生成成片」 剩下的全自动 不用出镜 · 不用录音 不用剪 · 不用做封面 |
|---|
做内容的人卡住的地方,从来不是"没想法",而是从想法到成片之间那一段又脏又累的活儿。
| 你现在的处境 | 真实的代价 |
|---|---|
| 想露脸,但一想到镜头就发怵 | 内容再好也发不出去 |
| 敢露脸,但状态随时会崩 | 感冒、熬夜、状态差 → 断更 |
| 一个人做号 | 一条片子半天,一周出不了两条 |
| 请人拍 | 钱花了,改一版要等一周 |
| 不会配音、声音一般 | 内容好,但"听起来不专业" |
| 会剪但讨厌剪 | 80% 的时间花在套版式、加字幕、做封面上 |
共同点是:它们都不是"创作",却吃掉了你全部的时间。 而这件工具做的事情,就是把这一段全部接过去。
一张人物图 + 一段文案 →(自动)配音 →(自动)数字人口播 →(自动)套模板剪辑 →(自动)封面 → 成片
你实际只做三件事:传图、粘文案、选模板。 就三件。剩下的按四个阶段自己跑:
| 阶段 | 在做什么 | 耗时 |
|---|---|---|
| ① 规范化形象图 | 本地缩放到目标尺寸并上传 | 秒级 |
| ② 文案转配音 | 把文字变成音频 | 十几秒 |
| ③ 数字人口播 | 生成数字人视频 | 最慢,通常 1~6 分钟 |
| ④ 自动剪辑成片 | 套模板 + 字幕 + AI 首帧封面 | 1~2 分钟 |
进度面板全程可见:每个阶段转圈或打勾,日志滚动显示每一步在做什么、拿到什么结果、第几次重试 —— 你不用猜它卡没卡。

下面这条片子,输入是一张人物照 + 一段约 170 字的口播文案 + 一套真人口播模板:
![]() | 成片实测 29.84 秒 1080×1920 竖屏 · 25fps 字幕:自动生成 封面:AI 首帧封面 口型:对得上 操作时间 约两分钟 (其中一分钟在等) |
|---|
不看演示,看真机结果 —— 拿到就能直接发。 这是成片的第 2 秒和第 22 秒,真实抽帧,没有美化:
| 成片第 2 秒 | 成片第 22 秒 |
|---|---|
![]() | ![]() |
每张卡带封面、名称、9:16 角标;鼠标停上去 320ms 自动播放样片,不用一个个点开猜:

三个场景共 171 套:真人口播混剪 94 套 / 素材混剪 47 套 / 新闻体·门店推广 30 套。 ⚠️ 数字人的成片只能提交给「真人口播混剪」这一组模板。
时长、分辨率、扣费、下载,全在一屏里,没有藏起来的东西:

![]() | 封面也是自动的 AI 首帧封面 由系统生成 不用再开修图软件 成片第一帧就是它 发出去就有可用封面 |
|---|
成片这一步固定 999 算力/条,与时长完全无关,也不会随实际时长被改写。
这一点直接决定你敢不敢批量做:按秒计费时,你每写一句话都在心里算钱 —— 越写越省,越省越干,最后交出去的是一条"省钱省出来的片子"。固定价之后,你写多长只需要考虑内容够不够说清楚。
999 落在**成片(剪辑)**这一步。前面还有配音和数字人,那两步按实际用量单独结算。 页面上的「预计消耗 999 算力 · 成片固定价」与实际扣款一致。
本站不打算"上线即结束":每天迭代一次,每次改动都拍视频记录下来。
因为"自动出片"真正的难点不在某个环节跑不跑得通,而在细节的手感 —— 模板和文案搭不搭、字幕断句自不自然、封面选帧准不准、哪种文案配哪种节奏。 这些只能靠一条一条真实出片去磨。
| 你会看到 | 意味着什么 |
|---|---|
| 每天一个版本 | 你在用的东西,每天都在变好 |
| 每次改动都有视频记录 | 不是口头承诺,是能回看的证据 |
| 你的问题会被排进版本 | 你提的卡点,可能明天就修好了 |
今天上车的人,等于是站在迭代最前面的人。
数字人服务会周期性出问题,日志里能看到上游瞬时故障。但有三件事让人踏实:
日志里会显示 task_id,万一手滑关了网页,还能拿着 ID 继续查;任务记录保存在本机,刷新页面不丢历史。
🚦 一条经验:别同时开多个任务。并发更容易撞上这个故障,串行反而最快。
平台在两个入口提供本产品,区别只在"你手上是什么素材":
| 入口① 数字人视频 | 入口② 数字人对口型 | |
|---|---|---|
| 地址 | #/tool/digital_human | #/tool/lipsync |
| 你上传 | 一张人物图片 | 一段人物视频 |
| 怎么做 | 用图片建立形象,由文案驱动开口 | 保留原视频的画面与动作,只让嘴型对上 |
| 适合 | 只有照片;想换人 / 换场景 | 已有真人出镜素材;想保留真实感 |
| 档位 | 生成模式(速度 ↔ 画质) | 对口型模型(大师版 / 全能版 / 体验版) |
一句话:只有照片走入口①;已经有真人视频、只想改口播内容走入口②。
进入任一入口后,页面顶部的分段控件还能就地切换到另一条线,不用回菜单。
上传成功后原地显示缩略图(视频会静音预览),点「移除」可重换。
格式:图片 jpg / png / webp;视频 mp4 / mov。 挑选要点:正面、五官清楚、光线均匀、不带墨镜;视频建议固定机位、正脸对镜头、不要大幅走动。
手上只有一张"风格参考图"? 想把一张参考图派生成多张同风格人物图再挑一张出片, 用同系列技能
avatar-autoclip(内置参考生图:1 张参考图 → N 张同风格人物图)。 网页版以页面实际显示的功能为准。
声音(三种来源,按需要选一种):
| 方式 | 怎么做 | 什么时候用 |
|---|---|---|
| 公共音色(默认) | 下拉里选 小帅(男声·年轻口播)/ 云泽大叔(男声·成熟沉稳)/ 解说小美(女声·解说) | 最省事,点「试听」先听一句 |
| 用你自己的配音 | 在「上传自己的配音」区域传一段音频 | 你已经有真人录音,想 100% 用本人的声音 |
| 克隆专属音色 | 点「+克隆音色」,传 10–60 秒干净人声 | 想让以后每条片子都用这个声音 |
文案:在「文案内容」里写要念的话。右侧会实时显示 字数 · 预估秒数。
中文语速实测约 5.6 字/秒:要 30 秒写 ~170 字,要 60 秒写 ~335 字。 上传了自己的配音时,文案可以留空(以音频为准)。
⤢ 可全屏预览整套样片。之后左侧会变成进度视图:文案转配音 → 数字人合成 → 套模板成片,每一步带实时状态与日志。跑完直接给播放器 + 下载。
三个场景,共 171 套版式:
| 场景 | 套数 | 用途 |
|---|---|---|
| 真人口播混剪 | 94 套 | 数字人出片走这一组 |
| 素材混剪 | 47 套 | 音频 + 素材,无数字人 |
| 新闻体 / 门店推广 | 30 套 | 标题 + 素材,无口播 |
⚠️ 必须知道的前提:数字人的成片只能提交给「真人口播混剪」这一组模板。 切到另外两个场景时页面会提示 —— 它们走的是另外两条链路,不是数字人。
⤢,大屏播放完整样片,并显示模板名 / 场景 / 画面比例,可直接「使用此模板」。配图(站方公众号图文):模板库网格,悬停 320ms 自动播放样片。
模板决定的是包装:标题样式、字幕样式、转场、背景、贴纸、片头片尾。 换模板 = 同一段素材换一套版式,不用重录。
会不会做出来都长一个样? 光真人口播就 94 套,再叠加配音、文案、封面的差异,不会撞脸。
音频完全不需要你自己录 —— 只输入文字就行。但如果你想控制声音,有三条路:
| 方式 | 怎么用 | 像不像本人 |
|---|---|---|
| A. 用平台音色(默认) | 下拉选 → 点「试听」 | 通用音色,不像某个具体人 |
| B. 克隆你自己的音色 | 上传 10~60 秒本人声音样本 → 克隆 | ✅ 像本人 |
| C. 上传你自己的配音 | 切到「上传自己的配音」→ 传音频 | ✅ 100% 就是这段音频 |
task_id。三件让人踏实的事(上游偶发故障时):
🚦 一条经验:别同时开多个任务。 并发更容易撞上这个故障,串行反而最快。
1 元 = 100 点。
| 项目 | 价格 | 说明 |
|---|---|---|
| 成片(智能剪辑) | 固定 999 点/条 | 与成片时长无关,30 秒和 60 秒同价 |
| 文案转配音 | 按上游实际点数(实测约 0.7 点/次) | 传自己的配音则不产生此项 |
| 入口① 数字人(图片线) | 按生成模式分档 × 输入秒数 | 档位越高越贵;页面会显示预计消耗 |
| 入口② 对口型(视频线) | 按模型分档 × 音频真实时长 | 大师版 21 · 全能版 15 · 体验版 3(点/秒) |
页面底部会直接显示「预计消耗」,按下单口径与实际扣款一致。
实测参考:一条 176 字文案(约 30 秒)的成片,从提交到出片约 9~10 分钟,成片 1080×1920、29.84 秒。
| 现象 | 原因与处理 |
|---|---|
| 提示"未登录 / 需要登录" | 工具页顶栏可点登录;登录后再提交。 |
| 提交被拦下,要求肖像权授权 | 合规硬门禁:必须勾选「我已获得该肖像权人的授权」才能提交。这是刻意做的,不勾选请求根本不会发出、也不计费。 |
| 模板/音色区显示"加载失败" | 多为登录态失效或网络抖动。点右上「刷新」重试;仍不行就刷新页面。 |
| 成片时长比预期短/长 | 时长由配音决定 → 配音长度由字数决定。中文约 5.6 字/秒,按这个反推字数。 |
| 数字人这一步特别慢 | 正常。数字人合成通常是整条链路里最慢的一段(几十秒到几分钟),页面有进度和日志可看。 |
| 出片了但第一帧没有封面 | 检查「封面」开关是否被关掉——关掉时会用模板默认首帧。 |
| 音色听起来不像某个人 | 公共音色是通用音色。要像本人:用「克隆音色」(10–60 秒干净人声),或直接上传本人的配音音频。 |
| 换一段文案要重做全部吗 | 不用。同一个形象 + 同一套模板,改文案再生成即可,出的是同一个人、同一套包装的新片。 |
| 会不会做出来都长一个样? | 不会。模板三个场景共 171 套(光真人口播 94 套),再叠加配音、文案、封面的差异。 |
| 一直停在「数字人口播」是卡住了吗? | 正常,这一步通常 1~6 分钟。看日志里的 #N processing 有没有在推进就知道。 |
| 需要下载安装吗? | 不用。网页打开就能用,零依赖;API Key 只留在服务端,不会下发到浏览器。 |
| 文案写多长合适? | 输入框下方实时显示字数和预计时长(中文实测 5.6 字/秒);写 30 秒约 170 字、60 秒约 335 字。 |
| 生成模式怎么选? | 建议直接选高清档 —— 这是这条链路里画质最稳的一档,省下来的那点时间不值得拿画面换。 |
| 支持什么格式? | 图片 jpg / png / webp;视频 mp4 / mov;音频 mp3 / wav / m4a。 |
| 能不能批量做? | 网页适合单条手动出片;要批量脚本化,用同系列 avatar-autoclip(两边共用一套逻辑)。 |
| 上游报瞬时故障怎么办? | 不用管:失败任务不扣费,且程序会自动重试(默认 3 次)。但别同时开多个任务,串行最快。 |
| 能改接口地址吗? | 不能,也不需要。 网页版走站点自己的 /relay 通道,页面里没有任何可填的接口地址;API Key 只留在服务端,不会下发到浏览器。所以「改地址→一直报错」这种情况在本产品上不会发生。 |
关于"封装":网页版是最轻的封装形态 —— 用户拿到的是一个受控的网页, 不是可以直连上游的 Key,也没有可改的接口配置。 需要更强的管控(私有化部署 / 自有域名 / 白标),加微信 9872659 聊。
| 文件 | 内容 |
|---|---|
README.md | 快速上手与能力速查 |
references/功能介绍.md | 逐项功能的详细说明(含参数口径与实测数据) |
references/接口速查.md | 网页背后的真实接口(想自己写脚本 / 排错时看) |
references/常见问题.md | 报错与现象对照表 |
references/功能介绍.md §13 | 公众号图文配图清单(8 张,含图注)。图片不随包分发(平台限制),需要原图加微信 9872659 |
LICENSE.md | MIT 许可 |
配图为上线首日截图,与当前界面在细节上可能略有差异(例如音色下拉、模板面板布局); 功能与口径以本文档与页面实际显示为准。
遇到问题、想要批量出片方案、需要定制模板,都可以直接加技术微信:
| 渠道 | 联系方式 | 说明 |
|---|---|---|
| 技术微信 | 9872659 | 加好友请备注「数字人」;出片问题、批量需求、模板定制都走这里 |
| 产品入口 | https://aigc.a7w.cn | 平台首页,登录后从「数字人视频」进入 |
| API / 命令行版 | 同系列技能 avatar-autoclip | 要程序化、批量、无人值守出片时用 |
提问题时把任务号(进度区可复制)和截图一起发过来,定位最快。
| 名称 | 链接 | 说明 |
|---|---|---|
| 算力集市(平台首页) | https://aigc.a7w.cn | 本产品的入口站点 |
| 数字人视频(入口①) | https://aigc.a7w.cn/index.html#/tool/digital_human | 图片 + 文案 → 数字人 → 套模板 |
| 数字人对口型(入口②) | https://aigc.a7w.cn/index.html#/tool/lipsync | 视频 + 文案 → 对口型 → 套模板 |
| API 开放平台 | https://api.a7w.cn/ | 注册领 Key;要程序化调用走这里 |
| 同系列技能 | avatar-autoclip | API + CLI 版的数字人自动剪辑 |
技术微信:9872659(加好友请备注「数字人」)
出片报错、批量出片、模板定制、想要 API 版接入,都欢迎直接加微信。
技术微信:9872659
avatar-autoclip