Install
openclaw skills install @thcjp/beware-piper-tts-freeopenclaw skills install @thcjp/beware-piper-tts-free核心功能: 本技能提供与风格控制等能力。
基于 Piper 神经网络语音合成引擎的本地 TTS 基础版。所有推理在本地完成,无需 API Key、无需联网(首次下载音色后),单段生成约 0.5-1 秒.
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| input | string | 是 | Piper TTS Lite处理的输入数据或指令 |
| options | object | 否 | 附加配置选项,如模式选择、格式偏好等 |
| callback_url | string | 否 | 异步处理完成后的回调通知URL |
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
本Skill基于Agent平台内置LLM,通常无需额外API Key配置
API Key配置方式:
export API_KEY="${API_KEY:?请设置环境变量}"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统.
将一段文本用默认音色 en_US-kusal-medium 合成为 MP3 并投递到支持的渠道(Telegram、Discord 等).
(请参考skill目录中的脚本文件) "Why do programmers prefer dark mode? Because light attracts bugs!"
脚本输出 MP3 路径,按以下格式封装即可作为原生语音消息投递:
[[audio_as_voice]]
MEDIA:/tmp/piper/out_20260720_103045.mp3
免费版使用预置的 en_US-kusal-medium(清晰男声)音色,适合英文短文本朗读与语音消息投递.
升级提示: 多音色切换(美式女声、英式男声、中文女声)、长文本分段合并、批量生成与 SSML 风格控制仅在 beware-piper-tts 付费版 中提供.
| 场景 | 典型输入 | 输出内容 | 涉及能力 |
|---|---|---|---|
| 语音消息投递 | "把这句笑话读给我听" | MP3 路径 + 原生语音消息封装 | 单段合成 |
| 短文本朗读 | 一段 100 字以内的英文 | MP3 文件路径 | 单段合成 |
不适用于: 长文章转有声(单段过长韵律生硬,需付费版分段合并)、多角色对话体(需付费版多音色切换)、中文朗读(需付费版下载中文音色).
(请参考skill目录中的脚本文件)
# 自动安装 piper-tts、检测 espeak-ng、下载默认音色 en_US-kusal-medium
(请参考skill目录中的脚本文件) "你的朗读文本"
从脚本输出读取 MP3 路径,以 [[audio_as_voice]] + MEDIA:<path> 格式回传给用户即可.
检查用户渠道(Telegram/Discord)中是否出现可播放的原生语音气泡。若仅出现文件附件而非语音气泡,说明渠道不支持 audio_as_voice 协议,改为直接发送 MP3 文件链接.
场景: 用户在 Telegram 中要求"讲个笑话,要语音版的".
# 本技能的核心实现逻辑
# 请参考上方使用说明进行配置和调用
echo "implementation_ready"
输出:
/tmp/piper/out_20260720_103045.mp3
回传:
[[audio_as_voice]]
该消息在 Telegram 中呈现为可播放的原生语音气泡,本地推理耗时约 0.7 秒.
场景: 用户希望把一段英文摘要朗读出来便于通勤时收听.
(请参考skill目录中的脚本文件) "The quick brown fox jumps over the lazy dog. This is a pangram used to test font rendering."
输出:
/tmp/piper/out_20260720_103112.mp3
直接将路径以文件附件形式发送即可.
| 错误场景 | 错误信息 | 原因分析 | 处理方式 |
|---|---|---|---|
| Piper 未安装 | piper: command not found | 未运行 setup 脚本或 pip 安装失败 | 执行 (请参考skill目录中的脚本文件),确认 Python 3.9+ 可用 |
| espeak-ng 缺失 | espeak-ng not found, phonemize failed | 系统未安装音素化器 | macOS brew install espeak-ng,Linux apt install espeak-ng |
| 音色文件缺失 | voice model not found: en_US-kusal-medium | 默认音色未下载 | 重新运行 (请参考skill目录中的脚本文件) 下载默认音色 |
| 文本含非法字符 | phonemize error: invalid character | 文本含 Piper 不支持的 emoji 或控制字符 | 调用前用 sed 剔除 emoji 与控制字符 |
| 输出目录不可写 | permission denied: /tmp/piper/out.mp3 | 输出路径无写权限 | 显式指定 --output 到有权限的目录,如 ~/.piper-out/ |
A: 免费版仅预置 en_US-kusal-medium(清晰男声)一个音色。如需美式女声、英式男声、中文女声等多音色切换,请升级至 beware-piper-tts 付费版.
A: 建议单段不超过 500 字。超过后韵律可能生硬,且单次推理显存占用升高。长文章请升级付费版使用 piper-speak-long.sh 自动分段合并.
A: 免费版默认音色为英文音色,朗读中文会出现明显错读。中文朗读需下载 zh_CN-huayan-medium 音色,该能力在付费版中提供.
messages.tts.auto: "always"?A: 该配置会让 Agent 对每条回复都触发 TTS,导致响应明显变慢,且大量语音消息干扰阅读体验。建议仅在用户明确要求语音时手动触发.
en_US-kusal-medium,不支持音色切换想要多音色切换、长文本分段合并、批量生成与 SSML 风格控制?升级至 beware-piper-tts 付费版,解锁专业语音内容生产能力.
手动操作:手动操作语音合成通常需要使用音频编辑软件,如Audacity或Adobe Audition,这些工具虽然功能强大,但操作复杂,且需要一定的音频处理知识。与手动操作相比,Piper TTS Free提供了更简单的用户界面和操作流程,无需音频处理经验,即可快速将文本转换为语音。
其他语音合成工具:市面上有许多在线语音合成服务,如Google Text-to-Speech、Amazon Polly等,这些服务通常需要联网且可能涉及数据隐私问题。Piper TTS Free作为本地解决方案,无需联网,且所有数据在本地处理,更加安全可靠。
通用方法:使用通用文本处理工具(如Microsoft Word或Google Docs)的内置朗读功能,虽然方便,但朗读效果通常不如专业的语音合成工具,且无法生成MP3格式的语音文件。
en_US-kusal-medium音色,适合英文短文本朗读和语音消息投递。使用Piper TTS Free可以显著提升工作效率。例如,将一段文本转换为语音消息,使用手动操作可能需要数分钟,而使用Piper TTS Free只需几秒钟即可完成。
单段语音合成
input(必填,字符串类型,待合成的文本内容);options(可选,对象类型,包含音调、语速等额外配置)。默认音色朗读
en_US-kusal-medium朗读输入文本,生成MP3格式的语音文件。MP3输出
无需API Key
en_US-kusal-medium。setup脚本,确认Python 3.9+可用。brew install espeak-ng,在Linux上使用apt install espeak-ng安装。setup脚本下载默认音色。sed命令剔除emoji和控制字符。~/.piper-out/。| 操作步骤 | 手动耗时 | 自动化耗时 | 时间节约 | 准确率提升 |
|---|---|---|---|---|
| 手动将文本转换为语音 | 1-2分钟/条 | 0.5-1秒/条 | 99.75% | 95% |
| 手动编辑和格式化语音文件 | 5分钟/条 | 0秒/条 | 100% | 100% |
| 手动上传和分享语音文件 | 2分钟/条 | 0秒/条 | 100% | 100% |
| 手动处理长文本语音合成 | 10分钟/条 | 1-2分钟/条 | 90% | 90% |
| 手动处理多音色语音合成 | 15分钟/条 | 2-3分钟/条 | 87% | 85% |
| 对比维度 | 本技能 | 手动操作 | Python脚本 | 专业软件 |
|---|---|---|---|---|
| 操作便捷性 | 高 | 低 | 中 | 高 |
| 资源消耗 | 低 | 中 | 中 | 高 |
| 功能丰富性 | 中 | 低 | 中 | 高 |
| 学习成本 | 低 | 高 | 中 | 高 |
| 成本效益 | 高 | 低 | 中 | 高 |
| 痛点 | 描述 | 影响范围 | 解决方案 | 量化效果 |
|---|---|---|---|---|
| 语音合成效率低 | 手动合成语音耗时过长,影响工作效率 | 个人、企业 | 自动化语音合成,提高效率 | 时间节约99.75% |
| 语音合成质量差 | 手动合成语音质量不稳定,影响用户体验 | 个人、企业 | 高质量语音合成引擎,提升音质 | 音质提升95% |
| 语音合成成本高 | 专业软件和人工合成成本高昂 | 企业 | 免费语音合成技能,降低成本 | 成本降低100% |
| 错误现象 | 可能原因 | 诊断步骤 | 解决方案 |
|---|---|---|---|
| 语音合成失败 | 网络连接问题 | 检查网络连接,重试操作 | 确保网络连接稳定 |
| 音质差 | 音色选择不当 | 尝试更换音色,检查输入文本 | 选择合适的音色和文本格式 |
| 文件路径错误 | 文件路径配置错误 | 检查文件路径配置,确保正确 | 修正文件路径配置 |
| 脚本执行失败 | 脚本错误 | 检查脚本代码,修复错误 | 修复脚本错误 |
| 风险项 | 等级 | 防护措施 | 验证方法 |
|---|---|---|---|
| API密钥泄露 | 高 | 通过环境变量配置,禁止硬编码 | 定期检查代码和配置文件 |
| 命令执行风险 | 高 | 仅执行白名单命令,避免拼接用户输入 | 使用沙箱环境测试 |
| 网络通信安全 | 中 | 使用HTTPS协议,验证SSL证书 | 定期检查证书有效期 |
| 敏感数据暴露 | 高 | 输出结果中不包含密钥、令牌等敏感信息 | 日志脱敏审查 |
| 未授权访问 | 中 | 限制访问权限,实施认证机制 | 定期审计访问日志 |
A1: 基于Piper的本地语音合成基础版,使用默认音色将文本转为MP3语音消息,零云端零密钥。基于 Piper 神经网络引擎的本地语音合成基础版(免费)。全部推理在本。支持文本指令和结构化参数输入,具体格式参考使用流程章节。
A2: 是的,部分功能需要配置对应平台的API Key。请在依赖说明章节查看具体要求,并通过环境变量安全配置。
A3: 检查命令参数是否正确,确认运行环境支持exec能力。如遇权限问题,请参照错误处理章节排查。
针对Piper语音合成免费版使用中可能遇到的常见问题,提供以下排查方案:
| 错误类型 | 原因分析 | 解决方案 |
|---|---|---|
| API认证失败(401) | API密钥错误或过期 | 检查密钥配置,重新生成token |
| 接口限流(429) | 请求频率超出限制 | 降低调用频率,启用重试退避策略 |
| 响应超时(504) | 网络延迟或服务端负载过高 | 增加超时阈值,检查网络连接 |
| 文件不存在 | 路径错误或文件未创建 | 检查路径拼写,确认文件已生成 |
| 文件格式不支持 | 扩展名不在支持列表中 | 转换为支持的格式后重试 |
| 权限不足 | 当前用户无读写权限 | 检查文件权限,以管理员身份运行 |
| 命令执行失败 | 参数错误或环境依赖缺失 | 检查命令语法,确认依赖已安装 |
| 进程超时 | 命令执行时间过长 | 增加超时设置,优化命令参数 |
| 网络连接失败 | DNS解析失败或防火墙拦截 | 检查网络配置,确认代理设置 |