with one click
aliang-podcast-maker
多人对话脚本转语音播客:为不同角色分配音色,逐句生成后用 ffmpeg 拼接成完整音频。
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Menu
多人对话脚本转语音播客:为不同角色分配音色,逐句生成后用 ffmpeg 拼接成完整音频。
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Based on SOC occupation classification
使用百炼已创建的克隆音色(CosyVoice v3.5-flash)通过 bl speech synthesize 合成语音。
儿童故事制作全流程:选择年龄→时长→播音风格→生成3个故事供选择→制作音频+插图→输出到指定目录。
用阿里云百炼 bl CLI 把一个故事主题做成「儿童有声绘本」——AI 写故事→多音色配音(TTS)→统一画风文生图→合成网页版翻页有声书(可选导出 mp4 视频版、纯音频 mp3)。当用户想做有声书 / 有声绘本 / 儿童绘本 / 故事配音配图 / 睡前故事,或说"把故事做成有声书""做个绘本""故事变成声音再配图"时使用。
高质量商品详情图生成。将产品图片去背景,根据产品特点生成多角度、多场景商品详情图。
短剧全流程制作流水线——把一句话灵感逐步做成可拍/可播的短剧:① 剧情大纲 → ② 分集剧本(含台词) → ③ 分镜表 → ④ 用百炼 bl CLI 批量生成每镜关键帧图片 → ⑤ 图生视频合成最终成片。支持多题材(草根逆袭/复仇打脸/都市甜宠/悬疑反转/家庭伦理/古装重生/战神赘婿/搞笑沙雕),支持按单镜指定时长(5s/10s/15s)。每阶段产出后暂停等用户确认再继续。⚠️ **视频生成费钱:开发/测试/演示阶段默认只产出视频命令、不实跑,需用户显式确认要为某段付费才生成**。当用户说"做短剧""短剧剧本""短剧分镜""把这个点子做成短剧""短剧出图""短剧成片"时使用。
| name | aliang-podcast-maker |
| description | 多人对话脚本转语音播客:为不同角色分配音色,逐句生成后用 ffmpeg 拼接成完整音频。 |
当用户提供多角色对话脚本、播客剧本、访谈内容,并要求"做成声音"、"制作播客"、"配音"时使用。
bl speech synthesize --list-voices --model cosyvoice-v3-flash
| 角色类型 | 推荐音色 | 说明 |
|---|---|---|
| 活泼女性 | longanhuan | 欢脱元气女 |
| 沉稳女性 | longxiaoxia_v3 | 沉稳权威女 |
| 知性女性 | longanwen_v3 | 优雅知性女 |
| 磁性男性 | longtian_v3 | 磁性理智男 |
| 温暖男性 | longze_v3 | 温暖元气男 |
| 青年男性 | longcheng_v3 | 智慧青年男 |
创建临时目录存放分句音频:
mkdir -p {输出目录}/{对话标题}_语音
按对话顺序,为每句生成音频。阿琳用 longanhuan、老陈用 longtian_v3 举例:
# 阿琳第1句
bl speech synthesize \
--text "好了,咱今天就唠唠——AI 这么猛,到底还需要什么样的人才?" \
--voice longanhuan \
--out "{输出目录}/{对话标题}_语音/阿琳_01.mp3"
# 老陈第1句
bl speech synthesize \
--text "我觉得是 T 字型的人。" \
--voice longtian_v3 \
--out "{输出目录}/{对话标题}_语音/老陈_01.mp3"
继续为所有对话逐句生成。命名格式:{角色名}_{序号}.mp3
注意:
--model cosyvoice-v3-flash(系统音色默认,可不写)--rate / --pitch 参数在语音目录下创建 concat_list.txt,按对话顺序排列:
file '阿琳_01.mp3'
file '老陈_01.mp3'
file '阿琳_02.mp3'
file '老陈_02.mp3'
...
关键发现:Bailian TTS 虽然输出 .mp3 扩展名,实际格式是 WAV(PCM)。 因此拼接时必须转码:
ffmpeg -y -f concat -safe 0 -i {输出目录}/{对话标题}_语音/concat_list.txt \
-c:a libmp3lame -b:a 192k \
{输出目录}/{对话标题}_完整版.mp3
-y:自动覆盖已存在文件-c:a libmp3lame:转码为真 MP3-b:a 192k:192kbps 音质concat_list.txt✅ 播客制作完成!
完整音频:输出/T型人才对话_完整版.mp3
- 时长:68秒
- 格式:MP3, 192kbps, 24kHz
- 大小:1.3MB
音色方案:
阿琳 → longanhuan(欢脱元气女)
老陈 → longtian_v3(磁性理智男)
分句音频:输出/T型人才对话_语音/(13个文件)
如果需要添加背景音乐或音效:
# 片头音频 + 完整对话拼接
ffmpeg -y -f concat -safe 0 \
-i <(printf "file 'intro.mp3'\nfile '完整版.mp3'\nfile 'outro.mp3'\n") \
-c:a libmp3lame -b:a 192k \
{输出目录}/{对话标题}_带片头.mp3
cosyvoice-v3.5-flash 模型时(克隆音色),命令中的 --model 参数必须显式指定