一键导入
aliang-podcast-maker
多人对话脚本转语音播客:为不同角色分配音色,逐句生成后用 ffmpeg 拼接成完整音频。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
多人对话脚本转语音播客:为不同角色分配音色,逐句生成后用 ffmpeg 拼接成完整音频。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
使用百炼已创建的克隆音色(CosyVoice v3.5-flash)通过 bl speech synthesize 合成语音。
儿童故事制作全流程:选择年龄→时长→播音风格→生成3个故事供选择→制作音频+插图→输出到指定目录。
用阿里云百炼 bl CLI 把一个故事主题做成「儿童有声绘本」——AI 写故事→多音色配音(TTS)→统一画风文生图→合成网页版翻页有声书(可选导出 mp4 视频版、纯音频 mp3)。当用户想做有声书 / 有声绘本 / 儿童绘本 / 故事配音配图 / 睡前故事,或说"把故事做成有声书""做个绘本""故事变成声音再配图"时使用。
高质量商品详情图生成。将产品图片去背景,根据产品特点生成多角度、多场景商品详情图。
短剧全流程制作流水线——把一句话灵感逐步做成可拍/可播的短剧:① 剧情大纲 → ② 分集剧本(含台词) → ③ 分镜表 → ④ 用百炼 bl CLI 批量生成每镜关键帧图片 → ⑤ 图生视频合成最终成片。支持多题材(草根逆袭/复仇打脸/都市甜宠/悬疑反转/家庭伦理/古装重生/战神赘婿/搞笑沙雕),支持按单镜指定时长(5s/10s/15s)。每阶段产出后暂停等用户确认再继续。⚠️ **视频生成费钱:开发/测试/演示阶段默认只产出视频命令、不实跑,需用户显式确认要为某段付费才生成**。当用户说"做短剧""短剧剧本""短剧分镜""把这个点子做成短剧""短剧出图""短剧成片"时使用。
| name | aliang-podcast-maker |
| description | 多人对话脚本转语音播客:为不同角色分配音色,逐句生成后用 ffmpeg 拼接成完整音频。 |
当用户提供多角色对话脚本、播客剧本、访谈内容,并要求"做成声音"、"制作播客"、"配音"时使用。
bl speech synthesize --list-voices --model cosyvoice-v3-flash
| 角色类型 | 推荐音色 | 说明 |
|---|---|---|
| 活泼女性 | longanhuan | 欢脱元气女 |
| 沉稳女性 | longxiaoxia_v3 | 沉稳权威女 |
| 知性女性 | longanwen_v3 | 优雅知性女 |
| 磁性男性 | longtian_v3 | 磁性理智男 |
| 温暖男性 | longze_v3 | 温暖元气男 |
| 青年男性 | longcheng_v3 | 智慧青年男 |
创建临时目录存放分句音频:
mkdir -p {输出目录}/{对话标题}_语音
按对话顺序,为每句生成音频。阿琳用 longanhuan、老陈用 longtian_v3 举例:
# 阿琳第1句
bl speech synthesize \
--text "好了,咱今天就唠唠——AI 这么猛,到底还需要什么样的人才?" \
--voice longanhuan \
--out "{输出目录}/{对话标题}_语音/阿琳_01.mp3"
# 老陈第1句
bl speech synthesize \
--text "我觉得是 T 字型的人。" \
--voice longtian_v3 \
--out "{输出目录}/{对话标题}_语音/老陈_01.mp3"
继续为所有对话逐句生成。命名格式:{角色名}_{序号}.mp3
注意:
--model cosyvoice-v3-flash(系统音色默认,可不写)--rate / --pitch 参数在语音目录下创建 concat_list.txt,按对话顺序排列:
file '阿琳_01.mp3'
file '老陈_01.mp3'
file '阿琳_02.mp3'
file '老陈_02.mp3'
...
关键发现:Bailian TTS 虽然输出 .mp3 扩展名,实际格式是 WAV(PCM)。 因此拼接时必须转码:
ffmpeg -y -f concat -safe 0 -i {输出目录}/{对话标题}_语音/concat_list.txt \
-c:a libmp3lame -b:a 192k \
{输出目录}/{对话标题}_完整版.mp3
-y:自动覆盖已存在文件-c:a libmp3lame:转码为真 MP3-b:a 192k:192kbps 音质concat_list.txt✅ 播客制作完成!
完整音频:输出/T型人才对话_完整版.mp3
- 时长:68秒
- 格式:MP3, 192kbps, 24kHz
- 大小:1.3MB
音色方案:
阿琳 → longanhuan(欢脱元气女)
老陈 → longtian_v3(磁性理智男)
分句音频:输出/T型人才对话_语音/(13个文件)
如果需要添加背景音乐或音效:
# 片头音频 + 完整对话拼接
ffmpeg -y -f concat -safe 0 \
-i <(printf "file 'intro.mp3'\nfile '完整版.mp3'\nfile 'outro.mp3'\n") \
-c:a libmp3lame -b:a 192k \
{输出目录}/{对话标题}_带片头.mp3
cosyvoice-v3.5-flash 模型时(克隆音色),命令中的 --model 参数必须显式指定