Skip to main content

ai-podcast

从人工原声建立可复用声线,将文章、资料或录音整理成单人口播稿,用开源 OmniVoice 合成播客或画外音,并按授权登录平台分发。适用于 AI podcast、声音克隆到播客发布的完整流程;支持无 NVIDIA GPU 的 CPU 电脑和 Mac,也可从已有声线或定稿接续。

Ir a la instalación

Datos de origen

Repositorio
bronc-x/lotus
Última actividad en el origen
23 de septiembre de 2026 a las 04:19
Idioma detectado de SKILL.md
chino
Estrellas
23
Forks
1

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.

Explorador de archivos
14 archivos

Mostrando SKILL.md

SKILL.md
Instrucciones de origen · Vista previa de solo lectura
name
ai-podcast
description
从人工原声建立可复用声线,将文章、资料或录音整理成单人口播稿,用开源 OmniVoice 合成播客或画外音,并按授权登录平台分发。适用于 AI podcast、声音克隆到播客发布的完整流程;支持无 NVIDIA GPU 的 CPU 电脑和 Mac,也可从已有声线或定稿接续。
# AI podcast 交付从内容、本人声线到可播放音频和可核对的平台结果。按现有进度进入相应阶段;已有已确认声线、定稿、登录态或同一候选的发布授权时直接复用。 ## 入口与项目记录 从当前任务确认材料、听众、语言、时长、说话人和交付平台。未指定平台时先完成本地音频,不猜账号。创建单期工程,至少保留 `sources/`、`script/`、`audio/`、`release/`、`publishing/`;项目已有目录约定时沿用。机器配置、账号归属、声音资产留在外部本地 profile,不写入共享 Skill。 每阶段记录 running / complete / failed / blocked 及实际产物路径。只有当前范围内阶段完成才宣称完成;“本地已生成”“待试听”“平台审核中”分别报告。恢复任务先查已有稿件、段落检查点与平台记录,不重复克隆、全量重生或重复发布。 ## 1. 建立或选择声线 读取 [声音与运行环境](references/voice-runtime.md)。使用开源 `k2-fsa/OmniVoice` 做参考声音克隆;它不等于训练专属模型。 - 已选 Toni/Tony:读取当前安装的 `toni-voice/SKILL.md`、`voice.json`、`runtime.json` 和资产哈希,不能从本 Skill 的历史文字恢复旧 03。原 Skill 可执行时沿用它;CPU/Mac 使用本 Skill 的可移植入口及单独 runtime,保留声线、32 步、段落意图和清晰度参数。 - 新说话人:人录原声 → 人工核对参考片段的逐字稿 → 编码并保存 prompt/profile → 生成试听 → 记录用户选定的版本与语言。多段录音用于挑选干净参考或不同表达提示,不把五段机械拼成一个长参考。 - 试听数量按本次请求决定;比较声线时可用每条 40–60 秒、含叙述/问题/强调/数字的同文案。以前“十条、每条超过 40 秒”不是每集默认要求。 - 已批准声音不再重新选型。新语言首次试听;中文批准不代表英语音色或口音已批准。其他人的声线保持独立 profile。生成成品不能成为新的克隆原声。 ## 2. 材料变成可讲述的稿件 读取 [内容与口播稿](references/content-script.md)。有定稿就保留,只做明确授权的朗读规范化;需要创作时先解析证据和论点,再写成单人讲述。 有原录音且需要内容母库时,可用已安装的 `recording` 做转写、来源映射;本任务明确是 AI 单人播客时,不套用访谈“原音占比”的剪辑规则。用户要求本人文风时用已安装的 `broncin-style-writer`;没有该私人 Skill 的电脑按本文内置口播流程执行,不假装具有其私人语料。`lieflat-less-ai-tone` 只在需要且已安装时进行清单内清理。 产物为来源清单、事实/判断依据、原稿、实际合成稿,以及任务 JSON。风格、音色和事实核对是不同工作;不让旧笔记替用户作新判断,不编造第一人称经历。 ## 3. 合成、核对与成品 先运行设备检查和短样测速;无 GPU 也继续使用 CPU 路线。确认时长可接受后按语义分段合成,保留段落缓存;失败只修复受影响段落,整集交付连续 WAV 与发布副本。可调用 `scripts/synthesize.py`,具体命令与配置见声音参考。 声音变化先比较原录音与已批准参考,不用加混响、变调或重度均衡掩盖远场、噪声或削波。检查漏句、重复、专名、数字、跨语言读音、连接处及实际时长;长稿用本地 ASR 辅助逐段核对,ASR 不能代替试听。保留未通过检查的状态,不能用“文件存在”代替验收。 按最终音频实际时间生成 OUTLINE、字幕或镜头映射,不能拿字数估计时码作为交付。默认不擅自加音乐、双主持人、品牌广告。发布编码、响度要求按本次平台核对,另导出副本且保留无损母版。 ## 4. 登录、分发与结果核对 读取 [发布与分发](references/distribution.md)。先做好具体发布候选(音频、封面、标题、完整介绍、实际时间轴、用户指定链接/联系信息),生成哈希记录,再执行授权覆盖的平台与账号。登录态优先复用;确需验证码或扫码时只请用户完成那一步。 Firstory 等托管 RSS 与 Apple 等订阅目录分开处理;QQ/TME、喜马拉雅等分别确认账号和结果。不把上传成功写成已发布,不把 RSS 已添加写成中国区已收录。没有可用浏览器/连接器时完成发布包并说明卡点,不捏造操作结果。 ## 完成与移植 展示可播放音频、稿件及实际发布链接/待处理事项。按项目要求归档,并校验副本哈希。分发不隐含后续定时监控授权。 复制整个本 Skill 文件夹即可移植流程;目标电脑另建 Python 环境、模型缓存、机器 runtime 和私有 voice profile。共享仓库不带原声、`.pt`、个人风格语料、账号凭据或本机配置。已执行的验证和边界见 [验证记录](references/validation.md),不能将 Windows CPU 测试冒充 Mac 实机测试。
Ver en GitHub