Skip to main content

ai-podcast

从人工原声建立可复用声线,将文章、资料或录音整理成单人口播稿,用开源 OmniVoice 合成播客或画外音,并按授权登录平台分发。适用于 AI podcast、声音克隆到播客发布的完整流程;支持无 NVIDIA GPU 的 CPU 电脑和 Mac,也可从已有声线或定稿接续。

الانتقال إلى التثبيت

معلومات المصدر

المستودع
bronc-x/lotus
آخر نشاط في المصدر
٢٣ سبتمبر ٢٠٢٦ في ٠٤:١٩
لغة SKILL.md المكتشفة
الصينية
النجوم
٢٣
التفرعات
١

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.

مستكشف الملفات
14 ملفات

عرض SKILL.md

SKILL.md
تعليمات المصدر · معاينة للقراءة فقط
name
ai-podcast
description
从人工原声建立可复用声线,将文章、资料或录音整理成单人口播稿,用开源 OmniVoice 合成播客或画外音,并按授权登录平台分发。适用于 AI podcast、声音克隆到播客发布的完整流程;支持无 NVIDIA GPU 的 CPU 电脑和 Mac,也可从已有声线或定稿接续。
# AI podcast 交付从内容、本人声线到可播放音频和可核对的平台结果。按现有进度进入相应阶段;已有已确认声线、定稿、登录态或同一候选的发布授权时直接复用。 ## 入口与项目记录 从当前任务确认材料、听众、语言、时长、说话人和交付平台。未指定平台时先完成本地音频,不猜账号。创建单期工程,至少保留 `sources/`、`script/`、`audio/`、`release/`、`publishing/`;项目已有目录约定时沿用。机器配置、账号归属、声音资产留在外部本地 profile,不写入共享 Skill。 每阶段记录 running / complete / failed / blocked 及实际产物路径。只有当前范围内阶段完成才宣称完成;“本地已生成”“待试听”“平台审核中”分别报告。恢复任务先查已有稿件、段落检查点与平台记录,不重复克隆、全量重生或重复发布。 ## 1. 建立或选择声线 读取 [声音与运行环境](references/voice-runtime.md)。使用开源 `k2-fsa/OmniVoice` 做参考声音克隆;它不等于训练专属模型。 - 已选 Toni/Tony:读取当前安装的 `toni-voice/SKILL.md`、`voice.json`、`runtime.json` 和资产哈希,不能从本 Skill 的历史文字恢复旧 03。原 Skill 可执行时沿用它;CPU/Mac 使用本 Skill 的可移植入口及单独 runtime,保留声线、32 步、段落意图和清晰度参数。 - 新说话人:人录原声 → 人工核对参考片段的逐字稿 → 编码并保存 prompt/profile → 生成试听 → 记录用户选定的版本与语言。多段录音用于挑选干净参考或不同表达提示,不把五段机械拼成一个长参考。 - 试听数量按本次请求决定;比较声线时可用每条 40–60 秒、含叙述/问题/强调/数字的同文案。以前“十条、每条超过 40 秒”不是每集默认要求。 - 已批准声音不再重新选型。新语言首次试听;中文批准不代表英语音色或口音已批准。其他人的声线保持独立 profile。生成成品不能成为新的克隆原声。 ## 2. 材料变成可讲述的稿件 读取 [内容与口播稿](references/content-script.md)。有定稿就保留,只做明确授权的朗读规范化;需要创作时先解析证据和论点,再写成单人讲述。 有原录音且需要内容母库时,可用已安装的 `recording` 做转写、来源映射;本任务明确是 AI 单人播客时,不套用访谈“原音占比”的剪辑规则。用户要求本人文风时用已安装的 `broncin-style-writer`;没有该私人 Skill 的电脑按本文内置口播流程执行,不假装具有其私人语料。`lieflat-less-ai-tone` 只在需要且已安装时进行清单内清理。 产物为来源清单、事实/判断依据、原稿、实际合成稿,以及任务 JSON。风格、音色和事实核对是不同工作;不让旧笔记替用户作新判断,不编造第一人称经历。 ## 3. 合成、核对与成品 先运行设备检查和短样测速;无 GPU 也继续使用 CPU 路线。确认时长可接受后按语义分段合成,保留段落缓存;失败只修复受影响段落,整集交付连续 WAV 与发布副本。可调用 `scripts/synthesize.py`,具体命令与配置见声音参考。 声音变化先比较原录音与已批准参考,不用加混响、变调或重度均衡掩盖远场、噪声或削波。检查漏句、重复、专名、数字、跨语言读音、连接处及实际时长;长稿用本地 ASR 辅助逐段核对,ASR 不能代替试听。保留未通过检查的状态,不能用“文件存在”代替验收。 按最终音频实际时间生成 OUTLINE、字幕或镜头映射,不能拿字数估计时码作为交付。默认不擅自加音乐、双主持人、品牌广告。发布编码、响度要求按本次平台核对,另导出副本且保留无损母版。 ## 4. 登录、分发与结果核对 读取 [发布与分发](references/distribution.md)。先做好具体发布候选(音频、封面、标题、完整介绍、实际时间轴、用户指定链接/联系信息),生成哈希记录,再执行授权覆盖的平台与账号。登录态优先复用;确需验证码或扫码时只请用户完成那一步。 Firstory 等托管 RSS 与 Apple 等订阅目录分开处理;QQ/TME、喜马拉雅等分别确认账号和结果。不把上传成功写成已发布,不把 RSS 已添加写成中国区已收录。没有可用浏览器/连接器时完成发布包并说明卡点,不捏造操作结果。 ## 完成与移植 展示可播放音频、稿件及实际发布链接/待处理事项。按项目要求归档,并校验副本哈希。分发不隐含后续定时监控授权。 复制整个本 Skill 文件夹即可移植流程;目标电脑另建 Python 环境、模型缓存、机器 runtime 和私有 voice profile。共享仓库不带原声、`.pt`、个人风格语料、账号凭据或本机配置。已执行的验证和边界见 [验证记录](references/validation.md),不能将 Windows CPU 测试冒充 Mac 实机测试。
عرض على GitHub