用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/shenweihuan/aigc-creative-skills-v3 --skill audio-domain命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | audio-domain |
| version | 3.0.0 |
| status | placeholder |
| description | 音频领域路由器(占位符)— 待扩展。 计划覆盖:音乐创作 / 播客制作 / 声音设计 / 音效合成。 当前状态:规划中,等待AI音频生成技术进一步成熟。 |
⚠️ 本领域当前为占位状态,正在规划和建设中。 音频创作是AIGC Creative Skills v3的下一个重要扩展方向。
┌─────────────────────────────────────────────────────────────┐
│ │
│ 🎵 音频领域 │
│ │
│ ⚠️ COMING SOON ⚠️ │
│ │
│ 本领域正在积极规划中,预计在以下条件成熟后正式开放: │
│ │
│ ✅ AI音乐生成技术达到可用水平 │
| ✅ AI语音合成质量满足专业需求 │
| ✅ 完成足够的大师级品味框架研究 │
| ✅ 构建完整的感知训练体系 │
│ │
│ 预计时间窗口:2026-2027年 │
│ │
└─────────────────────────────────────────────────────────────┘
与其他四个领域的对比:
| 领域 | AI技术成熟度 | 可用性 | v3 覆盖状态 |
|---|---|---|---|
| 视觉艺术 | ★★★★★ (非常成熟) | Midjourney/DALL-E/SD 已广泛使用 | ✅ 完成 (12个技能) |
| 写作文学 | ★★★★★ (非常成熟) | ChatGPT/Claude 已达到专业水平 | ✅ 完成 (9个技能) |
| 影视视频 | ★★★★☆ (快速进步中) | Seedance/Runway/Kling 可用于片段 | ✅ 完成 (7个技能) |
| 设计 | ★★★★☆ (成熟) | 图像生成 + 设计工具链完善 | ✅ 完成 (6个技能) |
| 音频 | ★★★☆☆ (发展中) | 音乐/语音有突破但未达"大师协作"级别 | 🚧 占位 |
1. 时间维度的复杂性
- 音乐是多轨时间流的精确同步
- 比视频更抽象(没有视觉锚点)
- 结构和和声需要深层理解
2. 主观性更强
- "好听"比"好看"更难定义
- 文化和个人偏好差异巨大
- 缺乏通用的"评价标准"
3. 技术限制
- AI音乐生成的连贯性和可控性仍有限
- 语音合成的情感表达不够自然
- 音效设计的精确控制困难
- 多轨混音的AI自动化程度低
4. 版权和法律问题
- AI训练数据的版权争议更大(音乐产业保护意识强)
- 声音克隆的伦理问题
- 商业使用的法律边界不清晰
尽管尚未正式开放,我们已经完成了初步规划。以下是计划覆盖的方向:
domains/audio/
├── music/ # 音乐创作
│ ├── classical/ # 古典音乐方向
│ │ ├── bach-counterpoint # 巴赫·对位法
│ │ └── romantic-piano # 浪漫派钢琴
│ ├── modern/ # 现代音乐方向
│ │ ├── jazz-improv # 爵士即兴
│ │ ├── electronic-ambient # 电子氛围
│ │ └── rock-production # 摇滚制作
│ └── film-score # 电影配乐
│ ├── hans-zimmer-epic # 汉斯·季默·史诗配乐
│ └── piano-melancholy # 忧郁钢琴(久石让风格)
│
├── podcasting/ # 播客与有声内容
│ ├── narrative-storytelling # 叙事型播客
│ └── interview-conversation # 对话型播客
│
├── sound-design/ # 声音设计
│ ├── foley-artistry # 拟音艺术
│ └── atmospheric-soundscape # 氛围声景
│
└── voice/ # 语音与合成
├── tts-narration # 有声书/旁白
└── vocal-synthesis # 歌声合成
music/)| 计划技能名 | 大师/风格 | 预期定位 | 关键挑战 |
|---|---|---|---|
bach-counterpoint | J.S.巴赫 · 对位法 | 复调音乐的逻辑之美 | AI需要理解和声/复调理论 |
romantic-chopin | 肖邦 · 浪漫派钢琴 | 情感的极致表达 | 需要捕捉演奏的细微动态 |
jazz-miles-davis | 迈尔斯·戴维斯 · 爵士即兴 | 即兴的艺术 | 即兴性的AI模拟极难 |
electronic-brian-eno | 布莱恩·伊诺 · 氛围音乐 | 生成系统与偶然性 | 可能是最适合AI的音乐类型 |
film-score-hans-zimmer | 汉斯·季默 · 史诗配乐 | 情绪的管弦乐工程 | 多轨编排的复杂性 |
anime-joe-hisaishi | 久石让 · 动画配乐 | 旋律的记忆点 | 与视觉叙事的配合 |
podcasting/)| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|---|---|---|---|
narrative-this-american-life | 叙事型播客(This American Life式) | 用声音讲故事 | 声音剪辑的艺术 |
conversation-joe-rogan | 对话型播客(长对话式) | 对话的能量管理 | 自然对话的节奏感 |
sound-design/)| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|---|---|---|---|
foley-classic | 经典拟音 | 用日常物品创造世界 | 创造力和拟音技巧 |
soundscape-nature | 自然声景 | 环境音的氛围营造 | 层次感和空间感 |
voice/)| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|---|---|---|---|
audiobook-calm | 平静叙述型有声书 | 沉浸式阅读体验 | 情感表达的微妙控制 |
character-voice | 角色配音 | 多角色声音塑造 | 声音的一致性和辨识度 |
虽然本领域尚未正式开放,但你仍然可以通过以下方式处理音频相关的创作需求:
如果你需要:
→ 背景音乐建议 → 使用 film-video/ 的技能(电影配乐部分会涉及音乐讨论)
→ 声音氛围描述 → 使用 writing/ 的技能(用文字描述声音场景)
→ 歌词创作 → 使用 poetry/ 或 prose/ 的技能(文字是声音的基础)
→ 播客脚本 → 使用 screenplay/ 或 copywriting/ 的技能(结构化写作)
当前可用的AI音频工具(非本系统集成):
| 工具类型 | 代表产品 | 适用场景 | 局限性 |
|---|---|---|---|
| AI音乐生成 | Suno / Udio / Google MusicLM | 短片段背景音乐/实验 | 风格控制粗糙,难以精调 |
| AI语音合成 | ElevenLabs / Azure TTS / ChatTTS | 有声书/配音/播客 | 情感表达仍不够自然 |
| AI音效 | AudioLDM / Stable Audio | 音效素材生成 | 控制精度低 |
| AI歌词辅助 | ChatGPT / Claude | 歌词创作 | 无旋律配合能力 |
对于严肃的音频项目,当前最佳实践仍是:
1. 人类创作核心(旋律/歌词/概念)
2. AI辅助:
- 灵感生成(AI提供多个起点)
- 编曲建议(和弦进行/配器方案)
- 混音参考(AI分析参考曲目参数)
3. 人类最终决策和精细调整
4. 专业软件执行(DAW / 插件)
这不是"AI替代人类",而是"AI加速人类的迭代过程"。
以下是判断"何时正式开放音频领域"的关键指标:
□ AI音乐生成能够:
✓ 生成2分钟以上连贯的作品(不是15秒循环)
✓ 遵循指定的风格和情绪(不只是随机输出)
✓ 支持多轨分离编辑(人声/贝斯/鼓等独立控制)
✓ 允许精细的参数调整(速度/调性/乐器配置)
✓ 输出质量达到商业发布标准(或接近)
□ AI语音合成能够:
✓ 表达复杂的情感(不仅是"开心/悲伤"这种粗粒度)
✓ 维持长文本的一致性角色声音
✓ 支持自然的韵律和呼吸感
✓ 允许风格迁移(模仿特定演员/播音员的声音特征)
✓ 解决声音克隆的伦理和法律问题
□ AI音效设计能够:
✓ 根据描述生成准确的音效(不只是近似)
✓ 支持空间定位(立体声/环绕声/3D音频)
✓ 允许动态变化(不是静态样本)
✓ 与视频同步(自动匹配画面节奏)
| 技术/公司 | 最新进展 | 对本系统的意义 |
|---|---|---|
| Suno v3/v4 | 音乐生成质量和长度持续提升 | 可能成为音乐技能的首选平台 |
| ElevenLabs Turbo | 语音合成速度和质量提升 | 有望成为语音技能的基础设施 |
| Google MusicLM / MusicFX | 谷歌在音乐AI上的投入 | 技术验证的重要参考 |
| Stable Audio (Stability AI) | 开源音频模型 | 可能支持本地部署和定制化 |
| Meta AudioCraft | Meta的多功能音频模型 | 一站式音乐+音效+语音的可能性 |
| Anthropic/GPT音频能力 | 大模型厂商进入音频领域 | 可能带来"语言+音频"的统一理解 |
1. 继续使用现有工具(上述"临时替代方案")
2. 关注本领域的更新(我们会在总控 SKILL.md 中标注进度)
3. 参与我们社区的建设:
- 分享你使用AI音频工具的经验
- 提出你希望看到的技能方向
- 协助测试未来的beta版本
4. 先从其他领域入手:
- 学习 writing/ 的技能提升歌词/脚本能力
- 学习 film-video/ 的技能理解视听配合
- 这些都会在音频领域开放后成为你的优势
1. 如果你正在开发AI音频工具,我们很乐意合作:
- 提供品味框架作为"上层指导"
- 测试你的技术在真实创作场景的表现
- 共同定义"AI音频大师"的工作模式
2. 如果你想贡献内容:
- 音乐理论和美学的研究
- 特定风格的深度分析(如:如何定义"爵士味")
- 感知训练方法的设计(如:如何训练耳朵)
- 评价标准的建立(如:什么是"好的人声")
3. 联系方式:通过主仓库 Issues 或 Discussions 提出
虽然还未实现,但我们已经形成了对音频领域的核心理解:
视觉艺术:空间的艺术(眼睛扫描平面/体积)
写作文学:时间的艺术(线性阅读)
影视视频:时空艺术(时间流中的空间呈现)
设计:解决问题的艺术(功能导向的美学)
音频:纯粹的时间艺术(无形、不可逆、直接作用于情感)
音频的特殊性:
✗ 没有视觉锚点(纯听觉体验)
✗ 不可逆的时间流(不能像绘画那样反复观看细节)
✗ 直接的情感通道(绕过理性思考,直达边缘系统)
✗ 物理性(声波是真实的物理振动,会引起生理反应)
✗ 文化的普遍性(音乐可能是最普世的"语言")
因此,音频领域的技能设计必须:
1. 强调"时间感知训练"(比其他领域更重要)
2. 建立"情感映射系统"(音乐元素→情感反应的科学对应)
3. 发展"非视觉的想象力"(用耳朵"看到"声音的空间)
4. 尊重文化和个人差异(避免单一标准)
5. 与其他领域深度整合(尤其是film-video的视听配合)
ai-audio-master(规划中)
核心能力:
- 全平台音频生成专家(Suno/Udio/ElevenLabs/AudioLDM)
- 音乐理论与提示词工程的桥梁
- 自动混音和母带处理引擎
- 多轨编排助手
- 声音设计顾问
工作模式(参考其他AI大师的四模式):
A 教学模式:音乐理论基础/DAW操作指南/听音训练方法
B 评价模式:多维度音频评分/频率分析/动态范围诊断
C 工作流模式:完整音乐制作流程/播客生产管线/声音设计流程
D 自动迭代模式:生成→听评→修改→再生成的循环(针对音乐特别优化)
特殊挑战:
- 如何建立"音频版的自检清单"?(视觉可以截图对比,音频呢?)
- 如何量化"好听"?(主观性太强)
- 如何处理版权?(音乐产业的特殊性)
2025 Q3-Q4:
├── 完成本领域的详细规划文档
├── 开始构建第一批1-2个实验性技能(可能是electronic-ambient)
├── 建立音频感知训练的原型
└── 开启小范围内测
2026:
├── 如果技术达标:正式开放 music/ 的2-3个技能
├── 发布 ai-audio-master 的alpha版本
├── 开始 podcasting/ 和 sound-design/ 的建设
└── 收集用户反馈,快速迭代
2027:
├── 目标:达到与其他4个领域相当的覆盖度
├── 完整的6大领域协同工作流
└── AIGC Creative Skills v3 "完整版"
音频是人类最古老的艺术形式之一——早在绘画之前,我们的祖先就在火堆旁歌唱了。
我们不急于开放这个领域,是因为我们对它怀有敬畏。
当我们最终开放时,它不会是一个"能用就行"的工具集合,而会是一个真正能帮助你 "像巴赫一样思考对位法"、"像汉斯·季默一样构建史诗"、 "像布莱恩·伊诺一样拥抱偶然性"的品味训练系统。
请给我们一点时间。好的事情值得等待。🎵
相关链接:
../SKILL.md (AIGC Creative Skills v3)../visual/SKILL.md../writing/SKILL.md../film-video/SKILL.md../design/SKILL.md最后更新:2025年(v3.0.0 初始版本,占位状态)