소스 정보
- 저장소
- shenweihuan/aigc-creative-skills-v3
- 최근 소스 활동
- 2026년 6월 7일 19:04
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 5
- 포크
- 2
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/shenweihuan/aigc-creative-skills-v3 --skill audio-domain명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SKILL.md 표시 중
| name | audio-domain |
| version | 3.0.0 |
| status | placeholder |
| description | 音频领域路由器(占位符)— 待扩展。 计划覆盖:音乐创作 / 播客制作 / 声音设计 / 音效合成。 当前状态:规划中,等待AI音频生成技术进一步成熟。 |
⚠️ 本领域当前为占位状态,正在规划和建设中。 音频创作是AIGC Creative Skills v3的下一个重要扩展方向。
┌─────────────────────────────────────────────────────────────┐
│ │
│ 🎵 音频领域 │
│ │
│ ⚠️ COMING SOON ⚠️ │
│ │
│ 本领域正在积极规划中,预计在以下条件成熟后正式开放: │
│ │
│ ✅ AI音乐生成技术达到可用水平 │
| ✅ AI语音合成质量满足专业需求 │
| ✅ 完成足够的大师级品味框架研究 │
| ✅ 构建完整的感知训练体系 │
│ │
│ 预计时间窗口:2026-2027年 │
│ │
└─────────────────────────────────────────────────────────────┘
与其他四个领域的对比:
| 领域 | AI技术成熟度 | 可用性 | v3 覆盖状态 |
|---|---|---|---|
| 视觉艺术 | ★★★★★ (非常成熟) | Midjourney/DALL-E/SD 已广泛使用 | ✅ 完成 (12个技能) |
| 写作文学 | ★★★★★ (非常成熟) | ChatGPT/Claude 已达到专业水平 | ✅ 完成 (9个技能) |
| 影视视频 | ★★★★☆ (快速进步中) | Seedance/Runway/Kling 可用于片段 | ✅ 完成 (7个技能) |
| 设计 | ★★★★☆ (成熟) | 图像生成 + 设计工具链完善 | ✅ 完成 (6个技能) |
| 音频 | ★★★☆☆ (发展中) | 音乐/语音有突破但未达"大师协作"级别 | 🚧 占位 |
1. 时间维度的复杂性
- 音乐是多轨时间流的精确同步
- 比视频更抽象(没有视觉锚点)
- 结构和和声需要深层理解
2. 主观性更强
- "好听"比"好看"更难定义
- 文化和个人偏好差异巨大
- 缺乏通用的"评价标准"
3. 技术限制
- AI音乐生成的连贯性和可控性仍有限
- 语音合成的情感表达不够自然
- 音效设计的精确控制困难
- 多轨混音的AI自动化程度低
4. 版权和法律问题
- AI训练数据的版权争议更大(音乐产业保护意识强)
- 声音克隆的伦理问题
- 商业使用的法律边界不清晰
尽管尚未正式开放,我们已经完成了初步规划。以下是计划覆盖的方向:
domains/audio/
├── music/ # 音乐创作
│ ├── classical/ # 古典音乐方向
│ │ ├── bach-counterpoint # 巴赫·对位法
│ │ └── romantic-piano # 浪漫派钢琴
│ ├── modern/ # 现代音乐方向
│ │ ├── jazz-improv # 爵士即兴
│ │ ├── electronic-ambient # 电子氛围
│ │ └── rock-production # 摇滚制作
│ └── film-score # 电影配乐
│ ├── hans-zimmer-epic # 汉斯·季默·史诗配乐
│ └── piano-melancholy # 忧郁钢琴(久石让风格)
│
├── podcasting/ # 播客与有声内容
│ ├── narrative-storytelling # 叙事型播客
│ └── interview-conversation # 对话型播客
│
├── sound-design/ # 声音设计
│ ├── foley-artistry # 拟音艺术
│ └── atmospheric-soundscape # 氛围声景
│
└── voice/ # 语音与合成
├── tts-narration # 有声书/旁白
└── vocal-synthesis # 歌声合成
music/)| 计划技能名 | 大师/风格 | 预期定位 | 关键挑战 |
|---|---|---|---|
bach-counterpoint | J.S.巴赫 · 对位法 | 复调音乐的逻辑之美 | AI需要理解和声/复调理论 |
romantic-chopin | 肖邦 · 浪漫派钢琴 | 情感的极致表达 | 需要捕捉演奏的细微动态 |
jazz-miles-davis | 迈尔斯·戴维斯 · 爵士即兴 | 即兴的艺术 | 即兴性的AI模拟极难 |
electronic-brian-eno | 布莱恩·伊诺 · 氛围音乐 | 生成系统与偶然性 | 可能是最适合AI的音乐类型 |
film-score-hans-zimmer | 汉斯·季默 · 史诗配乐 | 情绪的管弦乐工程 | 多轨编排的复杂性 |
anime-joe-hisaishi | 久石让 · 动画配乐 | 旋律的记忆点 | 与视觉叙事的配合 |
podcasting/)| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|---|---|---|---|
narrative-this-american-life | 叙事型播客(This American Life式) | 用声音讲故事 | 声音剪辑的艺术 |
conversation-joe-rogan | 对话型播客(长对话式) | 对话的能量管理 | 自然对话的节奏感 |
sound-design/)| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|---|---|---|---|
foley-classic | 经典拟音 | 用日常物品创造世界 | 创造力和拟音技巧 |
soundscape-nature | 自然声景 | 环境音的氛围营造 | 层次感和空间感 |
voice/)| 计划技能名 | 类型 | 预期定位 | 关键挑战 |
|---|---|---|---|
audiobook-calm | 平静叙述型有声书 | 沉浸式阅读体验 | 情感表达的微妙控制 |
character-voice | 角色配音 | 多角色声音塑造 | 声音的一致性和辨识度 |
虽然本领域尚未正式开放,但你仍然可以通过以下方式处理音频相关的创作需求:
如果你需要:
→ 背景音乐建议 → 使用 film-video/ 的技能(电影配乐部分会涉及音乐讨论)
→ 声音氛围描述 → 使用 writing/ 的技能(用文字描述声音场景)
→ 歌词创作 → 使用 poetry/ 或 prose/ 的技能(文字是声音的基础)
→ 播客脚本 → 使用 screenplay/ 或 copywriting/ 的技能(结构化写作)
当前可用的AI音频工具(非本系统集成):
| 工具类型 | 代表产品 | 适用场景 | 局限性 |
|---|---|---|---|
| AI音乐生成 | Suno / Udio / Google MusicLM | 短片段背景音乐/实验 | 风格控制粗糙,难以精调 |
| AI语音合成 | ElevenLabs / Azure TTS / ChatTTS | 有声书/配音/播客 | 情感表达仍不够自然 |
| AI音效 | AudioLDM / Stable Audio | 音效素材生成 | 控制精度低 |
| AI歌词辅助 | ChatGPT / Claude | 歌词创作 | 无旋律配合能力 |
对于严肃的音频项目,当前最佳实践仍是:
1. 人类创作核心(旋律/歌词/概念)
2. AI辅助:
- 灵感生成(AI提供多个起点)
- 编曲建议(和弦进行/配器方案)
- 混音参考(AI分析参考曲目参数)
3. 人类最终决策和精细调整
4. 专业软件执行(DAW / 插件)
这不是"AI替代人类",而是"AI加速人类的迭代过程"。
以下是判断"何时正式开放音频领域"的关键指标:
□ AI音乐生成能够:
✓ 生成2分钟以上连贯的作品(不是15秒循环)
✓ 遵循指定的风格和情绪(不只是随机输出)
✓ 支持多轨分离编辑(人声/贝斯/鼓等独立控制)
✓ 允许精细的参数调整(速度/调性/乐器配置)
✓ 输出质量达到商业发布标准(或接近)
□ AI语音合成能够:
✓ 表达复杂的情感(不仅是"开心/悲伤"这种粗粒度)
✓ 维持长文本的一致性角色声音
✓ 支持自然的韵律和呼吸感
✓ 允许风格迁移(模仿特定演员/播音员的声音特征)
✓ 解决声音克隆的伦理和法律问题
□ AI音效设计能够:
✓ 根据描述生成准确的音效(不只是近似)
✓ 支持空间定位(立体声/环绕声/3D音频)
✓ 允许动态变化(不是静态样本)
✓ 与视频同步(自动匹配画面节奏)
| 技术/公司 | 最新进展 | 对本系统的意义 |
|---|---|---|
| Suno v3/v4 | 音乐生成质量和长度持续提升 | 可能成为音乐技能的首选平台 |
| ElevenLabs Turbo | 语音合成速度和质量提升 | 有望成为语音技能的基础设施 |
| Google MusicLM / MusicFX | 谷歌在音乐AI上的投入 | 技术验证的重要参考 |
| Stable Audio (Stability AI) | 开源音频模型 | 可能支持本地部署和定制化 |
| Meta AudioCraft | Meta的多功能音频模型 | 一站式音乐+音效+语音的可能性 |
| Anthropic/GPT音频能力 | 大模型厂商进入音频领域 | 可能带来"语言+音频"的统一理解 |
1. 继续使用现有工具(上述"临时替代方案")
2. 关注本领域的更新(我们会在总控 SKILL.md 中标注进度)
3. 参与我们社区的建设:
- 分享你使用AI音频工具的经验
- 提出你希望看到的技能方向
- 协助测试未来的beta版本
4. 先从其他领域入手:
- 学习 writing/ 的技能提升歌词/脚本能力
- 学习 film-video/ 的技能理解视听配合
- 这些都会在音频领域开放后成为你的优势
1. 如果你正在开发AI音频工具,我们很乐意合作:
- 提供品味框架作为"上层指导"
- 测试你的技术在真实创作场景的表现
- 共同定义"AI音频大师"的工作模式
2. 如果你想贡献内容:
- 音乐理论和美学的研究
- 特定风格的深度分析(如:如何定义"爵士味")
- 感知训练方法的设计(如:如何训练耳朵)
- 评价标准的建立(如:什么是"好的人声")
3. 联系方式:通过主仓库 Issues 或 Discussions 提出
虽然还未实现,但我们已经形成了对音频领域的核心理解:
视觉艺术:空间的艺术(眼睛扫描平面/体积)
写作文学:时间的艺术(线性阅读)
影视视频:时空艺术(时间流中的空间呈现)
设计:解决问题的艺术(功能导向的美学)
音频:纯粹的时间艺术(无形、不可逆、直接作用于情感)
音频的特殊性:
✗ 没有视觉锚点(纯听觉体验)
✗ 不可逆的时间流(不能像绘画那样反复观看细节)
✗ 直接的情感通道(绕过理性思考,直达边缘系统)
✗ 物理性(声波是真实的物理振动,会引起生理反应)
✗ 文化的普遍性(音乐可能是最普世的"语言")
因此,音频领域的技能设计必须:
1. 强调"时间感知训练"(比其他领域更重要)
2. 建立"情感映射系统"(音乐元素→情感反应的科学对应)
3. 发展"非视觉的想象力"(用耳朵"看到"声音的空间)
4. 尊重文化和个人差异(避免单一标准)
5. 与其他领域深度整合(尤其是film-video的视听配合)
ai-audio-master(规划中)
核心能力:
- 全平台音频生成专家(Suno/Udio/ElevenLabs/AudioLDM)
- 音乐理论与提示词工程的桥梁
- 自动混音和母带处理引擎
- 多轨编排助手
- 声音设计顾问
工作模式(参考其他AI大师的四模式):
A 教学模式:音乐理论基础/DAW操作指南/听音训练方法
B 评价模式:多维度音频评分/频率分析/动态范围诊断
C 工作流模式:完整音乐制作流程/播客生产管线/声音设计流程
D 自动迭代模式:生成→听评→修改→再生成的循环(针对音乐特别优化)
特殊挑战:
- 如何建立"音频版的自检清单"?(视觉可以截图对比,音频呢?)
- 如何量化"好听"?(主观性太强)
- 如何处理版权?(音乐产业的特殊性)
2025 Q3-Q4:
├── 完成本领域的详细规划文档
├── 开始构建第一批1-2个实验性技能(可能是electronic-ambient)
├── 建立音频感知训练的原型
└── 开启小范围内测
2026:
├── 如果技术达标:正式开放 music/ 的2-3个技能
├── 发布 ai-audio-master 的alpha版本
├── 开始 podcasting/ 和 sound-design/ 的建设
└── 收集用户反馈,快速迭代
2027:
├── 目标:达到与其他4个领域相当的覆盖度
├── 完整的6大领域协同工作流
└── AIGC Creative Skills v3 "完整版"
音频是人类最古老的艺术形式之一——早在绘画之前,我们的祖先就在火堆旁歌唱了。
我们不急于开放这个领域,是因为我们对它怀有敬畏。
当我们最终开放时,它不会是一个"能用就行"的工具集合,而会是一个真正能帮助你 "像巴赫一样思考对位法"、"像汉斯·季默一样构建史诗"、 "像布莱恩·伊诺一样拥抱偶然性"的品味训练系统。
请给我们一点时间。好的事情值得等待。🎵
相关链接:
../SKILL.md (AIGC Creative Skills v3)../visual/SKILL.md../writing/SKILL.md../film-video/SKILL.md../design/SKILL.md最后更新:2025年(v3.0.0 初始版本,占位状态)
AI创作操作系统 v3 — 基于艺术大师品味的细粒度原子技能体系。 MetaSkill 总控:分析用户创作意图 → 智能路由到对应的领域 + 大师/风格子技能。 五大领域:视觉艺术 / 写作文学 / 影视视频 / 设计 / 音频。 每个原子技能 = 一个艺术大师或流派,含完整工作流(哲学→感知训练→提示词→评价→跨域迁移)。 灵感来源:OpenSquilla MetaSkill 可组合技能规范。 触发词:「AI绘画」「AI写作」「AI视频」「帮我设计」「创作」「用XX风格画」
设计领域路由器 — 平面设计 + UI/UX + 排版三大板块。 6个设计流派/大师原子技能,覆盖从国际主义到解构主义的全谱系。 每个技能含完整工作流:大师哲学 → 感知训练 → 提示词公式 → 评价标准。 触发词:「帮我设计」「logo」「海报」「UI」「排版」「字体」
影视视频领域路由器 — 导演 + 摄影 + 短视频三大板块。 7个电影大师/风格原子技能,覆盖从史诗长片到抖音短片的创作全谱系。 每个技能含完整工作流:大师哲学 → 感知训练 → 提示词公式 → 评价标准。 触发词:「AI视频」「剪视频」「做个短片」「视频创作」
SOC 직업 분류 기준