| name | bytedance-tts |
| description | 使用字节 Seed TTS 将 narration-plan.json 按片段合成为 WAV,并输出包含 slide_id、实际时长和停顿的 tts-manifest.json。用于口播视频配音、复刻音色分段合成和页面级音频对齐。 |
字节分段 TTS
读取 Skill 根目录的 env.json,运行时同名环境变量覆盖默认值。BYTE_TTS_API_KEY 必须由运行环境提供,不得输出到日志。
BYTEDANCE_TTS_SKILL_DIR="<加载后显示的 Skill 根目录>"
python3 "$BYTEDANCE_TTS_SKILL_DIR/scripts/segmented_tts.py" \
--output-dir "$OUTPUT_DIR" \
--plan "$OUTPUT_DIR/narration-plan.json" \
--output "$OUTPUT_DIR/voiceover.wav" \
--manifest "$OUTPUT_DIR/tts-manifest.json"
逐片段请求 TTS,只把正文发送给接口;页面停顿在本地插入真实静音。输出 WAV 和 manifest,保留输入中的 slide_id、segment_id 与文本,并记录实际音频时长。
详细接口约定见 references/bytedance-tts.md。