| name | cut-quality |
| description | 改动剪切听感(停顿保留/crossfade/切点对齐)、紧凑度参数、LLM 废话识别 prompt 契约、建议审阅交互时使用。 |
剪切质量域知识
成品听感是这个产品成败的地方——"能剪"和"剪得让人听不出来"之间隔着以下参数体系。
听感不变量(默认值,均可配置)
- 绝不零间隙硬拼。 保留最小停顿:句中 ~150ms、句尾 ~250ms。"紧凑度"滑杆整体缩放这两个值(下限 80ms,再低必然机器人感)。
- 切点音频 crossfade 20–40ms(equal-power 曲线),消除爆音与相位跳变。
- 切点对齐词边界并外扩 padding 40–60ms,绝不在元音中间切——宁可少剪不可吞字(优先级:剪切正确性 > 紧凑)。
- 语气词删除后若两侧本有停顿,合并为一个停顿(取较长者),不留"双倍空洞"。
- 视频侧切点直接跳切(jump cut 是口播视频的成熟语言),不做画面过渡;但音频必须按上述规则处理。
LLM 废话识别契约(VerbosityAnalyzer ↔ LLMProvider)
- 输入:带句编号的全文 + 可选主题提示(用户一句话描述视频主题,显著提升离题判定)。
- 输出 JSON schema:
[{sentence_ids: [Int], category: repetition|falseStart|offTopic|padding, reason: String, confidence: Float}]。
- 禁止模型输出时间戳/字符 offset——只收句编号,本地反查(ADR-0003)。
- 长文分块时每块携带全文摘要作上下文;跨块重复(口播常见的"重讲一遍")需要全文视角,不能只看块内。
- prompt 修改要跑固定评测集(几段真实口播 + 人工标注的应删句),防止无感回退。
审阅交互原则
- 三类建议统一 UI:按类别着色(停顿/语气词/废话),支持逐条与按类批量接受。
- 每条建议可"跳听":播放切点前后各 1.5s 的拼接结果,让用户用耳朵确认。
- verbosity 默认全部待确认;pause/filler 默认可一键全收(高置信、可撤销)。
- 置信度低于阈值的 verbosity 建议折叠到"低置信"分组,不刷屏。