with one click
podcastcut-install
环境准备。安装依赖、下载模型、验证环境。触发词:安装、环境准备、初始化、install videocut
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Menu
环境准备。安装依赖、下载模型、验证环境。触发词:安装、环境准备、初始化、install videocut
Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.
Based on SOC occupation classification
使用 browser-use CLI 对 PodcastCut webapp 做浏览器验收。始终使用 headed 模式,覆盖打开页面、登录、上传指定音频、触发生成审查稿、刷新审查稿、手动标记删除、确认剪辑、核对 workspace 产物。触发词:browser validation、浏览器验证、用 browser-use 跑流程、上传音频验收
生成播客审查画布数据。根据当前工作区中的音频、转录、QA 报告和剪辑结果, 产出固定格式的 review_data.json,供右侧审查画布直接读取。 触发词:审查画布、review data、审查稿、生成播客审查
语音克隆 + 播客生成完整流程。 上传音频 → 转录 → 修正文稿 → 提取声音样本 → 克隆声音模型 → TTS 合成 → 合并成品音频。 全自动执行,无需用户逐步操作。 触发词:语音克隆、声音克隆、生成播客、克隆声音
音频剪辑。根据 delete_segments.json 删除指定片段,自适应淡入淡出,可选说话人音量对齐。触发词:剪辑、cut、编辑音频
将当前 webapp 发布到 Fly.io,并在发布前后做最小健康检查。 适用于前端或后端改动后的一键上线。触发词:deploy、发布、上线、推到 fly、fly.io
使用 browser-use CLI 对 webapp 做端到端验证。覆盖登录、上传音频、生成 review_data.json、刷新审查稿、手动标记删除、确认剪辑、验证 podcast_cut.mp3。触发词:browser e2e、端到端验证、验证网页剪辑、用浏览器跑流程
| name | podcastcut-install |
| description | 环境准备。安装依赖、下载模型、验证环境。触发词:安装、环境准备、初始化、install videocut |
首次使用前的环境准备
用户: 安装环境
用户: 初始化
用户: 下载模型
| 依赖 | 用途 | 安装命令 |
|---|---|---|
| funasr | 转录 + 口误识别 | pip install funasr |
| modelscope | 模型下载 | pip install modelscope |
| ffmpeg | 视频剪辑 | brew install ffmpeg |
首次运行自动下载到 ~/.cache/modelscope/:
| 模型 | 大小 | 用途 |
|---|---|---|
| paraformer-zh | 953MB | 语音识别(字符级时间戳) |
| punc_ct | 1.1GB | 标点预测(句子分割) |
| fsmn-vad | 4MB | 语音活动检测 |
| cam++ | ~100MB | 说话人分离 |
| 总计 | ~2.1GB |
| 阶段 | 功能 | 说明 |
|---|---|---|
| content(内容剪辑) | 转录 + 说话人分离 + 句子时间戳 | 一次调用 |
| transcribe(口误识别) | 转录 + 字符级时间戳 | 30s 分段 |
| subtitle(字幕生成) | 直接用转录结果 |
1. 安装 Python 依赖
↓
2. 安装 FFmpeg
↓
3. 下载 FunASR 模型
↓
4. 验证环境
pip install funasr modelscope
# macOS
brew install ffmpeg
# Ubuntu
sudo apt install ffmpeg
# 验证
ffmpeg -version
from funasr import AutoModel
# 下载全部模型(含说话人分离)
model = AutoModel(
model="paraformer-zh",
vad_model="fsmn-vad",
punc_model="ct-punc",
spk_model="cam++", # 说话人分离
)
print("FunASR 模型下载完成")
from funasr import AutoModel
model = AutoModel(
model="paraformer-zh",
vad_model="fsmn-vad",
punc_model="ct-punc",
spk_model="cam++",
disable_update=True
)
# 测试转录(用任意音频/视频)
result = model.generate(input="test.mp4", sentence_timestamp=True)
print("文本:", result[0]['text'][:50])
if 'sentence_info' in result[0]:
print("句子数:", len(result[0]['sentence_info']))
# 检查说话人分离
spk_ids = set(s.get('spk', 0) for s in result[0]['sentence_info'])
print("说话人数:", len(spk_ids))
print("✅ 环境就绪")
解决:使用国内镜像或手动下载
解决:确认已安装并添加到 PATH
which ffmpeg # 应该输出路径
解决:检查 Python 版本(需要 3.8+)
python3 --version