| name | video-editing |
| description | 실제 영상을 자르고, 구조화하고, 보강하기 위한 AI 지원 비디오 편집 워크플로우. 원본 캡처부터 FFmpeg, Remotion, ElevenLabs, fal.ai를 거쳐 Descript 또는 CapCut에서의 최종 마무리까지 전체 파이프라인을 다룹니다. 사용자가 비디오 편집, 영상 컷팅, 브이로그 제작 또는 비디오 콘텐츠 구축을 원할 때 사용하세요. |
| origin | ECC |
비디오 편집 (Video Editing)
실제 영상을 위한 AI 지원 편집입니다. 프롬프트로부터의 생성이 아닙니다. 기존 비디오를 빠르게 편집하는 것이 핵심입니다.
활성화 시점
- 사용자가 비디오 영상을 편집, 컷팅 또는 구조화하고자 할 때
- 긴 녹화본을 숏폼 콘텐츠로 바꿀 때
- 원본 캡처로부터 브이로그, 튜토리얼 또는 데모 비디오를 구축할 때
- 기존 비디오에 오버레이, 자막, 음악 또는 음성 해설을 추가할 때
- 다양한 플랫폼(YouTube, TikTok, Instagram)에 맞게 비디오를 리프레임할 때
- 사용자가 "비디오 편집", "영상 잘라줘", "브이로그 만들어 줘" 또는 "비디오 워크플로우"라고 말할 때
핵심 테제
AI 비디오 편집은 비디오 전체를 만들어 달라고 요청하는 것을 멈추고, 실제 영상을 압축하고 구조화하고 보강하는 데 사용할 때 유용합니다. 가치는 생성이 아니라 압축에 있습니다.
파이프라인
Screen Studio / 원본 영상
→ Claude / Codex
→ FFmpeg
→ Remotion
→ ElevenLabs / fal.ai
→ Descript or CapCut
각 레이어는 특정 역할을 수행합니다. 레이어를 건너뛰지 마세요. 하나의 도구가 모든 것을 하도록 만들지 마세요.
레이어 1: 캡처 (Screen Studio / 원본 영상)
소스 자료 수집:
- Screen Studio: 앱 데모, 코딩 세션, 브라우저 워크플로우를 위한 세련된 화면 녹화
- 원본 카메라 영상: 브이로그 영상, 인터뷰, 이벤트 녹화
- VideoDB를 통한 데스크톱 캡처: 실시간 컨텍스트가 포함된 세션 녹화 (
videodb 스킬 참조)
출력: 조직화를 위해 준비된 원본 파일.
레이어 2: 조직화 (Claude / Codex)
Claude Code 또는 Codex를 사용하여 다음을 수행합니다:
- 트랜스크립트 및 라벨링: 트랜스크립트 생성, 주제 및 테마 식별
- 구조 계획: 무엇을 남기고 무엇을 자를지, 어떤 순서가 좋을지 결정
- 불필요한 섹션 식별: 일시 중지, 빗나간 이야기, 반복된 테이크 찾기
- 편집 결정 목록(EDL) 생성: 컷 타임스탬프, 유지할 세그먼트
- FFmpeg 및 Remotion 코드 스캐폴딩: 명령어 및 컴포지션 생성
예시 프롬프트:
"여기 4시간짜리 녹화본의 트랜스크립트가 있어. 24분짜리 브이로그를 위한
가장 강력한 세그먼트 8개를 식별해 줘. 각 세그먼트에 대한 FFmpeg 컷 명령어를 줘."
이 레이어는 최종적인 창의적 취향이 아니라 구조에 관한 것입니다.
레이어 3: 결정론적 컷 (FFmpeg)
FFmpeg은 지루하지만 중요한 작업을 처리합니다: 분할, 트리밍, 병합 및 전처리.
타임스탬프로 세그먼트 추출
ffmpeg -i raw.mp4 -ss 00:12:30 -to 00:15:45 -c copy segment_01.mp4
편집 결정 목록에서 일괄 컷팅
#!/bin/bash
while IFS=, read -r start end label; do
ffmpeg -i raw.mp4 -ss "$start" -to "$end" -c copy "segments/${label}.mp4"
done < cuts.txt
세그먼트 병합
for f in segments/*.mp4; do echo "file '$f'"; done > concat.txt
ffmpeg -f concat -safe 0 -i concat.txt -c copy assembled.mp4
빠른 편집을 위한 프록시 생성
ffmpeg -i raw.mp4 -vf "scale=960:-2" -c:v libx264 -preset ultrafast -crf 28 proxy.mp4
트랜스크립트 작성을 위한 오디오 추출
ffmpeg -i raw.mp4 -vn -acodec pcm_s16le -ar 16000 audio.wav
오디오 레벨 정규화
ffmpeg -i segment.mp4 -af loudnorm=I=-16:TP=-1.5:LRA=11 -c:v copy normalized.mp4
레이어 4: 프로그래밍 가능한 컴포지션 (Remotion)
Remotion은 편집 문제를 조합 가능한 코드로 바꿉니다. 전통적인 편집기가 힘들어하는 작업에 사용하세요:
Remotion 사용 시점
- 오버레이: 텍스트, 이미지, 브랜딩, 로워 써드 (lower thirds)
- 데이터 시각화: 차트, 통계, 애니메이션 숫자
- 모션 그래픽: 전환 (transitions), 설명 애니메이션
- 조합 가능한 장면: 비디오 전반에서 재사용 가능한 템플릿
- 제품 데모: 주석이 달린 스크린샷, UI 하이라이트
기본 Remotion 컴포지션
import { AbsoluteFill, Sequence, Video, useCurrentFrame } from "remotion";
export const VlogComposition: React.FC = () => {
const frame = useCurrentFrame();
return (
<AbsoluteFill>
{/* 메인 영상 */}
<Sequence from={0} durationInFrames={300}>
<Video src="/segments/intro.mp4" />
</Sequence>
{/* 타이틀 오버레이 */}
<Sequence from={30} durationInFrames={90}>
<AbsoluteFill style={{
justifyContent: "center",
alignItems: "center",
}}>
<h1 style={{
fontSize: 72,
color: "white",
textShadow: "2px 2px 8px rgba(,,,)",
}}>
AI 편집 스택
{/* 다음 세그먼트 */}
);
};
렌더링 출력
npx remotion render src/index.ts VlogComposition output.mp4
상세 패턴 및 API 참조는 Remotion 문서를 확인하세요.
레이어 5: 생성된 자산 (ElevenLabs / fal.ai)
필요한 것만 생성하세요. 비디오 전체를 생성하지 마세요.
ElevenLabs를 통한 음성 해설
import os
import requests
resp = requests.post(
f"https://api.elevenlabs.io/v1/text-to-speech/{voice_id}",
headers={
"xi-api-key": os.environ["ELEVENLABS_API_KEY"],
"Content-Type": "application/json"
},
json={
"text": "Your narration text here",
"model_id": "eleven_turbo_v2_5",
"voice_settings": {"stability": 0.5, "similarity_boost": 0.75}
}
)
with open("voiceover.mp3", "wb") as f:
f.write(resp.content)
fal.ai를 통한 음악 및 효과음
다음 용도로 fal-ai-media 스킬을 사용하세요:
- 배경 음악 생성
- 사운드 효과 (비디오-오디오를 위한 ThinkSound 모델)
- 전환음
fal.ai를 통한 생성된 비주얼
삽입 샷, 썸네일 또는 존재하지 않는 B-roll을 위해 사용하세요:
generate(app_id: "fal-ai/nano-banana-pro", input_data: {
"prompt": "professional thumbnail for tech vlog, dark background, code on screen",
"image_size": "landscape_16_9"
})
VideoDB 생성형 오디오
VideoDB가 구성된 경우:
voiceover = coll.generate_voice(text="Narration here", voice="alloy")
music = coll.generate_music(prompt="lo-fi background for coding vlog", duration=120)
sfx = coll.generate_sound_effect(prompt="subtle whoosh transition")
레이어 6: 최종 마무리 (Descript / CapCut)
마지막 레이어는 인간의 영역입니다. 다음을 위해 전통적인 편집기를 사용하세요:
- 페이스 (Pacing): 너무 빠르거나 느리게 느껴지는 컷 조정
- 자막: 자동 생성 후 수동으로 정리
- 컬러 그레이딩: 기본적인 보정 및 분위기 설정
- 최종 오디오 믹싱: 음성, 음악 및 효과음 레벨 밸런스 조정
- 내보내기: 플랫폼별 형식 및 품질 설정
여기에 취향이 담깁니다. AI는 반복적인 작업을 제거합니다. 최종 결정은 당신이 내립니다.
소셜 미디어 리프레임 (Reframing)
플랫폼마다 다른 가로세로 비율이 필요합니다:
| 플랫폼 | 가로세로 비율 | 해상도 |
|---|
| YouTube | 16:9 | 1920x1080 |
| TikTok / Reels | 9:16 | 1080x1920 |
| Instagram Feed | 1:1 | 1080x1080 |
| X / Twitter | 16:9 또는 1:1 | 1280x720 또는 720x720 |
FFmpeg으로 리프레임
ffmpeg -i input.mp4 -vf "crop=ih*9/16:ih,scale=1080:1920" vertical.mp4
ffmpeg -i input.mp4 -vf "crop=ih:ih,scale=1080:1080" square.mp4
VideoDB로 리프레임
from videodb import ReframeMode
reframed = video.reframe(start=0, end=60, target="vertical", mode=ReframeMode.smart)
장면 감지 및 자동 컷팅
FFmpeg 장면 감지
ffmpeg -i input.mp4 -vf "select='gt(scene,0.3)',showinfo" -vsync vfr -f null - 2>&1 | grep showinfo
자동 컷팅을 위한 무음 감지
ffmpeg -i input.mp4 -af silencedetect=noise=-30dB:d=2 -f null - 2>&1 | grep silence
하이라이트 추출
Claude를 사용하여 트랜스크립트 + 장면 타임스탬프를 분석하세요:
"이 타임스탬프가 포함된 트랜스크립트와 장면 전환 지점들을 바탕으로,
소셜 미디어를 위한 가장 매력적인 30초짜리 클립 5개를 식별해 줘."
각 도구별 강점
| 도구 | 강점 | 약점 |
|---|
| Claude / Codex | 조직화, 계획, 코드 생성 | 창의적인 취향을 담당하는 레이어 아님 |
| FFmpeg | 결정론적 컷팅, 배치 처리, 형식 변환 | 시각적 편집 UI 없음 |
| Remotion | 프로그래밍 가능한 오버레이, 조합 가능한 장면, 재사용 템플릿 | 비개발자에게는 러닝 커브 있음 |
| Screen Studio | 즉시 세련된 화면 녹화 가능 | 화면 캡처만 가능 |
| ElevenLabs | 음성, 내레이션, 음악, 효과음 | 워크플로우의 중심은 아님 |
| Descript / CapCut | 최종 페이스 조정, 자막, 마무리 | 수동 작업, 자동화 불가 |
핵심 원칙
- 생성이 아니라 편집입니다. 이 워크플로우는 프롬프트로부터 만드는 것이 아니라 실제 영상을 자르는 데 초점을 맞춥니다.
- 스타일보다 구조입니다. 시각적인 것을 건드리기 전에 레이어 2에서 스토리를 바로잡으세요.
- FFmpeg은 중추입니다. 지루하지만 필수적입니다. 긴 영상을 관리 가능하게 만드는 곳입니다.
- 반복을 위한 Remotion. 한 번 이상 할 작업이라면 Remotion 컴포넌트로 만드세요.
- 선택적으로 생성하세요. 존재하지 않는 자산에만 AI 생성을 사용하고, 모든 것에 쓰지 마세요.
- 취향이 마지막 레이어입니다. AI는 반복 작업을 치워줍니다. 최종적인 창의적 결정은 당신이 합니다.
관련 스킬
fal-ai-media — AI 이미지, 비디오 및 오디오 생성
videodb — 서버 사이드 비디오 처리, 인덱싱 및 스트리밍
content-engine — 플랫폼 네이티브 콘텐츠 배포