video-narrate
Create narrated videos from static images — animates with Kling AI, adds voiceover, optional lip sync
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
Create narrated videos from static images — animates with Kling AI, adds voiceover, optional lip sync
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
| name | video-narrate |
| description | Create narrated videos from static images — animates with Kling AI, adds voiceover, optional lip sync |
| allowed-tools | Bash(video-narrate:*) |
Create narrated videos from static images. Each image becomes an animated 5-second clip with voiceover narration. Scenes with people can have lip-synced audio.
generate-gif --animate) or text-to-video (use generate-video)video-narrate img1.png img2.png img3.png img4.png \
--prompts "aerial pan of the city" "chef cooking in kitchen" "slow zoom into the plate" "chef talking to camera" \
--texts "Bienvenidos a la Ciudad de México" "El chef Juan prepara su platillo estrella" "Su especialidad es el mole oaxaqueño" "Les presento mi receta favorita" \
--lipsync 0 1 0 1 \
--voice regina
| Parameter | Required | Description |
|---|---|---|
| images (positional) | Yes | Paths to images (.png/.jpg) |
--prompts | Yes | One per image — describes camera movement/animation style |
--texts | Yes | One per image — narration text (what the voice says) |
--lipsync | No | One 0/1 per image. 1 = lip sync (for scenes with people). Default: all 0 |
--voice | No | ElevenLabs voice (default: antonio). Same voices as text-to-speech |
--video-vol | No | Kling ambient audio volume 0.0–1.0 (default: 0.35) |
--narr-vol | No | Narration volume 0.0–2.0 (default: 1.2) |
--output | No | Output filename (default: auto-generated) |
Look at each image:
1 (lip sync makes it look natural)0 (no lips to sync, just overlay narration)| Scene type | Cost |
|---|---|
| Without lip sync | ~$0.42 (Kling) + ~$0.01 (TTS) |
| With lip sync | ~$0.49 (Kling + LipSync) + ~$0.01 (TTS) |
A 4-clip video with 2 lip-synced scenes ≈ $1.82
mcp__nanoclaw__send_message({ text: "Tu video narrado:", video_path: "/workspace/group/video-narrate-123.mp4" })
Redactar escritos jurídicos mexicanos largos (recursos de apelación, demandas, contestaciones, amparos) a partir de varios documentos de un expediente (demanda, contestación, pericial, confesional, sentencia), entregados como .docx editable. Úsalo cuando el usuario pida "recurso de apelación", "redacta el escrito", "haz la demanda/contestación en Word", o cualquier pieza procesal larga que deba correlacionar agravios/hechos con documentos fuente y jurisprudencia verificada.
Sintetizar o redactar un entregable a partir de varios documentos fuente (o pocos muy grandes) que juntos NO caben en la ventana de contexto — reportes multi-fuente, due diligence, análisis/comparación de contratos, resúmenes de expediente, investigación. Úsalo cuando debas correlacionar información entre múltiples documentos y producir un documento nuevo, y leerlos todos completos reventaría el contexto ("Prompt is too long"). NO es para leer un solo documento corto.
Busca y descarga assets de diseño (iconos, ilustraciones, 3D, animaciones Lottie, imágenes AI) desde IconScout. Dispara cuando el user pida un icono/ilustración/animación para un diseño, mockup, presentación o web, o mencione IconScout. 13.8M+ assets con licencia royalty-free.
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
Transcribe a texto el HABLA de un audio largo o pesado (reuniones, notas de voz reenviadas, grabaciones de 10–60+ min). Trocea con ffmpeg y transcribe cada parte con Whisper, sin toparse con el límite de 25MB de la API. Úsala cuando llegue un [Audio file: ...] y el usuario pida "transcribe", "qué dice", "analiza el audio", o para resumir/analizar una grabación de voz.
Haz una versión nueva/ejecutiva/más limpia de un documento institucional (PDFs tipo "orden del día", agendas, hojas de evento, programas) MINANDO sus assets reales (logos, fotos de ponentes, texto, fuentes) y RECONSTRUYENDO en HTML — nunca re-difundiendo la página como imagen. Úsala ante "haz una nueva versión", "versión ejecutiva", "rehazlo más limpio", "adáptalo" de un PDF.