video-narrate
Create narrated videos from static images — animates with Kling AI, adds voiceover, optional lip sync
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
Create narrated videos from static images — animates with Kling AI, adds voiceover, optional lip sync
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
Redactar escritos jurídicos mexicanos largos (recursos de apelación, demandas, contestaciones, amparos) a partir de varios documentos de un expediente (demanda, contestación, pericial, confesional, sentencia), entregados como .docx editable. Úsalo cuando el usuario pida "recurso de apelación", "redacta el escrito", "haz la demanda/contestación en Word", o cualquier pieza procesal larga que deba correlacionar agravios/hechos con documentos fuente y jurisprudencia verificada.
Sintetizar o redactar un entregable a partir de varios documentos fuente (o pocos muy grandes) que juntos NO caben en la ventana de contexto — reportes multi-fuente, due diligence, análisis/comparación de contratos, resúmenes de expediente, investigación. Úsalo cuando debas correlacionar información entre múltiples documentos y producir un documento nuevo, y leerlos todos completos reventaría el contexto ("Prompt is too long"). NO es para leer un solo documento corto.
Busca y descarga assets de diseño (iconos, ilustraciones, 3D, animaciones Lottie, imágenes AI) desde IconScout. Dispara cuando el user pida un icono/ilustración/animación para un diseño, mockup, presentación o web, o mencione IconScout. 13.8M+ assets con licencia royalty-free.
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
Transcribe a texto el HABLA de un audio largo o pesado (reuniones, notas de voz reenviadas, grabaciones de 10–60+ min). Trocea con ffmpeg y transcribe cada parte con Whisper, sin toparse con el límite de 25MB de la API. Úsala cuando llegue un [Audio file: ...] y el usuario pida "transcribe", "qué dice", "analiza el audio", o para resumir/analizar una grabación de voz.
Haz una versión nueva/ejecutiva/más limpia de un documento institucional (PDFs tipo "orden del día", agendas, hojas de evento, programas) MINANDO sus assets reales (logos, fotos de ponentes, texto, fuentes) y RECONSTRUYENDO en HTML — nunca re-difundiendo la página como imagen. Úsala ante "haz una nueva versión", "versión ejecutiva", "rehazlo más limpio", "adáptalo" de un PDF.
| name | video-narrate |
| description | Create narrated videos from static images — animates with Kling AI, adds voiceover, optional lip sync |
| allowed-tools | Bash(video-narrate:*) |
Create narrated videos from static images. Each image becomes an animated 5-second clip with voiceover narration. Scenes with people can have lip-synced audio.
generate-gif --animate) or text-to-video (use generate-video)video-narrate img1.png img2.png img3.png img4.png \
--prompts "aerial pan of the city" "chef cooking in kitchen" "slow zoom into the plate" "chef talking to camera" \
--texts "Bienvenidos a la Ciudad de México" "El chef Juan prepara su platillo estrella" "Su especialidad es el mole oaxaqueño" "Les presento mi receta favorita" \
--lipsync 0 1 0 1 \
--voice regina
| Parameter | Required | Description |
|---|---|---|
| images (positional) | Yes | Paths to images (.png/.jpg) |
--prompts | Yes | One per image — describes camera movement/animation style |
--texts | Yes | One per image — narration text (what the voice says) |
--lipsync | No | One 0/1 per image. 1 = lip sync (for scenes with people). Default: all 0 |
--voice | No | ElevenLabs voice (default: antonio). Same voices as text-to-speech |
--video-vol | No | Kling ambient audio volume 0.0–1.0 (default: 0.35) |
--narr-vol | No | Narration volume 0.0–2.0 (default: 1.2) |
--output | No | Output filename (default: auto-generated) |
Look at each image:
1 (lip sync makes it look natural)0 (no lips to sync, just overlay narration)| Scene type | Cost |
|---|---|
| Without lip sync | ~$0.42 (Kling) + ~$0.01 (TTS) |
| With lip sync | ~$0.49 (Kling + LipSync) + ~$0.01 (TTS) |
A 4-clip video with 2 lip-synced scenes ≈ $1.82
mcp__nanoclaw__send_message({ text: "Tu video narrado:", video_path: "/workspace/group/video-narrate-123.mp4" })