voice
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
Instalar com Codex ou Claude Copie este prompt, cole no Codex, Claude ou outro assistente e deixe que ele revise a página da skill e instale para você.
Menu
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
Instalar com Codex ou Claude Copie este prompt, cole no Codex, Claude ou outro assistente e deixe que ele revise a página da skill e instale para você.
Baseado na classificação ocupacional SOC
Redactar escritos jurídicos mexicanos largos (recursos de apelación, demandas, contestaciones, amparos) a partir de varios documentos de un expediente (demanda, contestación, pericial, confesional, sentencia), entregados como .docx editable. Úsalo cuando el usuario pida "recurso de apelación", "redacta el escrito", "haz la demanda/contestación en Word", o cualquier pieza procesal larga que deba correlacionar agravios/hechos con documentos fuente y jurisprudencia verificada.
Sintetizar o redactar un entregable a partir de varios documentos fuente (o pocos muy grandes) que juntos NO caben en la ventana de contexto — reportes multi-fuente, due diligence, análisis/comparación de contratos, resúmenes de expediente, investigación. Úsalo cuando debas correlacionar información entre múltiples documentos y producir un documento nuevo, y leerlos todos completos reventaría el contexto ("Prompt is too long"). NO es para leer un solo documento corto.
Busca y descarga assets de diseño (iconos, ilustraciones, 3D, animaciones Lottie, imágenes AI) desde IconScout. Dispara cuando el user pida un icono/ilustración/animación para un diseño, mockup, presentación o web, o mencione IconScout. 13.8M+ assets con licencia royalty-free.
Transcribe a texto el HABLA de un audio largo o pesado (reuniones, notas de voz reenviadas, grabaciones de 10–60+ min). Trocea con ffmpeg y transcribe cada parte con Whisper, sin toparse con el límite de 25MB de la API. Úsala cuando llegue un [Audio file: ...] y el usuario pida "transcribe", "qué dice", "analiza el audio", o para resumir/analizar una grabación de voz.
Haz una versión nueva/ejecutiva/más limpia de un documento institucional (PDFs tipo "orden del día", agendas, hojas de evento, programas) MINANDO sus assets reales (logos, fotos de ponentes, texto, fuentes) y RECONSTRUYENDO en HTML — nunca re-difundiendo la página como imagen. Úsala ante "haz una nueva versión", "versión ejecutiva", "rehazlo más limpio", "adáptalo" de un PDF.
Redacta un oficio, circular, memorándum, carta o convocatoria institucional DESCTI y entrégalo como .docx EDITABLE (no PDF, no HTML). Úsala ante "haz un oficio", "redacta un oficio/carta/circular/memo", "necesito un oficio para...". NO es para clonar un PDF existente (eso es doc-remix); esto es redactar texto institucional nuevo.
| name | voice |
| description | Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback |
| allowed-tools | Bash(text-to-speech:*),Bash(clone-voice:*),Bash(ffmpeg:*),Bash(yt-dlp:*) |
When the user asks you to respond with voice, or when replying to a voice note and a voice reply feels natural, generate audio.
Kokoro runs locally (free, no API key). It ships 3 Spanish voices:
| Voice | Style | When to use |
|---|---|---|
santa | Male, Spanish | Default — everyday conversation |
alex | Male, Spanish | Alternative male voice |
dora | Female, Spanish | Female delivery |
# Default voice (santa)
text-to-speech "Qué onda, aquí el resumen de hoy"
# Alternative male voice
text-to-speech "Última hora: el servidor está al 99% de uptime" alex
# Female voice
text-to-speech "Te explico cómo funciona el sistema de pagos" dora
Legacy names (antonio, jc, brian, daniel, enrique, maya, cristina, regina) still
work — they remap to the closest Kokoro voice. If Kokoro is unavailable the script
falls back to OpenAI onyx.
mcp__nanoclaw__send_message({ text: "voice", audio_path: "/workspace/group/tts-123.ogg" })
When someone sends an audio/video and says "clona esta voz", "usa esta voz", "guarda esta voz":
clone-voice /workspace/group/attachments/audio-123.ogg "nombre-de-la-voz"
If they send a video file (.mp4, .mov, etc.):
ffmpeg -i /workspace/group/attachments/video.mp4 -vn -acodec libopus /workspace/group/extracted-audio.ogg -y
clone-voice /workspace/group/extracted-audio.ogg "nombre-de-la-voz"
When someone sends a YouTube URL and says "clona la voz de este video", "baja este video", "descarga el audio" or similar:
IMPORTANT: YouTube blocks ALL requests without cookies. NEVER try without cookies. ALWAYS copy cookies first (source is read-only), then use yt-dlp:
cp /workspace/youtube-cookies.txt /tmp/yt-cookies.txt
yt-dlp --cookies /tmp/yt-cookies.txt --remote-components ejs:github -x --audio-format wav -o "/workspace/group/yt-audio.%(ext)s" "YOUTUBE_URL"
The cookies file is pre-mounted at /workspace/youtube-cookies.txt (read-only). You MUST copy it to /tmp/ first because yt-dlp needs to write to it. Do NOT try cobalt, invidious, or any other workaround — they all fail. Use yt-dlp with cookies directly.
Then clone:
clone-voice /workspace/group/yt-audio.wav "nombre-de-la-voz"
Warn the user first: YouTube download + voice cloning takes ~1-2 minutes. Send a message before starting:
mcp__nanoclaw__send_message({ text: "Descargando audio de YouTube y clonando la voz, dame 1-2 min..." })
For best results, pick a video with clear speech (no music, no background noise).
⚠️ Voice cloning relied on ElevenLabs and is currently unavailable (no active ElevenLabs plan). Kokoro does not support cloning. Calls with
custom/clonedfall back to the defaultsantavoice. The cloning instructions below are kept for when an ElevenLabs plan is restored.