voice
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
Redactar escritos jurídicos mexicanos largos (recursos de apelación, demandas, contestaciones, amparos) a partir de varios documentos de un expediente (demanda, contestación, pericial, confesional, sentencia), entregados como .docx editable. Úsalo cuando el usuario pida "recurso de apelación", "redacta el escrito", "haz la demanda/contestación en Word", o cualquier pieza procesal larga que deba correlacionar agravios/hechos con documentos fuente y jurisprudencia verificada.
Sintetizar o redactar un entregable a partir de varios documentos fuente (o pocos muy grandes) que juntos NO caben en la ventana de contexto — reportes multi-fuente, due diligence, análisis/comparación de contratos, resúmenes de expediente, investigación. Úsalo cuando debas correlacionar información entre múltiples documentos y producir un documento nuevo, y leerlos todos completos reventaría el contexto ("Prompt is too long"). NO es para leer un solo documento corto.
Busca y descarga assets de diseño (iconos, ilustraciones, 3D, animaciones Lottie, imágenes AI) desde IconScout. Dispara cuando el user pida un icono/ilustración/animación para un diseño, mockup, presentación o web, o mencione IconScout. 13.8M+ assets con licencia royalty-free.
Transcribe a texto el HABLA de un audio largo o pesado (reuniones, notas de voz reenviadas, grabaciones de 10–60+ min). Trocea con ffmpeg y transcribe cada parte con Whisper, sin toparse con el límite de 25MB de la API. Úsala cuando llegue un [Audio file: ...] y el usuario pida "transcribe", "qué dice", "analiza el audio", o para resumir/analizar una grabación de voz.
Haz una versión nueva/ejecutiva/más limpia de un documento institucional (PDFs tipo "orden del día", agendas, hojas de evento, programas) MINANDO sus assets reales (logos, fotos de ponentes, texto, fuentes) y RECONSTRUYENDO en HTML — nunca re-difundiendo la página como imagen. Úsala ante "haz una nueva versión", "versión ejecutiva", "rehazlo más limpio", "adáptalo" de un PDF.
Redacta un oficio, circular, memorándum, carta o convocatoria institucional DESCTI y entrégalo como .docx EDITABLE (no PDF, no HTML). Úsala ante "haz un oficio", "redacta un oficio/carta/circular/memo", "necesito un oficio para...". NO es para clonar un PDF existente (eso es doc-remix); esto es redactar texto institucional nuevo.
| name | voice |
| description | Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback |
| allowed-tools | Bash(text-to-speech:*),Bash(clone-voice:*),Bash(ffmpeg:*),Bash(yt-dlp:*) |
When the user asks you to respond with voice, or when replying to a voice note and a voice reply feels natural, generate audio.
Kokoro runs locally (free, no API key). It ships 3 Spanish voices:
| Voice | Style | When to use |
|---|---|---|
santa | Male, Spanish | Default — everyday conversation |
alex | Male, Spanish | Alternative male voice |
dora | Female, Spanish | Female delivery |
# Default voice (santa)
text-to-speech "Qué onda, aquí el resumen de hoy"
# Alternative male voice
text-to-speech "Última hora: el servidor está al 99% de uptime" alex
# Female voice
text-to-speech "Te explico cómo funciona el sistema de pagos" dora
Legacy names (antonio, jc, brian, daniel, enrique, maya, cristina, regina) still
work — they remap to the closest Kokoro voice. If Kokoro is unavailable the script
falls back to OpenAI onyx.
mcp__nanoclaw__send_message({ text: "voice", audio_path: "/workspace/group/tts-123.ogg" })
When someone sends an audio/video and says "clona esta voz", "usa esta voz", "guarda esta voz":
clone-voice /workspace/group/attachments/audio-123.ogg "nombre-de-la-voz"
If they send a video file (.mp4, .mov, etc.):
ffmpeg -i /workspace/group/attachments/video.mp4 -vn -acodec libopus /workspace/group/extracted-audio.ogg -y
clone-voice /workspace/group/extracted-audio.ogg "nombre-de-la-voz"
When someone sends a YouTube URL and says "clona la voz de este video", "baja este video", "descarga el audio" or similar:
IMPORTANT: YouTube blocks ALL requests without cookies. NEVER try without cookies. ALWAYS copy cookies first (source is read-only), then use yt-dlp:
cp /workspace/youtube-cookies.txt /tmp/yt-cookies.txt
yt-dlp --cookies /tmp/yt-cookies.txt --remote-components ejs:github -x --audio-format wav -o "/workspace/group/yt-audio.%(ext)s" "YOUTUBE_URL"
The cookies file is pre-mounted at /workspace/youtube-cookies.txt (read-only). You MUST copy it to /tmp/ first because yt-dlp needs to write to it. Do NOT try cobalt, invidious, or any other workaround — they all fail. Use yt-dlp with cookies directly.
Then clone:
clone-voice /workspace/group/yt-audio.wav "nombre-de-la-voz"
Warn the user first: YouTube download + voice cloning takes ~1-2 minutes. Send a message before starting:
mcp__nanoclaw__send_message({ text: "Descargando audio de YouTube y clonando la voz, dame 1-2 min..." })
For best results, pick a video with clear speech (no music, no background noise).
⚠️ Voice cloning relied on ElevenLabs and is currently unavailable (no active ElevenLabs plan). Kokoro does not support cloning. Calls with
custom/clonedfall back to the defaultsantavoice. The cloning instructions below are kept for when an ElevenLabs plan is restored.