voice
Text-to-speech with Mexican Spanish voices (ElevenLabs) and voice cloning
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
Text-to-speech with Mexican Spanish voices (ElevenLabs) and voice cloning
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
| name | voice |
| description | Text-to-speech with Mexican Spanish voices (ElevenLabs) and voice cloning |
| allowed-tools | Bash(text-to-speech:*),Bash(clone-voice:*),Bash(ffmpeg:*),Bash(yt-dlp:*) |
When the user asks you to respond with voice, or when replying to a voice note and a voice reply feels natural, generate audio.
Pick the voice that fits the moment:
| Voice | Style | When to use |
|---|---|---|
antonio | Confident, gentle, latino | Default — everyday conversation |
jc | Energetic, broadcaster | News, data, exciting updates |
brian | Warm, soft, podcast | Long explanations, calm tone |
daniel | Young, natural, casual | Casual banter, young audience |
enrique | Rich, credible, narrator | Serious narration, formal reports |
maya | Dynamic, Mexican female | Female storytelling, energetic |
cristina | Young, conversational, Mexican female | Female casual chat |
regina | Sweet, friendly, Mexican female | Female warm/professional |
custom | Cloned voice | When group has a custom cloned voice |
# Default voice (antonio)
text-to-speech "Qué onda, aquí el resumen de hoy" antonio
# Energetic delivery
text-to-speech "Última hora: el servidor está al 99% de uptime" jc
# Calm explanation
text-to-speech "Te explico cómo funciona el sistema de pagos" brian
# Custom cloned voice (if available)
text-to-speech "Esto con la voz personalizada" custom
mcp__nanoclaw__send_message({ text: "voice", audio_path: "/workspace/group/tts-123.ogg" })
When someone sends an audio/video and says "clona esta voz", "usa esta voz", "guarda esta voz":
clone-voice /workspace/group/attachments/audio-123.ogg "nombre-de-la-voz"
If they send a video file (.mp4, .mov, etc.):
ffmpeg -i /workspace/group/attachments/video.mp4 -vn -acodec libopus /workspace/group/extracted-audio.ogg -y
clone-voice /workspace/group/extracted-audio.ogg "nombre-de-la-voz"
When someone sends a YouTube URL and says "clona la voz de este video", "baja este video", "descarga el audio" or similar:
IMPORTANT: YouTube blocks ALL requests without cookies. NEVER try without cookies. ALWAYS copy cookies first (source is read-only), then use yt-dlp:
cp /workspace/youtube-cookies.txt /tmp/yt-cookies.txt
yt-dlp --cookies /tmp/yt-cookies.txt --remote-components ejs:github -x --audio-format wav -o "/workspace/group/yt-audio.%(ext)s" "YOUTUBE_URL"
The cookies file is pre-mounted at /workspace/youtube-cookies.txt (read-only). You MUST copy it to /tmp/ first because yt-dlp needs to write to it. Do NOT try cobalt, invidious, or any other workaround — they all fail. Use yt-dlp with cookies directly.
Then clone:
clone-voice /workspace/group/yt-audio.wav "nombre-de-la-voz"
Warn the user first: YouTube download + voice cloning takes ~1-2 minutes. Send a message before starting:
mcp__nanoclaw__send_message({ text: "Descargando audio de YouTube y clonando la voz, dame 1-2 min..." })
For best results, pick a video with clear speech (no music, no background noise).
This uploads the audio to ElevenLabs, creates a cloned voice, and saves it to the group config. Future calls with text-to-speech "text" custom will use the cloned voice.
To stop using the cloned voice: delete /workspace/group/voice_config.json.
Redactar escritos jurídicos mexicanos largos (recursos de apelación, demandas, contestaciones, amparos) a partir de varios documentos de un expediente (demanda, contestación, pericial, confesional, sentencia), entregados como .docx editable. Úsalo cuando el usuario pida "recurso de apelación", "redacta el escrito", "haz la demanda/contestación en Word", o cualquier pieza procesal larga que deba correlacionar agravios/hechos con documentos fuente y jurisprudencia verificada.
Sintetizar o redactar un entregable a partir de varios documentos fuente (o pocos muy grandes) que juntos NO caben en la ventana de contexto — reportes multi-fuente, due diligence, análisis/comparación de contratos, resúmenes de expediente, investigación. Úsalo cuando debas correlacionar información entre múltiples documentos y producir un documento nuevo, y leerlos todos completos reventaría el contexto ("Prompt is too long"). NO es para leer un solo documento corto.
Busca y descarga assets de diseño (iconos, ilustraciones, 3D, animaciones Lottie, imágenes AI) desde IconScout. Dispara cuando el user pida un icono/ilustración/animación para un diseño, mockup, presentación o web, o mencione IconScout. 13.8M+ assets con licencia royalty-free.
Text-to-speech with Spanish voices (Kokoro, local & free) and OpenAI fallback
Transcribe a texto el HABLA de un audio largo o pesado (reuniones, notas de voz reenviadas, grabaciones de 10–60+ min). Trocea con ffmpeg y transcribe cada parte con Whisper, sin toparse con el límite de 25MB de la API. Úsala cuando llegue un [Audio file: ...] y el usuario pida "transcribe", "qué dice", "analiza el audio", o para resumir/analizar una grabación de voz.
Haz una versión nueva/ejecutiva/más limpia de un documento institucional (PDFs tipo "orden del día", agendas, hojas de evento, programas) MINANDO sus assets reales (logos, fotos de ponentes, texto, fuentes) y RECONSTRUYENDO en HTML — nunca re-difundiendo la página como imagen. Úsala ante "haz una nueva versión", "versión ejecutiva", "rehazlo más limpio", "adáptalo" de un PDF.