소스 정보
- 저장소
- Ntizar/MasterMind
- 최근 소스 활동
- 2026년 9월 6일 22:06
- 감지된 SKILL.md 언어
- 스페인어
- 스타
- 2
- 포크
- 0
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/Ntizar/MasterMind --skill hermes-talk-realtime-voice명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SKILL.md 표시 중
| name | hermes-talk-realtime-voice |
| description | Usa a dar voz dúplex en tiempo real a Hermes. |
| version | 2.0.0 |
| author | Mastermind (stars-explorer) |
| license | MIT |
| metadata | {"hermes":{"tags":["hermes","plugin","voz","realtime","speech-to-speech","openai-realtime","discord","dashboard"],"related_skills":["hermes-agent","voicebox","open-source-voice-studio","supermemory"]}} |
Repo: https://github.com/TheSmokeDev/hermes-talk (35⭐, Python, MIT, activo, verificado 2026-09-07 contra README real v0.6+)
Cuando David pida hablar con el agente por voz, integrar sesiones de voz en terminal/Discord/dashboard de Hermes, o delegar trabajo en segundo plano que se anuncie por altavoz al terminar. NO confundir con skills de TTS/clonación (voicebox, gpt-sovits): eso es sintetizar voz; hermes-talk es una conversación speech-to-speech completa que ejecuta tools reales de Hermes.
No reemplaza el modo voice por defecto de Hermes (STT→inferencia→TTS por turnos) — es la otra forma.
| Superficie | Cómo se arranca | Notas |
|---|---|---|
| Terminal | hermes talk | mic+altavoz nativo vía extra [audio] (sounddevice) |
| Dentro de sesión Hermes | /talk | ÚNICA superficie con agent loop attached → memoria y delegación responden inline |
| Discord | /voice join y luego /talk join | pide prestada la conexión de voz del host, nunca abre una segunda; autoridad de operador vía TALK_DISCORD_OPERATOR_USER_IDS (sin ella: todos pueden hablar, nadie puede mutar — fail-closed intencional) |
| Dashboard (pestaña Talk) | hermes dashboard | WebRTC del navegador, sin drivers de mic; solo OpenAI; loopback-only hasta fijar TALK_DASHBOARD_TOKEN |
TALK_PROVIDER, fail-closed, NUNCA se infiere de qué keys existan)openai (default): todos los surfaces. Auth en orden: TALK_OPENAI_API_KEY (set-pero-vacío REFUSA, no cae al siguiente) → OPENAI_API_KEY → Codex OAuth (codex login: viaja sobre el entitlement Realtime de tu suscripción ChatGPT, sin API key ni factura por minuto). TALK_PREFER_CODEX_OAUTH=true fuerza la vía suscripción. La key cruda nunca llega al socket: se acuña un client secret efímero server-side.grok: login X Premium/SuperGrok (hermes auth add xai-oauth) sin key; terminal + Discord; 5 voces.gemini: GEMINI_API_KEY (funciona free-tier AI Studio); terminal; sin cancel/truncate cliente → barge-in corta playback localmente; Discord lo rechaza.Publica las 3 vías en el contrato realtime neutro de Hermes core: hermes realtime --list muestra hermes-talk/openai|grok|gemini; registration feature-detected, sin configuración. Las capacidades se declaran, nunca se fingen (tabla capability por proveedor en el README).
El modo nativo usa voces provider-locked. Cascade deja al proveedor realtime como cerebro y envía su TEXTO a TTS streaming de ElevenLabs → habla con cualquier voz de tu cuenta, clon incluido (crearlo antes en VoiceLab y copiar el ID).
TALK_VOICE_MODE=cascade TALK_ELEVENLABS_VOICE_ID=<id> hermes talk
# key: TALK_ELEVENLABS_API_KEY | ELEVENLABS_API_KEY; modelo default eleven_flash_v2_5
Trade: ~0.5s extra en la PRIMERA frase (luego pipelinea bajo playback). Solo OpenAI por ahora (grok/gemini fallan closed). Barge-in aborta el stream TTS igual que nativo. TALK_VOICE_MODE default native = byte-idéntico al comportamiento pre-cascade.
list_agents (descubre qué corre, tagged can steer vs stop only), steer_agent (nota en cola; el paso actual SIEMPRE termina), redirect_agent (aborta el thinking en vuelo y reintenta con tu corrección; host ≥0.20, degrada a steer), stop_work (soportado en todas las vías), check_work.queued → landed → redirected / unconfirmed / missed / superseded. Nunca dice "les llegó" sin artefacto que lo pruebe. Cada nota viaja tokenizada [tk-xxxxxxxx].delegate_task acepta resource_keys (hasta 8 cosas estables que toca: path de repo, target de deploy…) + execution_mode exclusive (default) | parallel_read_only. Dos runs vivos que comparten clave no se solapan salvo que AMBOS sean read-only declarados; TALK_TRUST_DECLARED_READ_ONLY=true lo permite explícitamente. El rechazo se LOCUTA nombrando el run que estorba.$HERMES_HOME/state/talk-runs.jsonl; colgar la llamada NO mata el trabajo, pero un run de sesión anterior se reporta lost, nunca "still running".hermes talk doctor # solo lectura: qué vía ganó, auth, audio — nunca imprime keys
hermes talk check # doctor + un turno live + un run acotado; exit 0 = probado
hermes talk setup # detecta → pregunta solo lo que falta → escribe .env atómico
hermes talk diagnostics --bundle # bundle redactado, owner-only
Python ≥3.11, Hermes host ≥v0.17 (redirect limpio quiere 0.20+). Cero ediciones al core — puro register(ctx).
hermes plugins install TheSmokeDev/hermes-talk --enable
pip install "hermes-talk[audio]" # solo si quieres mic/speaker nativo
hermes talk
pause_voice_input; la pausa SOLO se ofrece donde hay control garantizado (Enter en hermes talk con tty real; en /talk y stdin pipeado NO hay pausa; Discord: /talk pause+/talk resume). Un micro pausado no oye "resume".TALK_DASHBOARD_TOKEN unset = solo loopback; el dashboard accesible desde otra máquina EXIGE token (comparado con hmac.compare_digest). Ver skill webui-csrf-origin si se accede vía túnel.Aprendido del ciclo stars-explorer de David (Ntizar) — batch 2026-09-07. Registry: TheSmokeDev/hermes-talk → category tool.
Restore Hermes from a backup repo or migrate machines.
Usa al analizar ADN crudo: ascendencia, rasgos, sexo.
Usar al operar Mastermind en Windows: repo, ChromaDB, crons, gateway Telegram (colapso por token revocado y su restauración), backups y monitorización.