| id | pocket-tts |
| name | Pocket-TTS |
| version | 1.0.0 |
| author | Leonardo Balland |
| description | Generate speech from text using Kyutai Pocket TTS - lightweight, CPU-friendly, streaming TTS with voice cloning. English only. ~6x real-time on M4 MacBook Air. |
| categories | ["text-to-speech","documentation"] |
| tags | ["kyutai","text-to-speech","tts","cpu","streaming","voice-cloning"] |
| homepage | https://kyutai.org/blog/2026-01-13-pocket-tts |
| repository | https://github.com/kyutai-labs/pocket-tts |
| documentation | https://github.com/kyutai-labs/pocket-tts/tree/main/docs |
Pocket TTS
Lightweight CPU-friendly text-to-speech with voice cloning. No GPU required.
When to Use
- Generating speech from text on CPU without GPU
- Voice cloning from audio samples
- Streaming audio generation (low latency)
- Local TTS without API dependencies
- Real-time speech synthesis (~6x faster than real-time)
Key Features
- 100M parameters - Small, efficient model
- CPU-optimized - No GPU needed, uses only 2 cores
- ~6x real-time - Fast generation on modern CPUs
- ~200ms latency - To first audio chunk (streaming)
- Voice cloning - From 3-10s audio samples
- 24kHz mono WAV - High-quality output
- English only - More languages planned
Installation
pip install pocket-tts
uv add pocket-tts
CLI Commands
Generate Speech
pocket-tts generate --text "Hello world"
pocket-tts generate --voice ./my_voice.wav
pocket-tts generate --voice "hf://kyutai/tts-voices/alba-mackenna/casual.wav"
pocket-tts generate --voice ./voice.safetensors
pocket-tts generate --temperature 0.7 --lsd-decode-steps 3
See docs/generate.md for full CLI reference.
Start Web Server
pocket-tts serve
pocket-tts serve --host localhost --port 8080
See docs/serve.md for server options.
Export Voice Embeddings
Convert audio files to .safetensors for faster loading:
pocket-tts export-voice voice.mp3 voice.safetensors
pocket-tts export-voice voices/ embeddings/ --truncate