AI / SPEECH

Clonación de Voz y Texto-a-Voz: Guía de Producción 2026

Guía bilingüe enfocada a producción sobre clonación de voz y TTS modernos: ElevenLabs v3, OpenAI gpt-4o-mini-tts y gpt-realtime, Google Gemini TTS, modelos open-source (XTTS-v2, F5-TTS, OpenVoice v2, Sesame CSM, Spark-TTS), proveedores de tiempo real (Cartesia Sonic, PlayHT, Hume EVI 3), self-hosting en RTX 4090/5090, precios y ejemplos de código.

Por Jose Nobile | Actualizado 2026-06-11 | 26 min de lectura

1. Panorama 2026 y Casos de Uso

La clonación de voz y TTS en 2026 se divide en tres niveles: APIs comerciales hiper-realistas (ElevenLabs, OpenAI, Google), motores de tiempo real de baja latencia (Cartesia, PlayHT, Hume) y modelos open-source para auto-hospedar (XTTS-v2, F5-TTS, OpenVoice v2, Sesame CSM, Spark-TTS). Latencia, fidelidad vocal, cobertura de idiomas y licencia te empujan a stacks distintos.

2. ElevenLabs v3 (Voice Design, IVC, Multilingüe)

ElevenLabs v3 (GA desde el 14 de marzo de 2026) es el modelo TTS más expresivo del mercado, con audio tags, más de 70 idiomas, diálogo multi-locutor y clonación instantánea (IVC) a partir de 1 minuto de audio. La clonación profesional (PVC) requiere más de 30 minutos para calidad de estudio. v3 no está pensado para tiempo real -- ElevenLabs recomienda Flash v2.5 (~75ms de latencia) para agentes conversacionales.

3. OpenAI y Google Gemini TTS

OpenAI gpt-4o-mini-tts ofrece instrucciones controlables ("habla como un terapeuta calmado") a $0.60/1M tokens de entrada. gpt-realtime es un modelo unificado voz-a-voz con latencia menor a 300ms. Google Gemini 2.5 Flash/Pro TTS soporta diálogo multi-locutor controlable a bajo costo.

4. Modelos Open-Source

Cinco familias open-source dominan el TTS auto-hospedado en 2026: Coqui XTTS-v2 (clonación multilingüe, licencia CPML), F5-TTS (flow-matching, MIT), OpenVoice v2 (clonación cross-lingüe, MIT), Sesame CSM-1B (conversacional, Apache 2.0) y Spark-TTS (BiCodec, Apache 2.0).

5. Proveedores Tiempo Real

Para agentes de voz e IVR, una latencia inicial menor a 200ms importa más que la fidelidad absoluta. Cartesia Sonic-3.5 alcanza menos de 90ms TTFB en 42 idiomas, PlayHT Play 3.0 mini ~143ms, y Hume EVI 3 agrega prosodia emocional y turnos empáticos sobre un LLM (EVI 1 y EVI 2 se retiraron el 30 de agosto de 2025).

6. Self-Hosting en RTX 4090 / 5090

Una sola RTX 4090 (24 GB) o RTX 5090 (32 GB) maneja cualquier modelo TTS open-source en tiempo real con margen sobrado. La 5090 duplica el ancho de banda de memoria (1.79 TB/s) y agrega soporte FP4, reduciendo la latencia de XTTS-v2 ~35% frente a la 4090.

7. Comparativa de Precios ($/1M caracteres)

Los precios comerciales varían hasta 200x entre proveedores. Abajo el precio de lista de julio 2026 por 1 millón de caracteres para el tier estándar de cada proveedor, normalizado para comparación directa.

8. Ejemplos de Código (SDK ElevenLabs + F5-TTS local)

Dos snippets mínimos pero listos para producción: una llamada streaming TTS con ElevenLabs en Python, y una inferencia local de F5-TTS usando la CLI oficial sobre una RTX 4090.

¿Necesitas ayuda para desplegar un agente de voz, una pipeline de doblaje o un cluster TTS auto-hospedado? Arquitecto sistemas de voz en producción de punta a punta.