Durante los últimos dieciocho meses, el texto a voz cruzó una línea que nadie certificó: las mejores voces sintéticas ya no suenan sintéticas. Los viejos indicios —la cadencia uniforme, la falta de respiraciones, los énfasis erróneos— han desaparecido en su mayoría en 2026. Los mejores modelos dudan, se ríen y corrigen a mitad de frase un nombre mal pronunciado; los modelos de diálogo intercambian réplicas en dos voces sin costuras. La forma fiable de distinguir un clip sintético de una grabación humana ya no es el oído, sino la procedencia: de dónde salió el audio, si la voz estaba licenciada y quién responde por ella.

Ese giro —de lo robótico pero práctico a lo indistinguible pero jurídicamente complicado— es la verdadera historia de la voz con IA en 2026. A continuación: los cambios del último año, qué puede hacer hoy el TTS (por tarea, no por proveedor), las direcciones que merece la pena vigilar y quién debería pagar. Los precios se contrastaron con las páginas oficiales a principios de septiembre de 2026. Para comparaciones herramienta por herramienta, consulta nuestra guía de alternativas a ElevenLabs.

El último año en siete movimientos

El cambio estructural de fondo: la voz dejó de ser un formato de salida y se convirtió en una interfaz. ElevenLabs superó los $330 million de ingresos anuales en enero de 2026 (TechCrunch); Google convirtió Gemini Live en el asistente predeterminado de Samsung (Wikipedia). El TTS ya no es una API de nicho para narrar vídeos: es la forma en que el software te contesta.

Qué puede hacer hoy el texto a voz

Cuatro tareas definen la categoría en 2026. Si la tuya es una de ellas, el TTS está listo para producción; si no, ningún modelo de voz la salvará.

Locuciones: lo bastante buenas como para cobrarlas

Este año, la voz sintética cruzó el umbral profesional de la narración —YouTube, anuncios, e-learning—. ElevenLabs sigue marcando el listón de la expresividad, pero la cuestión práctica se ha desplazado hacia el precio y las licencias. Los planes gratuitos sirven para probar; un narrador diario acaba en un plan intermedio de unos $22 al mes (el primer mes, unos $11 — consulta los precios oficiales). Dentro de ChatGPT, las voces integradas cuestan menos y satisfacen la mayor parte del contenido. El nivel mínimo no deja de subir: la API gratuita de Fish Audio y Kokoro hacen que una voz decente sea realista incluso con presupuesto cero. Lee la licencia comercial antes de monetizar: las cuestiones de datos de entrenamiento y de semejanza son ahora un problema de primera magnitud.

Audiolibros: un canal editorial, no un atajo

El cambio revelador en la narración de formato largo es la distribución. La herramienta de audiolibros de Spotify impulsada por ElevenLabs (TechCrunch, mayo de 2026) y los acuerdos de licencia de ElevenLabs con famosos y actores de voz (TechCrunch, noviembre de 2025) cambiaron la finalidad de la narración sintética: no esquivar el pago a las personas, sino publicar más libros. Los títulos regionales, los catálogos de fondo y los autores independientes tienen ahora un canal a un precio que la narración de estudio nunca alcanzó — y el modelo de consentimiento ha madurado: las editoriales licencian una voz a su propietario en lugar de clonarla, el patrón que seguirán los demás casos de uso.

Voz en tiempo real: la guerra de la latencia

La voz conversacional —sistemas telefónicos, juegos, agentes de IA parlantes— es donde el TTS se juzga en milisegundos. El Voxtral abierto de Mistral presume de unos 90 ms hasta el primer audio (TechCrunch); la clasificación de Artificial Analysis (consultada el 3 de septiembre de 2026) sitúa a los modelos de baja latencia, como Sonic de Cartesia, en lo más alto en calidad. El ángulo del hardware lo hace concreto: la «traducción» de los auriculares de traducción es habla sintetizada que debe seguir siendo inteligible a mitad de conversación en una sala ruidosa. En nuestra prueba práctica del Monoise P-G2 (4.2/5), la respuesta sintetizada que llegaba a mitad de llamada decidía el éxito o el fracaso de conversaciones reales de comercio exterior; en nuestro análisis de 25 opiniones de clientes de los auriculares UYUXIO (4.1/5), las quejas se centraban en la suscripción y el requisito de red del servicio de traducción, no en la calidad de la voz. La voz es la parte fácil; el modelo de negocio, la difícil. (Análisis del Monoise P-G2, análisis de los auriculares UYUXIO.)

Accesibilidad: el uso menos ambiguo

Es el trabajo más valioso y menos polémico del TTS. El banco de voz —grabar tu voz para que una versión sintetizada sobreviva a una enfermedad degenerativa— se convirtió en una categoría destacada cuando ElevenLabs se comprometió a aportar $1 billion en tecnología gratuita de restauración de voz (Wikipedia, marzo de 2026). Los lectores de pantalla, los dispositivos de CAA y las aplicaciones de lectura se están reconstruyendo sobre los nuevos modelos — y aquí, «indistinguible de la voz humana» es una ventaja, no un riesgo.

Tres direcciones que merece la pena vigilar

Dos se apoyan en productos ya lanzados; la tercera es en parte lectura nuestra.

1. La voz se convierte en la interfaz predeterminada de los agentes. ChatGPT Voice, Gemini Live, Expressive Mode de ElevenLabs: todos los fabricantes de asistentes tratan la conversación hablada como una superficie central. Espera que las guerras de los agentes se libren en la calidad de voz y la latencia, que son las partes que los usuarios notan.

2. La economía del consentimiento se endurece. Entre la ley federal estadounidense sobre deepfakes de mayo de 2025, la ampliación de la detección de semejanza de YouTube (TechCrunch) y los acuerdos de licencia con actores, la clonación sin licencia se está volviendo legalmente radioactiva; su aplicación efectiva sigue siendo una incógnita.

3. Los pesos abiertos comprimen el precio mínimo. Voxtral y CSM-1B demostraron que los modelos abiertos pueden producir habla emocional y de baja latencia; Kokoro se sitúa en el extremo barato de esa misma clasificación, a menos de un céntimo por cada mil caracteres. El propio CEO de ElevenLabs predijo la mercantilización en octubre de 2025 (TechCrunch). Nuestra lectura: la diferenciación se desplaza hacia las bibliotecas de voces, las licencias, la latencia y la fiabilidad — una buena noticia para los compradores, una advertencia para quien venda solo calidad bruta.

Quién debería pagar por qué

Preguntas frecuentes, respuestas directas

¿Siguen distinguiendo los oyentes la voz sintética de la humana? En clips cortos de los mejores modelos, a menudo no — y la distancia se reduce cada trimestre. La narración de formato largo y el registro emocional todavía fallan, y la cobertura de idiomas varía, así que prueba en tu propio idioma. La salvaguarda práctica es la procedencia: guarda constancia de qué se generó, con qué voz y bajo qué licencia.

¿Es legal clonar una voz o monetizar la narración con IA? Depende del consentimiento y de la jurisdicción — esto no es asesoramiento legal. Clonar sin permiso es cada vez más arriesgado: la ley federal estadounidense sobre deepfakes de mayo de 2025, la detección de semejanza de las plataformas y las reclamaciones por el derecho a la propia imagen apuntan todas en la misma dirección. La vía segura es licenciar una voz a su propietario.

¿Con qué herramienta de texto a voz debería empezar? Si buscas el referente en expresividad y el doblaje, empieza por ElevenLabs. Si te importan más el precio o la apertura, recorre nuestra guía de alternativas a ElevenLabs y prueba los planes gratuitos — las diferencias solo aparecen con tu propio guion y en tu propio idioma.

Fuentes

Recopilada a principios de septiembre de 2026 a partir de fuentes públicas y verificables: Wikipedia (ElevenLabs; GPT-5; historial del chatbot Gemini); TechCrunch (cobertura de ElevenLabs; Sesame CSM-1B, marzo de 2025; Mistral Voxtral TTS, marzo de 2026; cobertura de la detección de semejanza); la página de precios oficial de ElevenLabs; la clasificación de texto a voz de Artificial Analysis — todo consultado el 3 de septiembre de 2026. Las puntuaciones de hardware proceden de nuestra prueba práctica publicada del Monoise P-G2 y de nuestro análisis de opiniones de clientes de los auriculares UYUXIO.

A fecha de septiembre de 2026. Precios aproximados: verifícalos en los sitios oficiales.