
Cartesia Sonic-3.6 es la nueva versión del modelo de texto a voz en tiempo real de la compañía. Llega aproximadamente tres meses después de Sonic-3.5 y centra su principal mejora en la naturalidad de la síntesis, con disponibilidad inicial en beta a través de una API alojada.
El modelo ocupa el primer puesto en las dos clasificaciones de voz de Artificial Analysis: alcanza 1.283 puntos Elo en Provider Voice y 1.123 en Controlled Voice. Esta última prueba utiliza las mismas ocho voces de referencia para todos los sistemas, por lo que reduce el peso del catálogo de voces y permite evaluar mejor el motor de síntesis.
Sonic-3.6 está en beta, ofrece un tiempo hasta el primer audio inferior a 90 milisegundos según Cartesia y solo se puede utilizar como servicio alojado: no hay pesos descargables ni versión para autoalojamiento.
Una mejora que también aparece con voces controladas
En la clasificación Controlled Voice, Sonic-3.6 queda por delante de Sonic-3.5 y de ElevenLabs Eleven v3. El resultado es relevante porque la comparación se realiza sobre un conjunto común de voces. Por tanto, el primer puesto apunta a una mejora del motor de generación y no únicamente a una selección más amplia o atractiva de voces disponibles.
Cartesia indica que Sonic-3.6 utiliza modelos de espacio de estados en lugar de arquitecturas basadas en transformers. La empresa presenta esta decisión como parte de su estrategia para equilibrar velocidad y naturalidad. Su cifra de latencia, inferior a 90 milisegundos hasta el primer audio, corresponde a la latencia del modelo y no a un recorrido completo de red desde una aplicación.
Funciones pensadas para agentes de voz
La API incorpora controles orientados a conversaciones generadas a partir de transcripciones. Las etiquetas insertadas en el texto permiten añadir expresiones no verbales como [laughter], mientras que los diccionarios de pronunciación admiten ajustes personalizados e indicaciones mediante IPA.
- Clonación instantánea de voz a partir de unos 10 segundos de audio.
- Parámetros de velocidad, volumen y emoción.
- Lectura nativa de números de pedido, teléfonos y códigos de confirmación.
- Integración con herramientas como el complemento de LiveKit Agents.
Las demostraciones de lanzamiento incluyen inglés con pausas y palabras de relleno, además de cambios entre hindi e inglés. Entre los usos indicados para el modelo están los agentes de atención, las llamadas de cualificación, la sustitución de sistemas IVR, los recordatorios de citas, los simuladores de formación comercial y la localización de audio.
Beta, API alojada y modelo de precios
Sonic-3.6 se ofrece en beta mediante la API de Cartesia. La documentación continúa señalando Sonic-3.5 como versión estable y algunos socios todavía utilizan esa versión. Sonic-3.6 es un modelo comercial cerrado: no dispone de pesos abiertos ni de un repositorio en Hugging Face, así que su uso depende del servicio de Cartesia.
Artificial Analysis normaliza su coste en 49 dólares por cada millón de caracteres, frente a los 100 dólares de ElevenLabs Eleven v3 y los 10 dólares de Speechify Simba 3.2 en las referencias indicadas. Cartesia, sin embargo, comercializa créditos. El plan Scale de 299 dólares mensuales incluye aproximadamente 10.667 minutos de texto a voz y 15 solicitudes simultáneas; los agentes de voz de Line se facturan aparte a 0,06 dólares por minuto.
Qué queda por comprobar
La posición de Sonic-3.6 en Artificial Analysis ofrece una referencia externa para comparar naturalidad, especialmente en el tablero con voces controladas. Aun así, las cifras de latencia publicadas por Cartesia no miden el tiempo total de una aplicación, que también depende de la red, el proveedor de inferencia y la integración utilizada.
Conclusión
Sonic-3.6 combina una mejora medible en las pruebas de voz con funciones prácticas para agentes conversacionales, como la clonación rápida, el control de pronunciación y la lectura de datos alfanuméricos. Su disponibilidad sigue siendo limitada por el estado beta y por el uso exclusivo mediante API alojada, mientras que las pruebas independientes de rendimiento en escenarios reales serán determinantes para valorar su comportamiento fuera de los benchmarks.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.