Coda, el nuevo modelo de síntesis de voz de Rime para conversaciones empresariales a escala

19/05/2026

Rime presenta Coda, un modelo de texto a voz para agentes conversacionales en tiempo real que reproduce el ritmo, las pausas y la entonación propios de una conversación real, diseñado para entornos de alta concurrencia.

Coda, el nuevo modelo de síntesis de voz de Rime para conversaciones empresariales a escala

Coda es el nuevo modelo de síntesis de voz de Rime, disponible desde el 19 de mayo de 2026 en beta pública. La compañía lo ha desarrollado para cubrir las necesidades de empresas que gestionan grandes volúmenes de interacciones telefónicas con clientes, un segmento en el que Rime ya opera con varios negocios a escala.

A diferencia de su modelo anterior, Arcana v3, Coda utiliza una arquitectura de doble decodificador entrenado de forma conjunta: uno orientado a la comprensión semántica del texto y otro a la reconstrucción acústica. Este diseño permite capturar elementos propios de la conversación real, como el ritmo, las pausas o el contorno de entonación, que suelen perderse en modelos diseñados para generar monólogos o contenido de audio pregrabado. El sistema procesa el audio en fragmentos de 80 milisegundos, cada uno codificado en 15 códigos acústicos, y entrega la señal en streaming.

Rime ha desarrollado también su propia infraestructura de inferencia, llamada TIGERSTRIPE, que ejecuta el modelo tanto en la nube como en instalaciones locales. La empresa afirma que esta implementación propia supera en rendimiento a las soluciones estándar del sector. Los mayores avances respecto a Arcana se registran en contextos multilingües.

En evaluaciones comparativas de calidad de voz frente a ElevenLabs —tanto su modelo Flash como v3—, Coda obtiene mejores puntuaciones en todos los idiomas probados, con la mayor diferencia en español. Respecto a Arcana, su modelo anterior, los avances más destacados se registran en alemán, español y francés.

El modelo está disponible a través del panel de control y la API de Rime.

Puntos clave

  • Coda es el nuevo modelo de síntesis de voz de Rime para agentes conversacionales empresariales en tiempo real
  • Reproduce ritmo, pausas y entonación naturales mediante un doble decodificador semántico y acústico
  • Supera a modelos orientados a monólogos o audio pregrabado
  • Incluye infraestructura de inferencia propia, disponible en nube e instalación local
  • En comparativas frente a ElevenLabs, obtiene mejores puntuaciones en todos los idiomas, con mayor diferencia en español
  • Respecto a Arcana, su modelo anterior, los mayores avances se dan en alemán, español y francés

IA relacionada

Rime

Modelos de síntesis de voz

Empresa de creación de modelos de texto a voz para agentes de voz empresariales. Reproduce respiraciones, pausas y ritmo del habla real, con control de pronunciación sin necesidad de reentrenar el ...

Últimas noticias

★★★★★
Valóranos en Google
Esta web utiliza cookies técnicas, de personalización y análisis, propias y de terceros, para facilitarle la navegación de forma anónima y analizar estadísticas del uso de la web. Consideramos que si continúa navegando, acepta su uso.