Coda, el nou model de síntesi de veu de Rime per a converses empresarials a escala

19/05/2026

Rime presenta Coda, un model de text a veu per a agents conversacionals en temps real que reprodueix el ritme, les pauses i l'entonació propis d'una conversa real, dissenyat per a entorns d'alta concurrència.

Coda, el nou model de síntesi de veu de Rime per a converses empresarials a escala

Coda és el nou model de síntesi de veu de Rime, disponible en beta pública des del 19 de maig de 2026. La companyia l'ha desenvolupat per cobrir les necessitats d'empreses que gestionen grans volums d'interaccions telefòniques amb clients, un segment en què Rime ja opera amb diversos negocis a escala.

A diferència del seu model anterior, Arcana v3, Coda utilitza una arquitectura de doble descodificador entrenat de forma conjunta: un orientat a la comprensió semàntica del text i un altre a la reconstrucció acústica. Aquest disseny permet capturar elements propis de la conversa real — com el ritme, les pauses o el contorn d'entonació — que solen perdre's en models dissenyats per generar monòlegs o contingut d'àudio pregravat. El sistema processa l'àudio en fragments de 80 mil·lisegons, cadascun codificat en 15 codis acústics, i lliura el senyal en streaming.

Rime ha desenvolupat també la seva pròpia infraestructura d'inferència, anomenada TIGERSTRIPE, que executa el model tant al núvol com en instal·lacions locals. L'empresa afirma que aquesta implementació pròpia supera en rendiment les solucions estàndard del sector. Els avenços més grans respecte a Arcana es registren en contextos multilingües.

En avaluacions comparatives de qualitat de veu davant ElevenLabs — tant el seu model Flash com v3 —, Coda obté millors puntuacions en tots els idiomes provats, amb la major diferència en espanyol. Respecte a Arcana, els avenços més destacats es registren en alemany, espanyol i francès.

El model està disponible a través del tauler de control i l'API de Rime.

Punts clau

  • Coda és el nou model de síntesi de veu de Rime per a agents conversacionals empresarials en temps real
  • Reprodueix ritme, pauses i entonació naturals mitjançant un doble descodificador semàntic i acústic
  • Supera els models orientats a monòlegs o àudio pregravat
  • Inclou infraestructura d'inferència pròpia, disponible al núvol i en instal·lació local
  • En comparatives davant ElevenLabs, obté millors puntuacions en tots els idiomes, amb més diferència en espanyol
  • Respecte a Arcana, el seu model anterior, els avenços més grans es donen en alemany, espanyol i francès

IA relacionada

Rime

Models de síntesi de ve

Empresa de creació de models de text a veu per a agents de veu empresarials. Reprodueix les respiracions, les pauses i el ritme de la parla real, amb control de pronunciació sense necessitat de ...

Últimes noticies

★★★★★
Valora'ns a Google
Aquest lloc web utilitza cookies tècniques, de personalització i anàlisi, pròpies i de tercers, per facilitar la navegació anònima i analitzar estadístiques d’ús del web. Considerem que si continueu navegant, n’accepteu l’ús.