Empresa de creació de models de text a veu per a agents de veu empresarials. Reprodueix les respiracions, les pauses i el ritme de la parla real, amb control de pronunciació sense necessitat de reentrenar el model.
Rime desenvolupa models de text a veu per a converses empresarials on la precisió i la naturalitat de la veu són determinants. L'empresa va ser fundada el 2022 a San Francisco per lingüistes i enginyers amb experiència en projectes com Amazon Alexa, i construeix els seus sistemes a partir d'un conjunt de dades propi de parla espontània en format full-duplex que inclou interrupcions, respiracions i disfluències vocals, capturats en estudi i en diverses localitzacions dels Estats Units.
La proposta de Rime s'articula en tres eixos. El primer és la naturalitat de la veu: els seus models reprodueixen el to, el ritme i les imperfeccions pròpies de la parla real —respiracions, pauses i èmfasi— perquè les converses no resultin automatitzades. El segon és el control de pronunciació: la plataforma inclou SpeechQA, una eina que detecta paraules amb pronunciació dubtosa abans de la seva publicació i permet corregir-les en minuts, sense necessitat de reentrenar el model. El tercer és el suport multilingüe, amb models que mantenen la naturalitat de la parla en diverses llengües.
Rime ofereix tres models principals. Coda és el model general, orientat a entorns de producció empresarial amb equilibri entre velocitat i naturalitat. Arcana està dissenyat per a aplicacions que requereixen alta expressivitat, amb més de 300 veus i opcions bilingües i multilingües. Mist és un model d'alta velocitat amb una latència inferior a 200 ms al núvol i inferior a 100 ms en instal·lació local, orientat a aplicacions de gran volum.
Els models es poden desplegar al núvol, en un entorn VPC privat o completament a les instal·lacions del client. La plataforma disposa de certificacions HIPAA i SOC 2 Tipus II i opera en sectors com la sanitat, la restauració, les finances i les telecomunicacions.
Rime presenta Coda, un model de text a veu per a agents conversacionals en temps real que reprodueix el ritme, les pauses i l'entonació propis d'una conversa real, dissenyat per a entorns d'alta concurrència.
Aquest lloc web utilitza cookies tècniques, de personalització i anàlisi, pròpies i de tercers, per facilitar la navegació anònima i analitzar estadístiques d’ús del web. Considerem que si continueu navegant, n’accepteu l’ús.