ElevenLabs presenta Scribe v2, un model de transcripció que millora la precisió en àudio extens i ofereix detecció automàtica d'entitats, suport multilingüe i funcions dissenyades per a fluxos de treball empresarials.
ElevenLabs ha anunciat el llançament de Scribe v2, el seu nou model de transcripció dissenyat per processar àudio per lots, generar subtítols i crear transcripcions a escala. El model incorpora millores en l'estabilitat i la precisió respecte a la versió anterior, amb una millor gestió d'àudios extensos, pauses, canvis de to i silencis prolongats.
Scribe v2 està optimitzat per a gravacions llargues i complexes, mantenint la precisió en diferents locutors, accents i estils de presentació. Segons dades de la companyia, el model assoleix la taxa d'error de paraules més baixa registrada en els estàndards d'avaluació del sector.
Entre les funcionalitats destacades es troba el keyterm prompting, un sistema que permet seleccionar fins a 100 paraules o frases específiques. El model utilitza el context per decidir quan transcriure aquests termes, cosa que resulta útil en dominis tècnics, noms de marca i llenguatge especialitzat.
El model incorpora detecció nativa d'entitats per a l'anàlisi estructurat d'àudio. Els usuaris poden seleccionar fins a 56 categories que inclouen informació personal identificable, dades de salut o informació de pagaments. Scribe v2 detecta automàticament aquestes instàncies i registra les seves marques de temps exactes.
El sistema suporta fluxos de treball multilingües de forma automàtica, processant fitxers que contenen múltiples idiomes i detectant cadascun sense necessitat de segmentació manual. El model ofereix suport per a més de 90 idiomes.
La versió inclou característiques addicionals orientades a casos empresarials: identificació intel·ligent de parlants, marques de temps a nivell de paraula, etiquetatge dinàmic d'àudio que detecta esdeveniments no verbals, i compliment amb estàndards SOC 2, ISO 27001, PCI DSS L1, HIPAA i RGPD. També ofereix residència de dades a la Unió Europea i l'Índia.
Scribe v2 està disponible a ElevenLabs Studio i a través de l'API de la plataforma, permetent a desenvolupadors i empreses automatitzar processos d'àudio complexos.
Explora el servei de clonació de veu i conversió de text a veu més avançat de la història. Crea locucions realistes per als teus continguts o utilitza el nostre generador de veu AI com un lector ...
24/07/2026
Anthropic presenta el seu nou model Opus, que s'acosta a la intel·ligència de Fable 5 en programació i treball de coneixement a meitat de cost, ...
21/07/2026
Hugging Face va detectar una intrusió atribuïda a un agent autònom d'IA. Dies després, OpenAI va confirmar que van ser els seus propis models, en ...
16/07/2026
SpaceXAI ha presentat Grok 4.5, el seu model més avançat fins ara, entrenat juntament amb Cursor i pensat per a programació, tasques d'agents i ...
16/07/2026
Moonshot AI ha presentat Kimi K3, un model de codi obert de 2,8 bilions de paràmetres que, segons les seves pròpies dades, supera diversos models ...