Microsoft amplia la seva família de models d'intel·ligència artificial amb set desenvolupaments interns que cobreixen generació d'imatges, transcripció, veu, raonament i codi.
Microsoft ha presentat al Microsoft Build 2026 set nous models d'IA desenvolupats íntegrament pel seu equip MAI, sense destil·lació a partir de models de tercers ni recurs a dades opaques. La família abasta cinc categories — imatge, transcripció, veu, raonament i codi — i està dissenyada per integrar-se als productes Microsoft existents, alhora que és accessible per a desenvolupadors externs a través de plataformes com OpenRouter, Fireworks i Baseten.
El model de raonament MAI-Thinking-1 és el referent del grup. Es tracta d'un model de mida mitjana — 35.000 milions de paràmetres actius — amb una finestra de context de 256.000 tokens que, segons avaluacions internes amb avaluadors humans independents, és preferit a Claude Sonnet 4.6 en comparacions cegues. A l'índex SWE-Bench Pro, que mesura el rendiment en tasques reals d'enginyeria de programari, obté un 52,8%, situant-se al mateix nivell que Claude Opus 4.6. A la prova de raonament matemàtic AIME 2025 assoleix el 97%.
En generació i edició d'imatges, MAI-Image-2.5 ocupa la segona posició del classificador Arena d'edició d'imatges amb una puntuació d'1.403. El model inclou una variant Flash pensada per a la producció a gran escala amb menor cost computacional. Ja està disponible a PowerPoint i s'està desplegant a OneDrive.
MAI-Transcribe-1.5 és el model de transcripció de veu a text de la família. Segons les proves amb la referència pública FLEURS, supera els models equivalents d'OpenAI i Google en precisió mitjana sobre 43 idiomes, alhora que opera fins a cinc vegades més ràpid que els competidors mesurats per l'índex de velocitat d'Artificial Analysis. S'integra a Copilot, Teams, GitHub i Dynamics 365.
MAI-Voice-2 cobreix la síntesi de veu en 15 idiomes amb capacitat per adaptar-se a la veu d'un locutor a partir d'una mostra breu. Inclou proteccions tècniques contra la clonació no autoritzada i marques d'aigua integrades a l'àudio generat. Una variant Flash, anunciada per a les properes setmanes, reduirà la latència per a aplicacions en temps real.
Per al desenvolupament de programari, MAI-Code-1-Flash és un model especialitzat en programació amb 5.000 milions de paràmetres actius que obté un 51% a SWE-Bench Pro. Amb un cost inferior al de Claude Haiku 4.5, està integrat com un dels models per defecte a VS Code i GitHub Copilot.
Paral·lelament als llançaments de models, Microsoft anuncia una col·laboració amb Mayo Clinic per desenvolupar conjuntament un model d'IA clínica. S'entrenarà amb dades desidentificades de Mayo Clinic i es desplegarà primer dins del seu sistema hospitalari abans de posar-se a disposició d'altres organitzacions a través de Microsoft Foundry. Mayo Clinic mantindrà la titularitat del model resultant.
Tots els models s'acompanyen de Microsoft Frontier Tuning, un servei que permet a les organitzacions ajustar els models MAI als seus propis fluxos de treball mitjançant aprenentatge per reforç. El coneixement generat resta en mans exclusives de cada client. Segons la companyia, un model ajustat per a tasques d'Excel rendeix de manera comparable a GPT-5.4 amb fins a deu vegades menys cost per token generat. McKinsey figura entre els primers clients del servei, amb guanys d'eficiència similars enfront de GPT-5.5.
Microsoft AI desenvolupa models i productes d'intel·ligència artificial amb èmfasi en responsabilitat, accessibilitat i utilitat pràctica. El seu treball abasta models fundacionals, generació de ...
12/06/2026
El govern dels Estats Units ha ordenat a Anthropic bloquejar l'accés a Claude Fable 5 i Mythos 5 a ciutadans estrangers, la qual cosa ha obligat la ...
09/06/2026
Anthropic presenta Claude Fable 5 i Claude Mythos 5, dues versions del seu model de major capacitat fins ara. Comparteixen la mateixa base, però un ...
25/05/2026
El papa Lleó XIV publica la primera encíclica dedicada a la intel·ligència artificial, en la qual fixa la dignitat humana com a criteri per a tot ...
19/05/2026
Rime presenta Coda, un model de text a veu per a agents conversacionals en temps real que reprodueix el ritme, les pauses i l'entonació propis d'una ...