Microsoft élargit sa famille de modèles d'intelligence artificielle avec sept développements internes couvrant la génération d'images, la transcription, la voix, le raisonnement et le code.
Microsoft a présenté au Microsoft Build 2026 sept nouveaux modèles d'IA développés entièrement par son équipe MAI, sans distillation à partir de modèles tiers ni recours à des données opaques. La famille couvre cinq catégories — image, transcription, voix, raisonnement et code — et est conçue pour s'intégrer aux produits Microsoft existants, tout en étant disponible pour les développeurs externes via des plateformes comme OpenRouter, Fireworks et Baseten.
Le modèle de raisonnement MAI-Thinking-1 est la référence du groupe. Il s'agit d'un modèle de taille moyenne — 35 milliards de paramètres actifs — avec une fenêtre de contexte de 256 000 tokens qui, selon des évaluations internes menées par des évaluateurs humains indépendants, est préféré à Claude Sonnet 4.6 lors de comparaisons en aveugle. Sur l'indice SWE-Bench Pro, qui mesure les performances sur des tâches réelles de génie logiciel, il obtient 52,8 %, se plaçant au même niveau que Claude Opus 4.6. Sur le test de raisonnement mathématique AIME 2025, il atteint 97 %.
En génération et édition d'images, MAI-Image-2.5 occupe la deuxième place du classement Arena d'édition d'images avec un score de 1 403. Le modèle comprend une variante Flash destinée à la production à grande échelle à moindre coût computationnel. Il est déjà disponible dans PowerPoint et est en cours de déploiement sur OneDrive.
MAI-Transcribe-1.5 est le modèle de transcription parole-texte de la famille. Selon les tests utilisant le benchmark public FLEURS, il surpasse les modèles équivalents d'OpenAI et Google en précision moyenne sur 43 langues, tout en fonctionnant jusqu'à cinq fois plus vite que les concurrents selon l'indice de vitesse d'Artificial Analysis. Il s'intègre à Copilot, Teams, GitHub et Dynamics 365.
MAI-Voice-2 couvre la synthèse vocale en 15 langues avec la capacité de s'adapter à la voix d'un locuteur à partir d'un court échantillon. Il inclut des protections techniques contre le clonage non autorisé et des filigranes intégrés dans l'audio généré. Une variante Flash, annoncée pour les prochaines semaines, réduira la latence pour les applications en temps réel.
Pour le développement logiciel, MAI-Code-1-Flash est un modèle spécialisé dans la programmation avec 5 milliards de paramètres actifs qui obtient 51 % sur SWE-Bench Pro. Moins cher que Claude Haiku 4.5, il est intégré comme l'un des modèles par défaut dans VS Code et GitHub Copilot.
En parallèle des lancements de modèles, Microsoft annonce une collaboration avec Mayo Clinic pour développer conjointement un modèle d'IA clinique. Il sera entraîné sur des données désidentifiées de Mayo Clinic et déployé d'abord au sein de son système hospitalier avant d'être mis à disposition d'autres organisations via Microsoft Foundry. Mayo Clinic conservera la propriété du modèle résultant.
Tous les modèles s'accompagnent de Microsoft Frontier Tuning, un service permettant aux organisations d'affiner les modèles MAI sur leurs propres flux de travail via l'apprentissage par renforcement. Les connaissances générées restent exclusivement entre les mains de chaque client. Selon la société, un modèle affiné pour des tâches Excel se comporte de manière comparable à GPT-5.4 avec jusqu'à dix fois moins de coût par token généré. McKinsey figure parmi les premiers clients du service, avec des gains d'efficacité similaires rapportés face à GPT-5.5.
Microsoft AI développe des modèles et produits d'intelligence artificielle axés sur la responsabilité, l'accessibilité et l'utilité pratique. Son travail englobe les modèles fondationnels, la ...
12/06/2026
Le gouvernement des États-Unis a ordonné à Anthropic de bloquer l'accès à Claude Fable 5 et Mythos 5 aux ressortissants étrangers, ce qui a ...
09/06/2026
...
25/05/2026
Le pape Léon XIV publie la première encyclique consacrée à l'intelligence artificielle, fixant la dignité humaine comme critère de tout ...
19/05/2026
Rime présente Coda, un modèle de synthèse vocale pour agents conversationnels en temps réel qui reproduit le rythme, les pauses et l'intonation ...