Microsoft amplía su familia de modelos de inteligencia artificial con siete nuevos desarrollos internos que cubren generación de imágenes, transcripción, voz, razonamiento y código.
Microsoft ha presentado en el Microsoft Build 2026 siete modelos de IA desarrollados íntegramente por su equipo MAI, sin reutilizar modelos de terceros ni recurrir a técnicas de destilación. La familia abarca cinco categorías distintas —imagen, transcripción, voz, razonamiento y código— y está diseñada para integrarse en los productos Microsoft existentes, así como para estar disponible para desarrolladores externos a través de plataformas como OpenRouter, Fireworks y Baseten.
El modelo de razonamiento MAI-Thinking-1 es el referente del grupo. Se trata de un modelo de tamaño mediano —35.000 millones de parámetros activos— con una ventana de contexto de 256.000 tokens que, según evaluaciones internas con evaluadores humanos independientes, resulta preferido frente a Claude Sonnet 4.6 en comparaciones ciegas. En el índice SWE-Bench Pro, que mide la capacidad para resolver tareas reales de ingeniería de software, obtiene un 52,8%, situándose en el mismo nivel que Claude Opus 4.6. En el test de razonamiento matemático AIME 2025 alcanza el 97%.
En el área de generación y edición de imágenes, MAI-Image-2.5 ocupa la segunda posición del clasificador Arena de edición de imágenes con una puntuación de 1.403. El modelo incluye una variante Flash pensada para producción a gran escala con menor coste computacional. Está ya disponible en PowerPoint y se está desplegando en OneDrive.
MAI-Transcribe-1.5 es el modelo de transcripción de voz a texto de la familia. Según las pruebas con la referencia pública FLEURS, supera a los modelos equivalentes de OpenAI y Google en precisión media sobre 43 idiomas, a la vez que opera hasta cinco veces más rápido que los competidores medidos por el índice de velocidad de Artificial Analysis. Se integra en Copilot, Teams, GitHub y Dynamics 365.
MAI-Voice-2 cubre la síntesis de voz en 15 idiomas con capacidad para adaptarse al timbre de una voz a partir de una muestra breve. Incluye protecciones técnicas contra la clonación no autorizada y marcas de agua en el audio generado. Una variante Flash, anunciada para próximas semanas, reducirá la latencia para aplicaciones de tiempo real.
Para el ámbito del desarrollo de software, MAI-Code-1-Flash es un modelo especializado en programación con 5.000 millones de parámetros activos que obtiene un 51% en SWE-Bench Pro. Con un coste inferior al de Claude Haiku 4.5, está integrado como uno de los modelos por defecto en VS Code y en GitHub Copilot.
Junto al lanzamiento de modelos, Microsoft anuncia una colaboración con Mayo Clinic para desarrollar conjuntamente un modelo de IA especializado en el ámbito clínico. El modelo se entrenará con datos clínicos desidentificados de Mayo Clinic y se desplegará primero en su sistema hospitalario antes de ponerse a disposición de otras organizaciones a través de Microsoft Foundry. Mayo Clinic mantendrá la titularidad del modelo resultante.
Junto a los modelos, Microsoft presenta Microsoft Frontier Tuning, un servicio de personalización basado en aprendizaje por refuerzo que permite a las organizaciones ajustar los modelos MAI a sus propios flujos de trabajo. El aprendizaje obtenido queda en manos exclusivas de cada cliente y no se comparte con otros usuarios. Según la compañía, un modelo ajustado internamente para tareas de Excel rinde de forma comparable a GPT-5.4 con hasta diez veces menos coste por token generado. McKinsey figura entre los primeros clientes del servicio, con resultados similares de eficiencia frente a GPT-5.5.
Microsoft AI desarrolla modelos y productos de inteligencia artificial con enfoque en responsabilidad, accesibilidad y utilidad práctica. Su trabajo abarca modelos fundacionales, generación de voz, ...
12/06/2026
El gobierno de Estados Unidos ha ordenado a Anthropic bloquear el acceso a Claude Fable 5 y Mythos 5 a ciudadanos extranjeros, lo que ha obligado a ...
09/06/2026
Anthropic presenta Claude Fable 5 y Claude Mythos 5, dos versiones de su modelo de mayor capacidad hasta la fecha. Comparten la misma base, pero uno ...
25/05/2026
El papa León XIV publica la primera encíclica dedicada a la inteligencia artificial, en la que fija la dignidad humana como criterio para todo ...
19/05/2026
Rime presenta Coda, un modelo de texto a voz para agentes conversacionales en tiempo real que reproduce el ritmo, las pausas y la entonación propios ...