Microsoft avanza en ia con modelos de voz y transcripción propios
La gigante tecnológica Microsoft ha presentado sus primeros modelos de inteligencia artificial dedicados a la transcripción y generación de voz, que ya están en funcionamiento en servicios propios como Copilot y Azure Speech.

Una estrategia para llegar a la vanguardia en 2027
Estos modelos forman parte de una estrategia de desarrollo propio de Microsoft, con el objetivo de lanzar en 2027 los modelos de frontera más avanzados del sector, para competir con empresas como OpenAI y Anthropic.
Entre los modelos recién lanzados se encuentran el generador de imágenes MAI-Image-2, el generador de voz MAI-Voice-1 y el nuevo generador de transcripciones MAI-Transcribe-1.
El modelo de transcripción MAI-Transcribe-1 es de reconocimiento de voz de gran precisión que soporta 25 idiomas, y se destaca por su eficiencia, con un coste de GPU aproximadamente un 50% inferior al de las principales alternativas del mercado.
Mientras que MAI-Voice-1 es capaz de generar 60 segundos de audio en menos de un segundo haciendo uso de una sola GPU, lo que lo convierte en ultrarrápido.
Estos modelos ya se encuentran integrados en servicios de Microsoft como Copilot, Bing, PowerPoint y Azure Speech, y se pueden probar en Playground y Foundry para su uso por parte de los desarrolladores.
