IA

Un team di 10 persone in Microsoft ha costruito un modello vocale più veloce e conveniente di OpenAI e Google

Adrian Kessler

Il modello si chiama MAI-Transcribe-2. Microsoft AI, la divisione guidata da Mustafa Suleyman, lo ha pubblicato il 3 settembre a 0,10 $ per ora audio — prezzo limitato fino alla fine del 2026. La versione precedente, MAI-Transcribe-1.5, costava 0,36 $ l’ora. Quel taglio del 72% non è un arrotondamento di marketing. Un contact center che elabora 100.000 ore di audio all’anno pagava 36.000 $ per il modello precedente; lo stesso carico di lavoro ora costa 10.000 $.

La performance nei benchmark è ciò che rende insolito il prezzo. Nella valutazione multilingue FLEURS, MAI-Transcribe-2 si classifica primo in 60 lingue con un tasso medio di errore sulle parole del 5,2% — meglio di GPT-Transcribe di OpenAI, Gemini 3.5 Transcribe di Google, ElevenLabs Scribe v2 e Whisper V3-Large di Meta. Nella classifica Artificial Analysis, che tiene traccia congiuntamente di accuratezza e latenza, si colloca al secondo posto assoluto e definisce quella che i ricercatori chiamano la frontiera di Pareto — il confine oltre il quale non si può migliorare una metrica senza degradare l’altra. Il modello è stato addestrato per posizionarsi sul bordo efficiente di quella frontiera, non per inseguire la vetta di una singola tabella di metriche.

La velocità è la seconda affermazione che merita attenzione. Microsoft sostiene che MAI-Transcribe-2 elabora l’audio 10 volte più velocemente di GPT-Transcribe, 7 volte più velocemente di ElevenLabs Scribe v2 e 5 volte più velocemente di Gemini 3.5 Transcribe. Per audio di lunga durata — trascrizione di podcast, deposizioni legali, note cliniche — quella differenza determina se un flusso di lavoro gira in secondi o in minuti. Il modello supporta anche la diarizzazione dei parlanti (identificare chi ha parlato quando), timestamp a livello di parola, biasing per parole chiave relative alla terminologia di dominio e commutazione di codice per lingue che si mescolano a metà frase, citando in particolare Hinglish e Spanglish come esempi testati.

Il team che lo ha costruito è notevole in proporzione a ciò che ha costruito. Microsoft descrive il gruppo centrale come composto da 10 persone, che operano con una burocrazia interna minima e supportate da team più ampi che gestiscono l’acquisizione dei dati e la gestione dei fornitori. La conseguente affermazione sull’efficienza della GPU è specifica: MAI-Transcribe-2 gira a metà del costo GPU dei modelli concorrenti allo stato dell’arte. Se ciò regga sotto carico aziendale su larga scala non è verificabile dall’annuncio, ma l’affermazione sull’architettura è abbastanza precisa da essere testata.

Il modello è disponibile ora su Microsoft Foundry, MAI Playground e Open Router — il che significa che l’accesso non richiede un contratto Azure né una relazione aziendale con Microsoft. Quell’ampiezza distributiva è intenzionale. La spinta di Microsoft AI verso API dirette agli sviluppatori fa parte di un più ampio riposizionamento seguito alla ristrutturazione della partnership con OpenAI. Gli emendamenti dell’ottobre 2025 e dell’aprile 2026 hanno eliminato gli accordi di esclusività e condivisione dei ricavi che avevano definito la relazione dal 2019. Microsoft ora ha un incentivo diretto a competere a livello di modello piuttosto che limitarsi a distribuire l’output di OpenAI.

Il prezzo di 0,10 $ è indicato come limitato fino alla fine del 2026. Il prezzo standard dopo tale data non è stato comunicato. Gli acquirenti che valutano MAI-Transcribe-2 per carichi di lavoro in produzione stanno prezzando un prodotto di cui non conoscono il costo per l’anno solare 2027. È un rischio che vale la pena nominare chiaramente, anche se la tariffa corrente rende il modello interessante rispetto a ogni alternativa visibile.

Tag: , , , , ,

Discussione

Ci sono 0 commenti.