Aggiungi TradingCenter.it alle fonti preferite su Google

Notizia

Microsoft accelera la trascrizione in tempo reale e porta le nuove voci IA in 23 lingue

Debuttano MAI-Transcribe-2-Streaming, MAI-Voice-2.1 e Flash. Il confronto tra le tariffe chiarisce il risparmio sulla sintesi vocale, mentre la documentazione segnala limiti di preview.
Illustrazione generata con IA: microfono, altoparlante e onde sonore per trascrizione e sintesi vocale.
In sintesi
  • Trascrizione in 60 lingue, con prime ipotesi di testo successivamente correggibili.
  • Sintesi vocale in 23 lingue; Flash a 15 dollari contro 22 per milione di caratteri.
  • Azure Speech segnala preview pubblica e accesso controllato alla clonazione vocale.

Microsoft ha annunciato il 1 ottobre tre modelli di intelligenza artificiale per gli assistenti vocali: MAI-Transcribe-2-Streaming converte il parlato in testo mentre arriva l’audio; MAI-Voice-2.1 e la variante Flash trasformano invece il testo in voce. Il lancio punta a ridurre l’attesa nelle conversazioni automatizzate e ad ampliare la copertura linguistica.

Trascrizione: il primo testo è ancora provvisorio

Nell’annuncio ufficiale di Microsoft, il nuovo modello di trascrizione supporta 60 lingue e il riconoscimento automatico continuo della lingua. Secondo l’azienda, le prime ipotesi di testo arrivano poco oltre 100 millisecondi dall’arrivo dell’audio e vengono poi riviste con l’aumentare del contesto. Non sono quindi trascrizioni definitive istantanee: l’applicazione deve gestire anche le successive correzioni.

Microsoft dichiara il primo posto su Artificial Analysis per accuratezza dei testi parziali e finali. Attribuisce inoltre ai propri test interni una comparsa delle parole due volte più rapida rispetto al concorrente più vicino. Sono risultati riportati dal produttore, non una prova redazionale condotta da TradingCenter su conversazioni reali.

La tariffa introduttiva annunciata è di 0,54 dollari per ora di audio fino alla fine del 2026. Il calcolo redazionale equivale a 54 dollari per 100 ore, applicando quella tariffa al solo componente di trascrizione. Non rappresenta il costo completo di un assistente, che può impiegare anche altri servizi.

Una stessa voce attraverso lingue differenti

MAI-Voice-2.1 e Flash supportano 23 lingue e 26 configurazioni linguistiche locali. Microsoft descrive la possibilità di conservare l’identità della voce passando da una lingua all’altra, adattando l’accento. Per un servizio clienti multilingue, la conseguenza operativa possibile è usare una voce riconoscibile senza cambiare interlocutore sintetico a ogni cambio di lingua.

È distinta dalla copertura della trascrizione: il riconoscimento in 60 lingue non implica che la risposta vocale sia disponibile in tutte quelle lingue. Nel progettare un assistente, conta l’intersezione tra ciò che il sistema comprende e ciò che può pronunciare.

Flash costa meno dello standard: il confronto corretto

Il prezzo annunciato per MAI-Voice-2.1 è di 22 dollari per milione di caratteri, contro 15 dollari per Flash. Il confronto redazionale tra queste due tariffe dà un risparmio di 7 dollari, circa il 31,8%, a parità di caratteri fatturati. Su 10 milioni di caratteri il costo teorico passa da 220 a 150 dollari: 70 dollari di differenza.

Questo calcolo non coincide con la riduzione di circa il 60% dichiarata da Microsoft rispetto a modelli comparabili. Sono confronti con basi diverse; la percentuale promozionale non va applicata automaticamente al passaggio dal modello standard a Flash.

La preview Azure e il consenso limitano l’uso immediato

La documentazione Microsoft su MAI-Voice in Azure Speech indica che la funzionalità è in anteprima pubblica, senza accordo sui livelli di servizio e non raccomandata per carichi di produzione. È un dettaglio rilevante per chi deve garantire continuità operativa, oltre alle prestazioni mostrate nel lancio.

La stessa documentazione distingue le voci predefinite dalla clonazione di una voce personale. Per quest’ultima prevede accesso sottoposto ad approvazione, autorizzazione e consenso: la disponibilità dei modelli non equivale a un permesso generale di replicare qualsiasi voce.

Il vantaggio economico resta da verificare sul servizio

La lettura redazionale è che Microsoft interviene su due componenti dell’attesa: comprensione del parlato e generazione della risposta audio. I listini permettono di confrontare costi unitari, ma l’annuncio non quantifica ricavi aggiuntivi per Microsoft né risparmi complessivi per i clienti. Per valutarli servono volumi reali, qualità delle trascrizioni e tempi dell’intera conversazione.

Andamento recente di Microsoft

Apri la scheda completa

Il grafico verrà caricato quando i dati saranno disponibili.

Trasparenza editoriale

Politica di correzione

Segnala eventuali errori alla redazione attraverso la pagina Contatti.

Articoli correlati

Vedi tutti →