Xiaomi ha lanciato OmniVoice, un modello di intelligenza artificiale aperto in grado di sintetizzare testi praticamente in tutte le lingue e di copiare voci.

Xiaomi ha lanciato OmniVoice, un modello di intelligenza artificiale aperto in grado di sintetizzare testi praticamente in tutte le lingue e di copiare voci.

32 software

Xiaomi ha presentato il modulo IA aperto OmniVoice

L’azienda ha annunciato l’avvio del modello di intelligenza artificiale OmniVoice, che trasforma il testo in voce. Oltre alla sintesi vocale in centinaia di lingue, il modello è in grado di clonare la voce e generare pronunce con impostazioni personalizzate.

Cosa c’è di nuovo in OmniVoice?
IndicatoreDescrizioneLingueSupporto per oltre 200 lingue, incluse quelle rare e poco addestrabili. Anche con meno di 10 ore di dati, il modello produce una voce “quasi in qualsiasi lingua”.QualitàIn test su 102 lingue, la chiarezza della voce era comparabile a quella umana e in alcuni casi la superava. Su 24 lingue, il modello ha superato diverse soluzioni commerciali per somiglianza e chiarezza.ArchitetturaRete transformer bidirezionale semplificata senza moduli intermedie di previsione token. Ciò riduce il tempo di addestramento a un giorno su 100 000 ore di dati e aumenta la velocità di inferenza (fino a 40× in tempo reale con PyTorch).Tecnologie• “Nascondimento casuale dei codici acustici” – accelera l’addestramento. • L’integrazione di un grande modello linguistico durante il pre-addestramento migliora pronuncia e chiarezza.

Possibilità pratiche
1. Clonazione della voce

- Generazione vocale secondo le caratteristiche descritte (età, genere, tono, accento, dialetto).

- Possibilità di creare sussurri e altri stili senza audio di riferimento.

2. Elaborazione delle registrazioni originali

- Rimozione del rumore e estrazione delle caratteristiche vocali pulite anche da file non ideali.

3. Gestione dell’intonazione

- Aggiunta di sospiri, risate e altre sfumature per un suono più naturale.

4. Correzione precisa della pronuncia

- Regolazione manuale di suoni complessi, ad esempio caratteri cinesi multivocali o nomi propri in inglese.

Conclusioni
OmniVoice rappresenta un’alternativa competitiva ai sistemi commerciali esistenti di sintesi vocale. Grazie al design semplice, alla rapida velocità di addestramento e inferenza, e alle ampie possibilità di personalizzazione, il modello è pronto per l’integrazione in applicazioni e servizi consumer.

Commenti (0)

Condividi la tua opinione — per favore, sii cortese e resta in tema.

Non ci sono ancora commenti. Lascia un commento e condividi la tua opinione!

Per lasciare un commento, accedi.

Accedi per commentare