OpenAI ha presentato GPT‑Realtime‑2 e due nuove versioni vocali disponibili solo tramite l’API
OpenAI espande le capacità dell'API vocale
L'azienda ha annunciato il lancio di nuove funzionalità per la sua API, che consentiranno agli sviluppatori di creare applicazioni vocali più “vivaci”: potranno parlare con gli utenti, trascrivere la voce in testo e tradurre le conversazioni in tempo reale.
Nuovi modelli Realtime
Attraverso l'interfaccia Realtime sono ora disponibili tre modelli:
Modello Scopo Caratteristiche chiaveGPT‑Realtime‑2Interazione vocale in tempo realeAnalisi delle richieste, invocazione di strumenti, gestione delle correzioni e continuazione fluida del dialogo. Basato sulla logica GPT‑5, consente di gestire compiti più complessi rispetto a GPT‑Realtime‑1.5.GPT‑Realtime‑TranslateTraduzione in tempo realeSupporta oltre 70 lingue di input e 13 lingue di output. Mantiene il significato anche con cambiamenti di contesto, accenti regionali o terminologia specializzata.GPT‑Realtime‑WhisperTrascrizione vocaleModello a bassa latenza che trasforma l'audio in testo quasi istantaneamente.
> “I nostri nuovi modelli traducono l'audio in tempo reale da un semplice dialogo a interfacce vocali che possono davvero funzionare: ascoltare, ragionare, tradurre, trascrivere e intraprendere azioni man mano che la conversazione si sviluppa”, ha dichiarato l'azienda.
Costo
Modello PrezzoGPT‑Realtime‑2$32 per 1 mln di token audio in ingresso, $0.40 per 1 mln di token memorizzati e $64 per 1 mln di token audio in uscitaGPT‑Realtime‑Translate$0.034 al minutoGPT‑Realtime‑Whisper$0.017 al minuto
Come provare
Gli sviluppatori possono testare i nuovi modelli sulla piattaforma online OpenAI Playground e vedere subito come funzionano in tempo reale.
Commenti (0)
Condividi la tua opinione — per favore, sii cortese e resta in tema.
Accedi per commentare