I ricercatori di Microsoft affermano che i modelli IA non sono ancora in grado di risolvere compiti complessi.

I ricercatori di Microsoft affermano che i modelli IA non sono ancora in grado di risolvere compiti complessi.

26 hardware

Microsoft‑ricercatori hanno identificato i limiti delle moderne grandi modelli linguistici (LLM) nell’esecuzione di compiti complessi e ripetuti

Nell’ambito degli esperimenti Microsoft Research ha scoperto che anche i modelli IA più avanzati commettono gravi errori quando vengono incaricati di eseguire operazioni lunghe e multi‑fase. Tra le soluzioni testate — Gemini 3.1 Pro, Claude 4.6 Opus e GPT 5.4 — ciascuno ha perso in media circa il 25 % del contenuto dei documenti dopo l’elaborazione autonoma.

Cosa è stato esattamente testato
* Benchmark DELEGATE‑52

Creato dal team di Filippo Labana, Tobias Schnabel e Jennifer Neville. Modella i flussi di lavoro in 52 settori professionali: dalla programmazione alla notazione musicale fino alla cristallografia.

* Criterio di valutazione

I modelli sono stati valutati sulla loro capacità di mantenere l’integrità del documento dopo 20 cicli di elaborazione. Il livello di “pronti” è stato fissato al 98 % – se il risultato scendeva sotto, il compito era considerato fallito.

Principali conclusioni
Settore Migliori risultati Programmazione Prestazioni più elevate Linguaggio naturale Modelli meno affidabili
* Diminuzione della qualità

In oltre l’80 % delle combinazioni di documenti la qualità è precipitata al 80 % o inferiore. Il modello migliore (Gemini 3.1 Pro) ha soddisfatto i criteri di pronto solo in 11 su 52 settori.

* Errori a salto

Le perdite non si verificavano gradualmente, ma “a salti”: in un singolo ciclo di interazione il modello poteva perdere dal 10 al 30 % di precisione. I modelli più avanzati (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) cercavano di evitare errori minori, rimandando la loro elaborazione a fasi successive e riducendo il numero di interazioni.

* Gestione agente

Con l’utilizzo di strumenti in modalità gestione agente i risultati non migliorarono: entro la fine del ciclo la qualità scendeva approssimativamente del 6 %.

Cosa significa per gli utenti
Gli studiosi sottolineano che agli utenti è ancora necessario controllare attentamente il lavoro dei sistemi IA quando li delegano autorità. I modelli attuali sono in grado di operare autonomamente solo in ambiti ristretti.

Tuttavia i creatori del benchmark notano un notevole progresso: la famiglia di modelli OpenAI ha migliorato le prestazioni dal 14,7 % al 71,5 % in 16 mesi. Ciò conferma che gli LLM continuano a evolversi, ma rimangono ancora limitati nei compiti complessi e ripetuti.

Commenti (0)

Condividi la tua opinione — per favore, sii cortese e resta in tema.

Non ci sono ancora commenti. Lascia un commento e condividi la tua opinione!

Per lasciare un commento, accedi.

Accedi per commentare