Víctor Blanco
← Torna al blog

La crescita esponenziale dell'IA: orizzonte raddoppiato ogni 7 mesi

METR ha rilevato che l'orizzonte dei compiti dell'IA è raddoppiato ogni sette mesi dal 2019 al 2025. Cosa misura e perché conta per le imprese.

(Aggiornato: 7/30/2026) 7 min di lettura
La crescita esponenziale dell'IA: orizzonte raddoppiato ogni 7 mesi

L’intelligenza artificiale migliora con ogni nuova generazione di modelli, ma i test accademici dicono poco sulla quantità di lavoro reale che un sistema può gestire. METR ha proposto una misura più pratica: il tempo che un professionista impiegherebbe per svolgere i compiti che un modello completa in autonomia.

Una misura del lavoro reale

METR definisce orizzonte temporale la durata dei compiti che un modello completa con una determinata probabilità di successo. Ordinando i risultati ottenuti dal 2019 al 2025, i ricercatori hanno osservato che questo orizzonte era raddoppiato circa ogni sette mesi.

La tendenza non implica che tutti i modelli migliorino allo stesso ritmo o che qualsiasi attività possa essere automatizzata. Descrive i progressi nel test dello studio, dedicato soprattutto ad attività di sviluppo software svolte al computer.

Perché un modello supera un esame ma fallisce in un progetto

I modelli possono risolvere problemi di conoscenza, scrivere codice e superare gli specialisti in alcune prove. La loro affidabilità diminuisce quando un compito richiede di mantenere il contesto, usare più strumenti e correggere errori per diverse ore.

I dati dello studio mostrano questo calo:

  • Nei compiti che una persona svolge in meno di 4 minuti, i modelli migliori si avvicinavano al 100% di successo.
  • Nei compiti che richiedono più di 4 ore, il tasso di successo scendeva sotto il 10%.

Tasso di successo dei modelli in base alla lunghezza del compito

Il tempo impiegato da una persona funziona quindi come misura approssimativa della difficoltà. Nei compiti lunghi aumentano le occasioni in cui il modello può perdere informazioni, scegliere lo strumento sbagliato o seguire un percorso che non porta al risultato richiesto.

Che cosa significa un orizzonte di un’ora

Nella valutazione pubblicata nel 2025, i modelli con i risultati migliori, tra cui Claude 3.7 Sonnet, raggiungevano un orizzonte vicino a un’ora con una soglia di successo del 50%. In pratica, completavano metà dei compiti che avrebbero richiesto circa un’ora a un professionista.

La cifra cambia quando chiedi maggiore affidabilità. Un tasso di successo del 50% non basta per automatizzare un’attività senza supervisione; con soglie più severe, l’orizzonte si riduce a pochi minuti. Questa differenza spiega perché un modello può convincere in una dimostrazione e richiedere comunque una revisione umana in un flusso di lavoro reale.

Che cosa permette di prevedere la tendenza

Se il ritmo misurato dal 2019 al 2025 continuasse fino alla fine del decennio, i sistemi più avanzati potrebbero affrontare progetti che oggi richiedono diverse settimane di lavoro umano. Gli autori stimano che persino un errore di misurazione di dieci volte sposterebbe la previsione di circa due anni, data la pendenza della tendenza.

La proiezione resta condizionata. Il test copre una classe specifica di compiti e non comprende tutto ciò che richiede un progetto aziendale: negoziare le priorità, interpretare informazioni ambigue, coordinare persone o assumersi la responsabilità di una decisione.

Come usare questo dato nella tua azienda

  1. Inizia da compiti circoscritti con dati in ingresso, risultati e criteri di qualità chiari.
  2. Misura il lavoro attuale: tempo impiegato, errori e costi prima di introdurre l’IA.
  3. Avvia un test con revisione umana finché non conosci i casi in cui il sistema sbaglia.
  4. Verifica le capacità ogni pochi mesi perché i limiti tecnici cambiano più in fretta di molti processi interni.

L’orizzonte temporale offre un modo concreto per seguire i progressi dell’IA. Per un’azienda, la decisione utile consiste nell’individuare quali attività rientrano già in quell’orizzonte e quali richiedono ancora contesto, giudizio e responsabilità umana.

Basato sulla ricerca “Measuring AI Ability to Complete Long Tasks”


Vuoi capire quali attività puoi automatizzare con la tecnologia attuale? Prenota una sessione gratuita di 30 minuti.