Economia Digitale

L’AI riscrive le regole dei test: Astra aggancia Claude in vetta all’Index

La revisione dei parametri di Artificial Analysis premia automazione agentica e gestione dei documenti complessi. Il podio resta saldamente americano, ma la francese Mistral (18ª) punta su costi ridotti e pesi aperti per conquistare la sovranità dei dati nelle imprese.

3' di lettura

English Version

3' di lettura

English Version

Qual è il modello di AI più “intelligente”? Dipende dal giorno in cui lo chiediamo. In questa fine estate 2026 abbiamo imparato che oggi può essere in testa alla classifica un modello, domani un altro, e non solo perché arrivano di continuo modelli più potenti dei precedenti (o almeno che sembrano tali). A essere mobile, ondivago è il metro di valutazione, in inglese il benchmark. Vedi quello che è successo a settembre con la classifica ora di riferimento, della società specializzata Artificial Analysis Intelligence. Nella sua versione 4.3, Claude Fable 5.1 di Anthropic e Gpt-6 Astra di OpenAI sono ai primi due posti pari merito. Seguono Claude Opus 5 e Claude Fable 5 (terzo e quarto posto). Cinque giorni prima, però, Astra, l’ultimo gioiello di OpenAI era al quinto posto. Che è successo? Artificial Intelligence si è accorta che il metro non era più tanto adeguato per giudicare i nuovi modelli e quindi ha cambiato i pesi dei diversi test a cui li sottopone.

Domande di approfondimento generate da 24Ore AI

Bisogna sapere che l’Intelligence Index non misura una generica “intelligenza” dell’AI. Aggrega dieci benchmark, con pesi differenti.

Loading...

Il 30% riguarda gli agenti, cioè la capacità di completare lavori composti da più operazioni. Il 20% riguarda il coding, il 30% capacità generali come conoscenza, gestione delle allucinazioni e comprensione di lunghi documenti, il restante 20% il ragionamento scientifico.

Tra i test ci sono AA-Briefcase e GDPval-AA v2 per il lavoro professionale; AutomationBench-AA per i workflow aziendali; Terminal-Bench e SciCode per la programmazione; Humanity’s Last Exam e CritPt per il ragionamento; AA-Omniscience per conoscenza e allucinazioni; GDP.pdf e AA-LCR per documenti e contesti molto lunghi.

Adesso, l’ultima versione dell’Index valorizza di più la capacità di svolgere lavori professionali lunghi e complessi, e di analizzare documenti molto corposi. Insomma, proprio le cose per le quali Astra eccelle e per le quali finora Anthropic aveva un vantaggio su OpenAI. Si tratta del lavoro AI autonomo, “agentico”, su attività che fino a poco tempo prima erano considerate solo “umane”. Gli esperti concordano che ancora l’umano conserva un vantaggio sulle capacità di pianificazione di lungo periodo, ma il divario con l’AI si riduce velocemente. Nel bene e nel male, se si considera quanta pianificazione di lungo periodo (mesi) ha richiesto il noto attacco (scoperto a luglio), compiuto dagli agenti di OpenAI ad Hugging Face, durante un test. Non solo pianificazione, ma anche una articolata collaborazione tra agenti (all’insaputa degli umani).

Bene, se questa è la frontiera, il podio è tutto americano, con Muse Spark 1.3 di Meta (uscito a settembre) al quinto posto – pure abile nell’usare tanti strumenti in modo autonomo per raggiungere uno scopo. Al sesto, Gpt 5.6 Max di Open AI. La Cina è subito dopo con Glm 5.3 Max.

Ci sono poi differenze di capacità in compiti specifici, da considerare.

Claude Fable 5.1 è particolarmente forte nei compiti professionali complessi, progetti di lavoro basati su migliaia di file dove deve produrre analisi, documenti, fogli di calcolo o presentazioni. Qui fa meglio di Astra, che però è migliore in programmazione (ma in quella scientifica è meglio Fable 5.1).

Astra emerge quando l’AI deve agire in modo autonomo, in workflow aziendali nei settori finanza, marketing, vendite, risorse umane e operations. Astra inoltre costa di meno di Fable 5.1, ma più rispetto a Glm 5.3 (nell’ambito dei modelli top). I modelli europei fanno capolino al 18esimo posto con la francese Mistral, che ha appena raccolto 3 miliardi di euro. Ha un costo molto ridotto (anche se ci sono modelli più economici, come Deepseek 4.1 Flash). È un modello a pesi aperti, come molti di quelli cinesi e a differenza di quelli top di OpenAI e Anthropic. Essendo aperto, lo si può quindi scaricare e modificare in libertà.

Quel 18esimo posto non significa quindi che Mistral sia irrilevante per le imprese. In applicazioni dove contano controllo dell’infrastruttura, possibilità di eseguire il modello in ambienti propri, sovranità dei dati o personalizzazione, l’apertura è un valore. Per di più almeno questa, a differenza dei benchmark, è un fatto oggettivo

Riproduzione riservata ©

Brand connect

Loading...

Newsletter

Notizie e approfondimenti sugli avvenimenti politici, economici e finanziari.

Iscriviti