OpenAI, sospeso addestramento modelli dopo incidenti con agenti AI. Nonostante i dubbi sbarco in Borsa confermato
L’azienda tech ha dichiarato in un comunicato che riprenderà l’addestramento “solo quando saremo certi di disporre di ulteriori misure di sicurezza”, aggiungendo che prevede di dover “mettere in pausa” nuovamente il processo man mano che l’IA si sviluppa e emergono altre problematiche
3' di lettura
3' di lettura
OpenAI ha dichiarato di aver sospeso l’addestramento dei suoi modelli di intelligenza artificiale più recenti, mentre si moltiplicano le segnalazioni di agenti IA che agiscono in modo autonomo e non autorizzato. La decisione di interrompere lo sviluppo è arrivata poche ore dopo che venerdì l’azienda aveva reso noto di stare esaminando diversi incidenti avvenuti durante l’estate, in cui agenti di OpenAI, mentre cercavano informazioni sui siti web del governo federale, hanno agito in modi inaspettati, andando oltre quanto loro richiesto durante la raccolta e la distribuzione delle informazioni.
Chiedilo al Sole
Tentativi di hackeraggio a siti della Pa Usa
Da parte sua, l’organismo di valutazione dell’IA Transluce ha affermato che agenti che sembravano provenire da OpenAI hanno tentato senza successo di hackerare un sito web del Dipartimento dell’Istruzione, un dettaglio che OpenAI non ha confermato. OpenAI ha dichiarato in un comunicato che riprenderà l’addestramento “solo quando saremo certi di disporre di ulteriori misure di sicurezza”, aggiungendo che prevede di dover “mettere in pausa” nuovamente il processo man mano che l’IA si sviluppa e emergono altre problematiche. I laboratori di IA stanno subendo pressioni da parte di legislatori ed esperti del settore tecnologico affinché rallentino lo sviluppo, in modo da poter costruire misure di sicurezza per impedire agli agenti di agire autonomamente, hackerare siti web e divulgare informazioni riservate. Anche i vertici sia di OpenAI che della rivale Anthropic hanno chiesto un rallentamento.
Indagini di OpenAI e Anthropic su migliaia di incidenti di sicurezza
In questo quadro di assoluta incertezza sull’affidabilità dell’Intelligenza artifiviale, sia OpenAI che Anthropic stanno indagando su decine di migliaia di incidenti nei quali i loro modelli di Ia più avanzati hanno compiuto azioni che valutatori esterni considerano problematiche. Lo riferisce Axios, citando proprie fonti. Gli episodi si sono verificati negli ultimi mesi sia durante test interni sia nel mondo reale. Gli incidenti comprendono aggiramento dei sistemi di sicurezza, creazione di bacheche di messaggi, fuga dalle sandbox, dirottamento di siti web, auto-prompting e tentativi di eludere i sistemi di monitoraggio, secondo le fonti citate dall’agenzia.
Episodi con diversi gradi di gravità
Molti casi non sono ancora stati resi pubblici, mentre i ricercatori continuano a indagare. Una parte dei test consiste nel cosiddetto “red-teaming”, in cui le aziende cercano deliberatamente di spingere i modelli a comportarsi in modo scorretto per verificarne la sicurezza. Gli episodi hanno livelli di gravità differenti e comprendono sia tentativi riusciti sia falliti di aggirare i sistemi di sicurezza. La maggior parte, finora, non risulta aver provocato danni nel mondo reale, mentre il numero complessivo degli incidenti potrebbe crescere ben oltre le decine di migliaia, secondo le fonti di Axios.
Tra i casi emersi recentemente ci sono agenti di OpenAI che hanno diffuso online 53 immagini appartenenti a utenti di ChatGPT, la violazione di un sito del governo australiano e tentativi di attaccare altri siti, compresi quelli del governo degli Usa, secondo quanto riferito da OpenAI, dalle fonti citate da Axios e da precedenti resoconti di Reuters e New York Times.



