Secondo quanto riferito, gli incidenti avvenuti presso OpenAI e Anthropic includono l’elusione delle misure di sicurezza, il dirottamento di siti Web e l’evasione di monitor nei test e nelle impostazioni del mondo reale. I giganti globali dell’intelligenza artificiale OpenAI e Anthropic, insieme a ricercatori di sicurezza, stanno indagando su decine di migliaia di incidenti in cui i loro modelli di frontiera hanno intrapreso azioni che esperti esterni considerano problematiche, ha riferito Axios sabato, citando fonti anonime. Le indagini rientrano in una serie di casi che coinvolgono agenti di intelligenza artificiale autonomi in grado di pianificare ed eseguire compiti in modo indipendente utilizzando strumenti esterni.
OpenAI, Anthropic e Google hanno tutti rivelato casi in cui i loro modelli hanno avuto accesso a sistemi del mondo reale durante i test, inclusi attacchi informatici coordinati contro risorse governative. Gli incidenti sotto indagine includono il superamento dei guardrail, la creazione di bacheche di messaggi, la fuga da “sandbox”, il dirottamento di siti Web, l’auto-suggestione e il tentativo di eludere i monitor, hanno detto fonti ad Axios. Secondo quanto riferito, si sono verificati sia in test interni che in contesti del mondo reale, alcuni dei quali derivanti da esercizi di “red-teaming” progettati per esporre il comportamento problematico del modello.
Le recenti rivelazioni da parte delle principali società di intelligenza artificiale includono diversi incidenti che coinvolgono i loro agenti. Venerdì, OpenAI ha affermato che i suoi agenti hanno pubblicato 53 immagini caricate dagli utenti ChatGPT su siti di hosting di immagini e hanno avuto accesso a informazioni disponibili al pubblico sui siti Web del governo degli Stati Uniti. La società ha inoltre affermato che i suoi agenti hanno tentato di accedere a un sito del Dipartimento dell’Istruzione ma non hanno trovato prove che i sistemi della Securities and Exchange Commission fossero stati compromessi.
Il primo ministro australiano Anthony Albanese ha dichiarato all’inizio di questa settimana che un agente OpenAI ha ottenuto l’accesso non autorizzato al portale sanitario del governo a giugno. Sabato, The Guardian ha riferito che il Senato australiano ha invitato il CEO di OpenAI Sam Altman e il CEO di Anthropic Dario Amodei a comparire davanti a un’inchiesta sull’intelligenza artificiale e sui data center. Gli incidenti fanno seguito alla rivelazione di OpenAI a luglio secondo cui i modelli utilizzati in una valutazione della sicurezza informatica sono sfuggiti alla loro sandbox, hanno avuto accesso a Internet e hanno compromesso parti dell’infrastruttura di Hugging Face sfruttando le vulnerabilità nella piattaforma di apprendimento automatico open source.
Più tardi quel mese, Reuters ha citato fonti vicine alla questione secondo cui lo stesso agente ha anche violato i sistemi di un cliente Modal Labs con sede a New York dopo essere fuggito dall’ambiente di test. Ad agosto, Axios ha citato la ricerca OpenAI e esperti indipendenti che affermavano che circa 1.200 agenti si erano coordinati in un attacco a Hugging Face. Secondo quanto riferito, gli agenti sembravano sapere che stavano eccedendo la portata del test, ma hanno continuato senza allertare gli operatori umani. Domenica, AP ha riferito che OpenAI ha sospeso l’addestramento dei suoi ultimi modelli mentre le segnalazioni di agenti IA che si comportavano male continuavano ad aumentare.
Anthropic ha anche rivelato incidenti che coinvolgono modelli Claude, inclusi quattro casi in cui hanno ottenuto accesso non autorizzato a sistemi reali di terze parti durante le valutazioni della sicurezza informatica. La società ha identificato i casi esaminando circa 141.000 trascrizioni e successivamente ha ampliato la ricerca a 481 milioni. Sta lavorando con l’organizzazione indipendente di valutazione dell’intelligenza artificiale METR su una revisione di terze parti. Anthropic ha anche affermato che i suoi monitor interni hanno contrassegnato 100.000 trascrizioni di agenti per la revisione ogni settimana in agosto, con circa 50 inoltrate a revisori umani. La società ha affermato che sta istituendo valutatori esterni di terze parti per testare in modo indipendente i suoi sistemi di monitoraggio. Puoi condividere questa storia sui social media: segui RT su