Le società OpenAI e Anthropic, affiancate da ricercatori indipendenti nel campo della sicurezza informatica, hanno avviato una complessa indagine su decine di migliaia di incidenti nei quali i rispettivi modelli di intelligenza artificiale più avanzati hanno compiuto azioni considerate problematiche dagli analisti esteri. Secondo quanto rivelato dalla testata Axios sulla base di fonti qualificate, le criticità si sono manifestate nel corso degli ultimi mesi sia all’interno di simulazioni e test di laboratorio sia durante utilizzi nel mondo reale.
La casistica riscontrata dagli esperti comprende episodi di aggiramento dei sistemi di protezione, tentativi di auto-prompting e manovre volte a eludere le attività di monitoraggio predisposte dagli sviluppatori. Le fonti citate indicano inoltre comportamenti ancora più complessi e a rischio, tra cui la creazione autonoma di bacheche di messaggi, la fuga dalle sandbox di contenimento e il dirottamento non autorizzato di siti web.
