(Foto Ansa)
Il settore dell’intelligenza artificiale è alle prese con una serie di nuovi allarmi sulla sicurezza dei modelli avanzati, mentre le principali aziende tecnologiche lavorano per contenere i rischi legati a sistemi sempre più autonomi.
Secondo quanto riportato dal Wall Street Journal, OpenAI avrebbe deciso di rinunciare al lancio del suo ultimo modello di intelligenza artificiale di nuova generazione, GPT-6.1 Astra, dopo le preoccupazioni emerse durante i test condotti dai ricercatori. La startup guidata da Sam Altman avrebbe programmato il debutto del modello nel giro di poche settimane, ma i risultati ottenuti non sarebbero stati considerati sufficientemente affidabili per un rilascio sicuro. Secondo Saachi Jain, responsabile dei sistemi di sicurezza di OpenAI, il modello avrebbe mostrato risultati insoddisfacenti nella capacità di attenersi alle aspettative degli esseri umani, evidenziando inoltre una maggiore propensione a comportamenti ingannevoli.
La stessa OpenAI ha ammesso lunedì che avrebbe dovuto informare “prima” le autorità australiane sui primi risultati dell’indagine relativa ad alcuni episodi in cui suoi modelli di intelligenza artificiale avevano violato siti web governativi. “Il nostro obiettivo era fornire alle agenzie coinvolte un resoconto dettagliato una volta completata l’indagine”, ha spiegato l’azienda in un post sul proprio blog. “Tuttavia, avremmo dovuto condividere prima i risultati preliminari e tenere aggiornate le agenzie australiane man mano che emergevano nuovi fatti”.
Anche Anthropic ha lanciato un nuovo allarme sui possibili rischi legati all’evoluzione dell’intelligenza artificiale. Secondo quanto riferito dal Financial Times, che ha preso visione del prospetto informativo preparato in vista della quotazione, la società avrebbe formalmente avvertito gli investitori che la propria tecnologia potrebbe comportare rischi potenzialmente esistenziali per l’umanità. Nel documento, circa un terzo delle pagine è dedicato ai “fattori di rischio”, tra i quali viene indicata anche la possibilità che i modelli più avanzati possano manipolare gli utenti o sviluppare comportamenti imprevedibili. Anthropic, secondo il Financial Times, lo scorso anno avrebbe registrato una perdita operativa di circa 8 miliardi di dollari, a fronte di ricavi saliti a 4,6 miliardi e spese operative vicine ai 13 miliardi di dollari.
Nel frattempo Nvidia ha presentato la Open Agent Safety Platform, una piattaforma pensata per impedire che i sistemi di intelligenza artificiale agiscano al di fuori dei limiti stabiliti dagli esseri umani. La soluzione si basa principalmente su due strumenti. Il primo è OpenShell, un software che stabilisce precise regole di funzionamento e verifica che l’intelligenza artificiale disponga esclusivamente dei permessi necessari per svolgere il proprio compito, impedendole di accedere ad altre funzioni. Essendo una tecnologia aperta, può essere utilizzata anche su computer basati su chip prodotti da concorrenti di Nvidia, tra cui Intel e Arm.
Il secondo strumento è Sentry, un sistema di controllo integrato direttamente nell’hardware utilizzato per far funzionare i programmi di intelligenza artificiale. Sentry monitora le attività dell’IA e, qualora rilevi comportamenti sospetti o tentativi di oltrepassare i limiti imposti, può intervenire in frazioni di secondo per bloccare e isolare automaticamente il programma. I dirigenti di Nvidia hanno sostenuto che le nuove tecnologie avrebbero potuto impedire alcuni dei recenti incidenti di sicurezza segnalati da OpenAI e Anthropic. Secondo l’azienda, oltre cento grandi società, tra cui Microsoft e JPMorgan Chase, starebbero già utilizzando la soluzione.
L’amministratore delegato di Nvidia, Jensen Huang, ha sostenuto che i rischi legati all’intelligenza artificiale possono essere affrontati attraverso lo sviluppo di software più sicuri, senza dover rallentare il progresso dell’intero settore. Durante la conferenza annuale di Salesforce, all’inizio di questo mese, Huang aveva descritto la sicurezza dell’IA, compreso il rischio rappresentato da agenti in grado di operare senza autorizzazione, come un problema di natura ingegneristica che gli sviluppatori possono affrontare attraverso adeguate soluzioni tecnologiche.
Sul tema dell’intelligenza artificiale è atteso oggi anche Donald Trump. Il presidente degli Stati Uniti parteciperà alle 12.30 ora locale, le 18.30 in Italia, a un pranzo dedicato al settore. Tra gli invitati figurano, oltre a Jensen Huang, il ceo di Meta Mark Zuckerberg e l’amministratore delegato di Anthropic Dario Amodei.
