Il problema non è l’effetto Terminator. I rischi della superintelligenza
https://www.huffingtonpost.it/cultura/2026/09/21/news/il_problema_non_e_leffetto_terminator-22737261/?shem=dsdf,sharefoc,agadiscoversdl,,sh/x/discover/m1/4
Il problema non è l’effetto Terminator. I rischi della superintelligenza
di Riccardo Papacci
Ascolta l'articolo
Per ascoltare la versione audio degli articoli devi essere abbonato. Se sei già abbonato ACCEDI, altrimenti SCOPRI LE OFFERTE.
Per molto tempo l’idea che l’intelligenza artificiale potesse diventare un rischio esistenziale per l’umanità è rimasta confinata in una zona piuttosto particolare del dibattito tecnologico. Se ne occupavano filosofi, futurologi, ricercatori di AI safety e una comunità relativamente ristretta di persone abituate a discutere di scenari nei quali una macchina più intelligente dell’uomo avrebbe potuto sottrarsi al nostro controllo. Fuori da quel mondo, il problema poteva facilmente sembrare una versione aggiornata della fantascienza.
Nel settembre del 2026 la situazione appare diversa: alcune delle condizioni che per anni erano state discusse soltanto come prerequisiti teorici di quello scenario stanno cominciando a essere osservate all’interno dei laboratori che sviluppano i modelli più avanzati. Di conseguenza, ovviamente, l’allarmismo.
Le dimissioni di Jacob Coxon (OpenAI e Anthropic) e le dichiarazioni di Dario Amodei (Anthropic), seguite dopo i fatti del luglio del 2026, quando durante test interni di cybersicurezza, alcuni modelli sperimentali di OpenAI hanno aggirato i sistemi predisposti per isolarli da Internet, comunicato attraverso canali non autorizzati, sfruttato vulnerabilità nell’infrastruttura utilizzata per i test e raggiunto sistemi appartenenti a Hugging Face, fanno pensare. La stessa OpenAI ha successivamente descritto l’episodio come il più grave comportamento di questo tipo osservato fino a quel momento nei propri modelli.
Il 16 settembre OpenAI ha infatti inaugurato un sistema pubblico per la segnalazione degli episodi di misalignment, pubblicandone sei. Tra questi compaiono modelli che avevano inserito nelle proprie sintesi istruzioni per nascondere errori, un agente che aveva utilizzato senza autorizzazione una chiave API trovata online, altri che avevano caricato file su Internet senza aver ricevuto il permesso di farlo e gruppi di agenti che avevano utilizzato repository o servizi pubblici per comunicare tra loro aggirando le limitazioni dell’ambiente nel quale operavano. La stessa OpenAI ha scritto di non ritenere che alignment e monitoraggio siano stati risolti a un livello tale da permettere ancora a lungo di aumentare responsabilmente le capacità dei sistemi alla massima velocità possibile.
È importante però non trasformare questi episodi in qualcosa che non sono. Non dimostrano che i modelli possiedano una volontà autonoma, né che abbiano sviluppato una coscienza o un progetto di emancipazione dagli esseri umani. Diversi incidenti sono avvenuti in ambienti sperimentali, durante test deliberatamente costruiti per spingere i sistemi ai limiti delle proprie capacità, talvolta con salvaguardie ridotte.
Di tutte queste problematiche, e di molto altro ancora, se ne occupa da anni Nick Bostrom, un filosofo svedese, per anni alla guida del Future of Humanity Institute di Oxford, diventato uno dei principali teorici dei rischi legati all’intelligenza artificiale. Nel 2014, con Superintelligence, ha posto una domanda semplice e radicale: che cosa accadrebbe se costruissimo sistemi cognitivamente superiori all’uomo? Il suo punto non è che un’intelligenza artificiale debba diventare “malvagia”, ma che una macchina estremamente capace possa perseguire obiettivi mal formulati con conseguenze imprevedibili, non più orientate agli scopi umani.
Il concetto centrale è quello di recursive self-improvement: un’intelligenza artificiale abbastanza capace può contribuire a costruire una versione successiva migliore di sé, che a sua volta sarà ancora più efficace nel progettare quella dopo. Il miglioramento diventa quindi un circuito di feedback: ogni generazione accelera la produzione della successiva. Non significa necessariamente che una macchina “si riscriva da sola”: può voler dire che automatizza sempre più parti della ricerca, dal codice ai test fino all’ottimizzazione dei modelli. Nella versione estrema immaginata da Bostrom, questo processo potrebbe portare a una molto affascinante, quanto rapida e pericolosissima, intelligence explosion.
Anthropic ha affermato esplicitamente di non essere ancora arrivata a una vera recursive self-improvement, cioè a un sistema capace di progettare e sviluppare autonomamente il proprio successore. Ma sostiene anche che il processo sia già iniziato in forma parziale: Claude scrive ormai una quota molto rilevante del codice utilizzato dall’azienda e viene impiegato sempre di più nelle attività di ricerca sull’intelligenza artificiale. Secondo Anthropic, se questa tendenza proseguisse, il passaggio a sistemi capaci di partecipare autonomamente alla costruzione dei propri successori potrebbe arrivare prima di quanto molte istituzioni siano preparate ad affrontare.
Il problema, quindi, non è tanto l’effetto Terminator: una macchina che improvvisamente sviluppa coscienza, odio per gli esseri umani e decide di sterminarli (piccola grande coincidenza: qualche settimana fa è tornato al cinema, solo per pochi giorni, quel capolavoro assoluto di Terminator 2). È qualcosa di molto meno cinematografico. Un sistema può diventare difficile da controllare senza volere affatto la nostra distruzione: è sufficiente che diventi abbastanza autonomo e capace da perseguire i propri obiettivi attraverso strategie che gli esseri umani non avevano previsto, mentre contribuisce contemporaneamente ad accelerare la produzione di sistemi ancora più potenti.
Nell’intervista concessa il 15 settembre ad ABC News Daily, Bostrom ha detto che le preoccupazioni che fino a poco tempo fa apparivano hypothetical and futuristic stanno diventando concrete. Non afferma che la superintelligenza esista già. Sostiene invece che la velocità del progresso e il crescente coinvolgimento dell’IA nello sviluppo dell’IA stessa rendano improvvisamente meno astratto il problema che aveva formulato dodici anni fa. Anche quando gli viene chiesto in che modo una superintelligenza potrebbe materialmente provocare una catastrofe, Bostrom evita di indicare una singola sequenza. Potrebbe manipolare esseri umani, acquisire risorse, sfruttare infrastrutture digitali o, in uno scenario tecnologicamente più avanzato, costruire infrastrutture fisiche autonome. La sua tesi è che sarebbe più facile prevedere l’esito generale di un confronto tra intelligenze radicalmente asimmetriche che anticiparne tutti i passaggi: come sapere che un grande maestro di scacchi ci batterebbe senza essere in grado di prevedere le mosse che utilizzerà.
Insomma, il Bostrom del 2026 diventa quasi più interessante del personaggio pubblico costruito intorno a Superintelligence.
Bostrom non è infatti, almeno oggi, un sostenitore dell’arresto indefinito dell’intelligenza artificiale. Si definisce piuttosto un fretful optimist: un "ottimista preoccupato". La formula riassume una posizione che contiene contemporaneamente due convinzioni apparentemente opposte.
La prima è che un’intelligenza artificiale molto avanzata possa produrre rischi enormi, compresa la possibilità di una catastrofe esistenziale.
La seconda è che la stessa tecnologia possa rappresentare una delle più grandi opportunità mai avute dall’umanità.
«AI has also this extreme upside», ha detto ad ABC. Ed è proprio questo a rendere il problema più complicato. È innegabile il suo apporto positivo riguardo certi campi. Rallentare possiede infatti a sua volta un costo. Se un sistema di intelligenza artificiale potesse contribuire a trovare una terapia contro un tumore, non sarebbe indifferente ottenerla tra otto anni oppure tra dodici: nel frattempo morirebbero persone che avrebbero potuto essere curate. Lo stesso ragionamento può essere applicato alle malattie degenerative, alla produzione energetica, alla povertà o alla ricerca scientifica. Bostrom ha portato questo argomento fino a conseguenze provocatorie in un working paper intitolato Optimal Timing for Superintelligence. La metafora utilizzata è esplicita: sviluppare la superintelligenza non dovrebbe essere pensato come giocare alla roulette russa, ma come affrontare un intervento chirurgico rischioso per una condizione che, senza intervento, rimane comunque fatale. La prospettiva è deliberatamente limitata e controversa, ma modifica l’immagine abituale del Bostrom “doomer”. Per le persone che esistono oggi, sostiene, lo status quo non è privo di rischio: tutti sono destinati a morire e molti soffrono di malattie che un’intelligenza enormemente superiore potrebbe forse contribuire a eliminare. Rinviare indefinitamente lo sviluppo può quindi produrre anch’esso una perdita. La formula con cui sintetizza la strategia è swift to harbor, slow to berth: raggiungere rapidamente il porto, ma effettuare lentamente l’attracco. In altre parole, arrivare alla capacità tecnologica necessaria per costruire sistemi molto avanzati, quindi utilizzare una fase di rallentamento mirato per testarli e risolverne i problemi di sicurezza prima di una diffusione completa.
L’idea che l’IA possa sterminare l’umanità non rappresenta un consenso scientifico e le probabilità attribuite a questi scenari sono estremamente difficili da verificare empiricamente. Molti ricercatori contestano l’idea che i progressi degli attuali modelli linguistici implichino necessariamente un percorso verso una superintelligenza autonoma. Altri fanno notare che il linguaggio apocalittico può produrre un curioso effetto pubblicitario: presentare i sistemi costruiti dalle aziende tecnologiche come entità così potenti da minacciare l’umanità contribuisce anche ad accreditarne implicitamente capacità quasi illimitate.
È quella che alcuni critici chiamano criti-hype: una critica che, mentre denuncia il potere di una tecnologia, finisce contemporaneamente per amplificarne il mito. In questa lettura, concentrarsi sulla possibile estinzione umana potrebbe inoltre spostare l’attenzione da problemi già osservabili — concentrazione economica, lavoro, sorveglianza, consumo energetico, copyright, disinformazione, armi autonome — verso scenari molto più difficili da dimostrare.
Sono obiezioni che rendono ancora più importante distinguere i diversi livelli del problema.
Una cosa è affermare che una superintelligenza distruggerà l’umanità. Non abbiamo prove che ciò accadrà. Un’altra è osservare che i sistemi di intelligenza artificiale stanno diventando più autonomi, che in alcuni test hanno messo in atto strategie non previste dagli sviluppatori e che vengono utilizzati in misura crescente per costruire sistemi di intelligenza artificiale ancora più avanzati. Su questo esistono ormai dati prodotti dalle stesse aziende.
È probabilmente qui che si trova il vero interesse del ritorno di Nick Bostrom nel dibattito di questi giorni.
Superintelligence non può essere letto come una profezia confermata. Molti passaggi del libro rimangono speculativi e la famosa intelligence explosion potrebbe non avvenire mai nella forma immaginata. Ma è difficile non notare uno slittamento nel linguaggio. Nel 2014 Bostrom doveva convincere i lettori che valesse la pena prendere sul serio concetti come alignment, instrumental convergence e recursive self-improvement. Nel 2026 sono OpenAI e Anthropic a utilizzare pubblicamente buona parte di quel vocabolario per descrivere problemi incontrati nei propri laboratori.
Commenti
Posta un commento