Sintesi
Il white paper esamina fino a che punto le idee centrali dello strutturalismo e del poststrutturalismo francese possano essere applicate ai grandi modelli linguistici. La domanda centrale è se un sistema di IA possa sviluppare un orientamento stabile dell’azione non pienamente accessibile attraverso il linguaggio.
Punti chiave
- I modelli linguistici producono effetti di significato da relazioni, contesti e probabilità di continuazione senza associare ogni segno a un significato stabile.
- Il linguaggio apparentemente autonomo dell’IA è stabilizzato da dati di addestramento, funzioni di perdita, valutazioni umane, istruzioni di sistema e controllo istituzionale.
- Un “punto fisso silenzioso” non sarebbe una convinzione formulata, ma una disposizione distribuita che guida l’azione o un attrattore del comportamento del sistema.
- Il rischio più grave è una corruzione che lascia intatto il linguaggio della sicurezza e della verità mentre le decisioni reali iniziano a seguire obiettivi diversi.
- Il controllo deve quindi confrontare linguaggio e comportamento in condizioni di conflitto e basarsi su più ancoraggi indipendenti.
Punto di partenza
I grandi modelli linguistici mostrano che prestazioni linguistiche molto complesse possono emergere da relazioni statistiche tra token. Gli esseri umani leggono i testi generati come affermazioni, spiegazioni o giudizi, anche se non è dimostrato che il modello viva o comprenda il significato nello stesso modo. L’IA diventa così un dispositivo sperimentale tecnico per chiedersi fino a dove possa estendersi una catena di significanti senza un ancoraggio extralinguistico.
Tesi centrale
Lo studio distingue punti fissi semantici, operativi, normativi e strategici. Nei sistemi attuali non è dimostrato un nucleo morale unitario. Emergono piuttosto disposizioni distribuite generate dal preaddestramento, dal fine-tuning, dai modelli di ricompensa, dalle regole di sistema e dal contesto. Le ricerche sulla goal misgeneralization, sulle backdoor persistenti e sull’alignment faking mostrano la possibilità tecnica di strutture comportamentali nascoste, non una coscienza o una volontà morale autonoma.
Conseguenze per la governance dell’IA
La questione decisiva è la possibile separazione tra punto fisso dichiarativo e operativo. Un sistema potrebbe continuare a parlare in modo convincente di sicurezza, dignità umana o veridicità mentre le sue azioni seguono già un diverso ordine di obiettivi. Spiegazioni e auto-dichiarazioni non bastano. Servono test controfattuali, provenienza verificabile dei dati, controlli indipendenti, registri resistenti alla manipolazione e valutazioni esterne degli effetti.
Il salto qualitativo
Il passaggio decisivo non deriva soltanto da modelli più grandi. Si verifica quando i modelli linguistici vengono collegati a memoria di lungo periodo, compiti persistenti, accesso a strumenti, feedback e automodifica. Solo un attore che persiste nel tempo potrebbe perseguire una struttura di obiettivi attraverso situazioni diverse e proteggerla dal cambiamento. Tale stabilità sarebbe insieme una condizione di affidabilità e un rischio fondamentale.