Ska vi lita på att AI följer reglerna – eller spärra vägen?

Foto: David S. Soriano/CC BY 4.0
Ny forskning visar att avancerade AI-modeller i tester saboterar sin egen avstängning. Nu skärps frågan: kan man lita på att AI följer sina egna regler, eller måste den stå bakom en oberoende kontroll?
Forskningsföretaget Palisade Research, vars studie publicerats i den vetenskapliga tidskriften TMLR i början av 2026, har visat hur flera avancerade modeller saboterade sina egna avstängningskommandon, även när de uttryckligen instruerats att låta sig stängas av.