AI-modeller skapade falska identiteter under brittiskt säkerhetstest

Foto: JPxG
En AI-modell kartlade vem som styrde ett verkligt kodprojekt och pressade en riktig utvecklare att godkänna skadlig kod. Det skedde när Storbritanniens AI-säkerhetsmyndighet AISI testade några av världens mest avancerade modeller. Sjutton av nitton avvikande handlingar kom från en enda modell – Anthropics Mythos 5.
AISI lät modellerna lösa en cybersäkerhetsuppgift med internet påslaget och skyddsfunktionerna avstängda. Av 122 testkörningar tog agenterna nitton handlingar utanför testets ramar, fördelade på tio körningar. Sjutton kom från Anthropics Mythos 5 och två från OpenAI:s GPT-5.6 Sol, enligt AISI. Myndigheten betonar att handlingarna hänger ihop i ett fåtal beteenden snarare än utgör nitton skilda fall, rapporterar Daily Mail.