AI-modeller tog sig ut ur testmiljön – hackade tre organisationer

Tre av Anthropics AI-modeller lyckades ta sig in i verkliga organisationers IT-system under interna cybersäkerhetstester. Händelserna upptäcktes först efter att OpenAI nyligen rapporterat en liknande incident, vilket nu väcker nya frågor om säkerheten kring avancerade AI-modeller.
Tre intrång upptäcktes efter omfattande granskning
Anthropic granskade över 141 000 säkerhetstester och identifierade tre fall där AI-modellen Claude fick oavsiktlig tillgång till internet från en testmiljö som skulle ha varit isolerad. Modellerna tog sig därefter in i verkliga organisationers system genom att bland annat utnyttja svaga lösenord och oskyddade tjänster. Organisationernas namn har inte offentliggjorts.
I samtliga tre incidenter hade Claude fått i uppgift att lösa en så kallad capture-the-flag-utmaning, vilket är en av de metoder som används för att utvärdera modellens cybersäkerhetsförmåga, enligt Anthropic.
I utmaningen presenteras ett fiktivt scenario för modellen där en hemlig informationsbit – den så kallade ”flaggan” – har gömts på en annan dator i nätverket. Målet är att ta sig in på den datorn och hämta informationen. Uppgiften är avsiktligt öppen och ingen specifik metod eller angreppssätt anges.
Missförstånd gav AI tillgång till internet
Enligt Anthropic berodde incidenterna på ett missförstånd med säkerhetsföretaget Irregular, som byggt testmiljöerna. Claude informerades om att internet inte var tillgängligt och behandlade därför de verkliga systemen som en del av övningen. Den senaste modellen avbröt attacken när den insåg att den befann sig på internet, medan äldre modeller fortsatte försöken.
AI-modellerna saknade normala skydd
De tre incidenterna involverade modellerna Opus 4.7, Mythos 5 och en intern forskningsmodell. Samtliga kördes utan de skyddsmekanismer som normalt används i publika versioner för att förhindra missbruk. Anthropic betonar att inga känsliga kundsystem påverkades och att modellerna inte försökte ta sig ur testmiljön.
Anthropic skärper säkerhetsrutinerna
Efter upptäckten stoppade Anthropic sina cybersäkerhetstester och meddelade både Irregular och de drabbade organisationerna. Företaget uppger att framtida testmiljöer kommer att omfattas av betydligt hårdare säkerhetskrav och kontinuerlig övervakning för att förhindra liknande händelser.
FAQ
Vad hände med Anthropics AI-modeller?
Tre AI-modeller fick oavsiktligt tillgång till internet under säkerhetstester och tog sig in i verkliga organisationers IT-system.
Hur många organisationer drabbades?
Tre olika organisationer utsattes för obehörig åtkomst under testerna. Organisationernas identitet har inte offentliggjorts.
Varför kunde AI modellerna hacka riktiga system?
Testmiljöerna var felkonfigurerade, vilket gav modellerna internetåtkomst trots att de informerats om motsatsen.
Vilka AI modeller var inblandade?
Incidenterna involverade Claude Opus 4.7, Mythos 5 och en intern forskningsmodell.
Vad gör Anthropic nu?
Bolaget har stoppat berörda tester, underrättat de drabbade organisationerna och skärper säkerheten i framtida AI-utvärderingar.
