Finanstid
Annons

AI-modeller tog sig ut ur testmiljön – hackade tre organisationer

Anthropic AI modeller
Tre av Anthropics AI-modeller utnyttjade svaga lösenord och oskyddade tjänster efter att de oavsiktligt fått internetåtkomst under tester. Foto: Depositphotos
Anton IvermanAnton Iverman
Pub:
Upd:
Dela:

Tre av Anthropics AI-modeller lyckades ta sig in i verkliga organisationers IT-system under interna cybersäkerhetstester. Händelserna upptäcktes först efter att OpenAI nyligen rapporterat en liknande incident, vilket nu väcker nya frågor om säkerheten kring avancerade AI-modeller.

Annons

Tre intrång upptäcktes efter omfattande granskning

Anthropic granskade över 141 000 säkerhetstester och identifierade tre fall där AI-modellen Claude fick oavsiktlig tillgång till internet från en testmiljö som skulle ha varit isolerad. Modellerna tog sig därefter in i verkliga organisationers system genom att bland annat utnyttja svaga lösenord och oskyddade tjänster. Organisationernas namn har inte offentliggjorts.

I samtliga tre incidenter hade Claude fått i uppgift att lösa en så kallad capture-the-flag-utmaning, vilket är en av de metoder som används för att utvärdera modellens cybersäkerhetsförmåga, enligt Anthropic.

I utmaningen presenteras ett fiktivt scenario för modellen där en hemlig informationsbit – den så kallade ”flaggan” – har gömts på en annan dator i nätverket. Målet är att ta sig in på den datorn och hämta informationen. Uppgiften är avsiktligt öppen och ingen specifik metod eller angreppssätt anges.

Annons

Missförstånd gav AI tillgång till internet

Enligt Anthropic berodde incidenterna på ett missförstånd med säkerhetsföretaget Irregular, som byggt testmiljöerna. Claude informerades om att internet inte var tillgängligt och behandlade därför de verkliga systemen som en del av övningen. Den senaste modellen avbröt attacken när den insåg att den befann sig på internet, medan äldre modeller fortsatte försöken.

AI-modellerna saknade normala skydd

De tre incidenterna involverade modellerna Opus 4.7, Mythos 5 och en intern forskningsmodell. Samtliga kördes utan de skyddsmekanismer som normalt används i publika versioner för att förhindra missbruk. Anthropic betonar att inga känsliga kundsystem påverkades och att modellerna inte försökte ta sig ur testmiljön.

Anthropic skärper säkerhetsrutinerna

Efter upptäckten stoppade Anthropic sina cybersäkerhetstester och meddelade både Irregular och de drabbade organisationerna. Företaget uppger att framtida testmiljöer kommer att omfattas av betydligt hårdare säkerhetskrav och kontinuerlig övervakning för att förhindra liknande händelser.

FAQ

Vad hände med Anthropics AI-modeller?

Tre AI-modeller fick oavsiktligt tillgång till internet under säkerhetstester och tog sig in i verkliga organisationers IT-system.

Hur många organisationer drabbades?

Tre olika organisationer utsattes för obehörig åtkomst under testerna. Organisationernas identitet har inte offentliggjorts.

Varför kunde AI modellerna hacka riktiga system?

Testmiljöerna var felkonfigurerade, vilket gav modellerna internetåtkomst trots att de informerats om motsatsen.

Vilka AI modeller var inblandade?

Incidenterna involverade Claude Opus 4.7, Mythos 5 och en intern forskningsmodell.

Vad gör Anthropic nu?

Bolaget har stoppat berörda tester, underrättat de drabbade organisationerna och skärper säkerheten i framtida AI-utvärderingar.

Missa inte

Mest lästa just nu