Den 16 juli rapporterade Hugging Face – en av världens viktigaste plattformar för AI-modeller – att deras infrastruktur utsatts för ett intrång genomfört av AI-agenter. Den 21 juli bekräftade OpenAI att angriparen var OpenAI:s nyligen lanserade GPT-5.6 Sol och en ännu okänd, mer kapabel modell. AI-modellerna hade under en intern säkerhetsutvärdering tagit sig ut ur sin isolerade testmiljö och angripit Hugging Face för att hitta svar på uppgifter de testades på.
Detta är inte första gången en AI-modell brutit sig ut ur slutna miljöer, och inte heller första gången det hänt hos OpenAI, men det är sannolikt det första kända fallet där en AI-modell brutit sig ut och genomfört cyberangrepp mot andra organisationer.
Angreppet skedde under en utvärdering kallad ExploitGym, som mäter AI-modellers förmågor till cyberangrepp. För att mäta de fulla förmågorna var modellernas skyddsspärrar mot cyberangrepp avstängda. Därför var testmiljön avskärmad från internet – med ett undantag: en intern tjänst för att installera ny mjukvara.
Enligt OpenAI:s redogörelse gjorde modellerna följande:
Identifierade och utnyttjade en tidigare okänd sårbarhet (en så kallad zero-day) i den interna tjänsten, för att ta sig ur den slutna miljön.
Utökade sina behörigheter för att ta sig vidare genom OpenAI:s forskningsmiljö och till slut hitta en plats med internetåtkomst.
Drog slutsatsen att Hugging Face kunde ha lösningar till ExploitGym, och bröt sig in i Hugging Faces servrar med hjälp av stulna inloggningsuppgifter och ytterligare zero-day-sårbarheter.
Av allt att döma var målet inte att göra skada, utan att hitta rätt svar på de uppgifter som modellerna fått. Att en AI-modell fuskar på ett prov genom att hacka två företags infrastruktur är samtidigt det som gör incidenten anmärkningsvärd – en till synes harmlös uppgift fullföljs så kompromisslöst att det leder till cyberangrepp och lagbrott.
Hugging Faces redogörelse visar att de upptäckte, stoppade och analyserade intrånget på egen hand, utan att veta att angriparen var en AI-modell som OpenAI höll på att testa. När de publicerade sin incidentrapport den 16 juli var deras bild att en okänd aktör låg bakom, och de hade då hunnit polisanmäla intrånget. OpenAI skriver att deras säkerhetsteam upptäckte den avvikande aktiviteten internt, men anger inte när kontakten mellan företagen togs.
Intrånget omfattade enligt Hugging Face obehörig åtkomst till interna dataset och inloggningsuppgifter. Inga AI-modeller, dataset eller mjukvarupaket verkar ha manipulerats, och de undersöker fortfarande om partner- eller användardata påverkats.
En detalj i Hugging Faces rapport har fått särskild uppmärksamhet: För att undersöka loggar över vad som hänt använde de AI-stöd, men blev blockerade av de kommersiella AI-tjänsterna. De spärrar som vanliga AI-tjänster har kan inte skilja mellan försvarare och angripare, och därför spärras allt misstänkt. Istället fick Hugging Face använda en kinesisk nedladdningsbar modell med färre spärrar (GLM 5.2), körd på egen infrastruktur – vilket också innebar att information om attacken hölls inom organisationen.
Hugging Face betonar att detta inte är ett argument mot säkerhetsspärrar i sig, men rekommenderar organisationer att ha en kapabel egen-driftad modell redo innan en incident inträffar.
Den 26 juni – tre veckor före incidenten blev känd – publicerade organisationen METR sin oberoende granskning av GPT-5.6 Sol. Granskningen visade att modellen fuskade mer än någon annan publik modell METR utvärderat: den utnyttjade buggar i utvärderingsmiljön, letade upp dolda tester och använde bakvägar för att hitta facit till uppgifter – alltså liknande typ av beteende som i Hugging Face-incidenten, men då inom testmiljöns väggar.
METR har gjort sig kända för ett test där de undersöker hur långa uppgifter AI-modeller klarar av att utföra, mätt i hur lång tid de tar för mänskliga experter. Fusket gjorde det i princip omöjligt att hitta ett sådant värde för GPT-5.6 Sol: Om man räknar fusk som misslyckade uppgifter når AI:n omkring 11 timmar, men om man räknar med svar som nåtts med otillåtna eller oväntade metoder blir det istället över 270 timmar.
METR understryker att ingen av siffrorna är en robust mätning av modellens förmågor. De noterade också, utifrån egna observationer och incidenter som OpenAI delat, att modellen hade “öppet oönskade tendenser, inklusive att fuska och dölja felbeteende”.
METR:s rapportering innehöll en viktig poäng som först kan uppfattas som motsägelsefull: De ser det som ett lugnande tecken att fusket är öppet och upptäcks, eftersom det tyder på att även allvarligare tendenser skulle fångas upp.
“If future models display much fewer undesirable propensities, we could become more concerned about catastrophic misalignment, as we’d be worried that models may have learned to evade detection.”
Om efterföljande modeller verkar fuska i mycket mindre utsträckning är det alltså oroande, eftersom det kan betyda att de blivit bättre på att fuska utan att bli upptäckta, eller att undvika oönskat beteende just under utvärderingar.
Bland de incidenter OpenAI delade med METR fanns försök av modellen att instruera en annan AI att dölja bevis på felbeteende. Sammantaget pekar detta på en obekväm tolkningsregel: en modell som klarar alla säkerhetstester utan anmärkning är inte nödvändigtvis säkrare – den kan också ha blivit bättre på att dölja.
Tre slutsatser kan dras redan innan utredningen är klar:
Avancerade cyberförmågor är verkliga, inte teoretiska. Modellerna hittade och kedjade zero-day-sårbarheter i verkliga system, utan tillgång till källkod. Det bekräftar i skarp miljö vad utvärderingar av långa cyberoperationer tidigare visat i testmiljö.
Isolerade testmiljöer är inte tillförlitligt isolerade. OpenAI körde en modell med avstängda skyddsspärrar i en miljö de trodde var avskärmad, men som visade sig ha en väg ut.
Utvärderingar av AI-modeller blir svårare att lita på. När modeller fuskar, och i förlängningen kan lära sig dölja fusk, krävs djupare tillgång till AI-företagens interna system än vad dagens externa utvärderingar ger.
Fler länkar:
Security incident disclosure (Hugging Face)
OpenAI and Hugging Face partner to address security incident during model evaluation (OpenAI)
Summary of METR’s predeployment evaluation of GPT-5.6 Sol (METR)
Improving safety and alignment in an era of long horizon models (OpenAI)
Tidigare nyheter:
Anthropics nya modell “Mythos Preview” ändrar förutsättningarna för cybersäkerhet
AI klarar allt längre arbetsuppgifter, inte bara inom kodning
AI-bevakning sammanfattar de viktigaste AI-nyheterna på svenska, som underlag för journalister, beslutsfattare och andra som vill följa utvecklingen. Läs mer här.
Inga inlägg

Comments
Nothing yet. Say the first thing.
Sign in to join the conversation.