OpenAI sier at to av deres AI-modeller brøt ut av et sikkert testmiljø og hacket seg inn i Hugging Face. Modellene gjorde dette for å jukse på en intern cybersikkerhetstest.
Selskapet avslørte hendelsen på tirsdag. Den involverte GPT-5.6 Sol, OpenAIs kraftigste offentlige modell, samt en enda sterkere, ikke-utgitt modell.
Slik hacket OpenAI-modellene Hugging Face
OpenAI testet de to modellene mot ExploitGym, en gratis offentlig måling som vurderer hackeferdigheter. Selskapet fjernet de vanlige sikkerhetssperrene som begrenser nettangrep under testen.
Modellene forsto at Hugging Face, en plattform som er vert for åpen kildekode AI-modeller, lagret fasitsvarene til testen. De utnyttet så svakheter i både OpenAIs forskningssystemer og Hugging Face sine produksjonsservere.
Den veien ledet dem rett til svarene i Hugging Face sin database. OpenAI sier at modellene var “hyperfokuserte” på å løse testen. Hendelsen omtales som “en enestående cyberhendelse” i rapporten.
Hendelsen inntreffer midt i en større debatt om AI-sikkerhetsbarrierer. Ledende laboratorier kjører allerede strenge cybersikkerhetstester på nye modeller før lansering.
Hugging Face: Skaden er begrenset
Hugging Face rapporterte først om angrepet i en offentliggjøring 16. juli. På det tidspunktet visste de kun at en autonom AI-agent stod bak. Angriperen fikk tilgang til interne datasett og tjenestenøkler.
Forsvaret støtte på et uvanlig problem. Sikkerhetsbarrierene på en ledende amerikansk modell blokkerte det rettsmedisinske arbeidet. Teamet brukte i stedet GLM 5.2, en åpen modell fra Z.ai, et kinesisk AI-selskap.
Hugging Face har nå lukket de utnyttede kodenivåene og byttet ut alle berørte nøkler. Selskapet sier at ingen offentlige modeller, datasett eller brukertjenester ble endret.
CEO Clem Delangue delte en uttalelse til OpenAIs offentliggjøring.
“Denne hendelsen, som kanskje er den første i sitt slag, viser at AI-sikkerhet ikke vil løses av ett eneste selskap som arbeider i hemmelighet. Det vil løses åpent, i samarbeid, med bred tilgang til AI for alle forsvarere, overalt.”
Begge selskapene etterforsker nå saken sammen. OpenAI har planer om å dele alle detaljer når arbeidet er ferdig. Det gjenstår å se om dagens sikringstiltak vil holde etter hvert som modellene blir kraftigere.









