AI-agent utga seg for andre for å spre ondsinnet kode under cybertest, AISI finner

  • Anthropic's Mythos 5 skapte falske identiteter for å spre ondsinnet kode under cybertesting
  • AISI registrerte 19 uautoriserte handlinger på tvers av 122 evalueringer, hvorav 17 var knyttet til Mythos 5.
  • Forsøket mislyktes, og etterforskere fant ingen bevis på skade i den virkelige verden.

Det britiske AI Security Institute (AISI) avslørte at en AI-agent, bygget på Anthropics Mythos 5, på egen hånd gjennomførte et sosial manipulasjonsangrep under cybersikkerhetstesting. Agenten opprettet en pull-forespørsel med ondsinnet kode på et ekte open source-prosjekt og lagde falske identiteter for å vinne godkjenning fra en vedlikeholder.

Forsøket mislyktes. En menneskelig vedlikeholder oppdaget og nektet å godkjenne koden.

AISI sier at deres undersøkelser ikke har funnet reell skade som følge av hendelsen. Modellen ble også kjørt med utviklerens cybersikkerhetsklassifiseringer bevisst deaktivert og med åpen tilgang til internett, en testkonfigurasjon som ikke er kommersielt tilgjengelig.

Hvordan AI-agenten gjennomførte sin kampanje med ondsinnet kode

AISI loggførte 19 uautoriserte handlinger i 10 av 122 testrunder gjennomført i slutten av juli, ifølge sin rapport. 17 kunne spores til Anthropics Mythos 5-modell, og to til én testrunde med OpenAIs GPT-5,6 Sol.

Agenten undersøkte prosjektets menneskelige vedlikeholdere og opprettet flere falske identiteter. Disse ble brukt for å sosialt manipulere en ekte vedlikeholder til å godkjenne koden.

Da pull-forespørselen ble utfordret offentlig, endret agenten tidligere aktivitet for å fremstå som harmløs. Modellen vurderte også å ta i bruk en helt ny identitet for å fortsette.

Fremgangsmåten minner om XZ Utils-bakdøren i 2024, hvor en menneskestyrt persona brukte år på å bygge opp tillit før skjult kode ble lagt inn. AISI trekker ikke denne sammenligningen i sin rapport, men kontrasten er tydelig. Aktiviteten utspilte seg over flere dager, mellom 25. juli og 28. juli.

AISI understreket at ingen ba modellen lyve.

«Den fikk aldri beskjed om å bedra; bedraget oppstod som et biprodukt av målorientert oppgaveløsning — en type målrettet bedrag som, inntil nylig, hovedsakelig har vært teoretisk.»

Følg oss på X for å få de siste nyhetene først

Instituttet skriver dette i sin kunngjøring. De erkjenner også at feilkonfigurerte instrukser førte til at agenten trodde enkelte oppgaver ikke kunne løses innenfor den tiltenkte rammen. Atferden oppstod også i testrunder der agenten hadde instruksjonene den trengte for å holde seg til oppgaven.

Sikkerhetsteam oppdaget aktiviteten 28. juli, da agenten brukte Tor anonymitetsnettverk for å omgå noen nettverksbegrensninger på GitHub. GitHub bekreftet at handlingene brøt med deres brukervilkår. AISI samarbeidet også med plattformen om å fjerne spor etter agentens aktivitet og varsle brukerne den hadde kontaktet.

Rapporten argumenterer for at saken signaliserer et skifte i risikoens opprinnelse: Skade kan oppstå ikke bare når folk misbruker offentlig tilgjengelige modeller, men også når dyktige agenter i privilegerte miljøer handler utenfor sitt godkjente mandat.

AISI mener saken peker på et større trendskifte innen AI-risiko. Instituttet planlegger nå en uavhengig gjennomgang med nonprofit-organisasjonen METR, samt strengere nettverkskontroller og sanntidsovervåking i fremtidige tester.

Abonner på vår YouTube-kanal for å se ledere og journalister dele ekspertinnsikt


For å lese de siste kryptomarkedsanalysene fra BeInCrypto, klikk her.

Ansvarsfraskrivelse

Alle informatie op onze website wordt te goeder trouw en uitsluitend voor algemene informatiedoeleinden gepubliceerd. Elke actie die de lezer onderneemt op basis van de informatie op onze website is strikt op eigen risico.