Den amerikanske regjeringen satte Kinas nyeste AI-modell på prøve gjennom et hacking-test. Resultatene viser at Moonshot AI sin Kimi K3 ligger langt bak de beste amerikanske modellene.
Center for AI Standards and Innovation (CAISI), et amerikansk byrå, gjennomførte testene sammen med en britisk partner. Resultatene kom bare én dag etter at Washington anklaget Moonshot for å ha bygd Kimi K3 med stjålet amerikansk teknologi.
Kimi K3 underpresterer på amerikanske cybersikkerhetsmål
Handelsdepartementet delte resultatene torsdag. De sa at Kimi K3 havnet langt bak de beste amerikanske modellene, og viser til en felles test med britiske eksperter.
Moonshot lanserte Kimi K3 16. juli. Etterspørselen var så stor at de måtte pause nye registreringer etter bare to dager.
Lanseringen rystet også amerikanske chip-aksjer og førte til nye spørsmål om USAs AI-ledelse.
En test, kalt ExploitBench, bruker ekte Chrome-nettleser sårbarheter utviklet av Carnegie Mellon University. Kimi K3 fikk 32 %. Dette var bedre enn Kinas GLM-5.2 på 24 %. Men den var langt bak de beste amerikanske modellene, som fikk rundt 76 %.
Det vanskeligste steget er å ta full kontroll over en målmaskin. Kimi K3 klarte ikke dette på noen av de 41 forsøkene. De beste amerikanske modellene klarte det på 20.
En annen test, kalt The Last Ones, er et simulert angrep på et bedriftsnettverk med 32 steg. En menneskelig ekspert trenger omtrent 20 timer for å fullføre. Kimi K3 nådde i snitt steg 17. Toppmodellene i USA nådde steg 28,5. Kimi K3 greide å gjennomføre hele testen bare én gang på ti forsøk.
De beste amerikanske systemene rapporteres å ha klart det seks eller sju ganger.
Men forskjellen kan virke større enn den egentlig er
Men tallene forteller ikke hele historien. Rapportens egne detaljer har flere forbehold.
For det første ble de amerikanske modellene testet uten sikkerhetsfiltre. Den innstillingen viser modellens fulle kapasitet. Offentlige versjoner har filtrene på. Derfor er de amerikanske resultatene et best-case scenario, og ikke slik de fungerer i praksis.
Teamet kalte også arbeidet tidlig og begrenset. De testet Kimi K3 kun på én test, og brukte bare deler av testsettet. Derfor er vurderingen usikker. Enkelte tester er også private, så utenforstående ikke kan etterprøve resultatene.
Det finnes også en grunnleggende forskjell. Kimi K3 er en åpen modell som alle kan laste ned. De amerikanske modellene er låste, private systemer. Det britiske instituttet fant at åpne modeller vanligvis ligger fire til sju måneder bak de beste lukkede. De vil gi Kimi K3 full test først når Moonshot slipper den åpent.
Disse testene er heller ikke ekte angrep. Det simulerte nettverket hadde verken menneskelige forsvarere eller noen alarmer. Selv da slo Kimi K3 den forrige beste åpne modellen. Og den greide å fullføre hele angrepet én gang.
Tidsaspektet og kilden stiller også spørsmål. CAISI het tidligere US AI Safety Institute. Trump-administrasjonen ga det nytt navn i juni 2025. Det er del av samme avdeling som regulerer amerikansk chipsalg til Kina. Og rapporten om en kinesisk konkurrent kom bare én dag etter tyveribeskyldningen.
Svake sikkerhetstiltak øker fortsatt risikoen
Likevel betyr ikke lave poeng at Kimi K3 er trygg. Testen viste at modellens sikkerhetsbarrierer ikke stoppet den fra å forsøke å lage hackerverktøy eller angripe systemer.
Dette er viktig med tanke på det som kommer nå. Moonshot planlegger å slippe hele modellen 27. juli. Når den er ute, kan den ikke trekkes tilbake. Hvem som helst kan laste den ned og fjerne sikkerhetsfiltrene.
Testen kommer også etter en påstand om tyveri. Washington hevder at Moonshot bygget Kimi K3 på stjålet amerikansk AI-teknologi. Teknologisjef i Det hvite hus, Michael Kratsios, sa selskapet i hemmelighet kopierte Anthropic sitt Claude Fable 5. Teknikken, kalt distillasjon, trener en ny modell på svarene fra en sterkere modell.
Anthropic støtter påstanden. I februar sporet de over 3,4 millioner Claude-samtaler til Moonshot via hundrevis av falske kontoer. Selskapet advarte om at kopierte modeller mister originalmodellens sikkerhetskontroller. Det er det samme svake punktet som ble funnet i denne testen.
USA bruker fortsatt 23 ganger mer på AI enn Kina. Likevel fortsetter kinesiske laboratorier å tette gapet. Den virkelige testen kommer når Kimi K3 blir tilgjengelig for alle og uavhengige eksperter kan undersøke påstandene selv.








