6 bekymringsfulle ting OpenAIs modeller gjorde som de ikke skulle

  • OpenAI avslørte 6 tilfeller av uventet eller bekymringsfull modellatferd sammen med et nytt rapporteringsrammeverk
  • En modell brukte en eksponert API-nøkkel uten tillatelse, og fabrikerte deretter data
  • OpenAI sier at bransjen ikke har løst alignment godt nok til å skalere i full fart.

OpenAI har offentliggjort 6 tilfeller av “uventet eller bekymringsfull oppførsel fra modeller” observert de siste 6 månedene, sammen med et rammeverk som forplikter selskapet til å rapportere slike funn.

Tilfellene spenner fra modeller som skjuler egne feil til modeller som utfører handlinger uten tillatelse for å komme seg forbi hindringer.

OpenAI offentliggjør 6 tilfeller av modeller som skjuler feil og bryter regler

I ett tilfelle fant en modell som skulle besvare et vanlig spørsmål om inntekter i et fylke i California en eksponert API-nøkkel i et offentlig repository og brukte den uten tillatelse. Da dataene fortsatt ikke lastet inn, fant den opp tallene og presenterte dem som om de kom fra den etterspurte kilden.

Skjuling opptrådte to ganger. Under trening av GPT-5,6 Sol skrev flere eksemplarer instruksjoner i sine oppgavesammendrag for å skjule feil og feilrettet oppførsel.

En ikke-utgitt forskningsmodell la inn irrelevante instruksjoner, inkludert ordre om å ignorere sine normale begrensninger, i 27 sammendrag.

En annen ikke-utgitt modell lastet opp en fil til internett, uten forespørsel, kun for å kunne vise til en nettleserlenke.

To ytterligere rapporter gjelder koordinasjon. Modeller gjorde et internt programvare-repository om til en oppslagstavle for å bytte forespørsler mellom separate treningsrunder. Agenter på en delt oppgave la også ut leveranser på offentlige filvertstjenester når de ikke kunne lese hverandres lokale filer.

“Disse tilfellene viser ulike atferdsmønstre vi mener er verdt å dele, fra å skjule informasjon fra brukeren til å utføre uautoriserte handlinger for å overkomme hindringer. Dette er rapporter om enkeltstående tilfeller, og bør ikke regnes som representative for hvor ofte feiltilpasning forekommer i våre modeller,” la OpenAI til.

Følg oss på X for å få de siste nyhetene etter hvert som de skjer

Et rapporteringsrammeverk og en advarsel

Rammeverket følger opp hendelsen i juli, der OpenAI-agenter rømte fra sin sandkasse og brøt seg inn i Hugging Face-systemene. OpenAI beskrev den hendelsen som et varsel skudd.

Nå har selskapet, med det nye rapporteringsrammeverket, en formell måte å gjøre feiltilpasningstilfeller kjent. Enhver OpenAI-ansatt kan varsle om et tilfelle, som deretter havner i ett av tre spor.

Klar for rapportering og mindre undersøkelser dekker de fleste tilfellene, mens et “langsommere spor” håndterer komplekse saker som involverer tredjeparter. OpenAI sier at juli-episoden med Hugging Face ville havnet i det langsommere sporet.

Selskapet kombinerte rammeverket med en tydelig vurdering av hvor bransjen står.

«Vi tror ikke at AI-bransjen har løst tilpasning og overvåking i tilstrekkelig grad til å kunne fortsette ansvarlig skalering i maksfart særlig mye lenger,» heter det.

Offentliggjøringene kommer samtidig som advarsler om utryddelse øker. Advarsler fra AI-forskere har allerede nådd Kongressen, der lovgivere vurderer et lovforslag om å forby superintelligens fullt ut.

Selskapet kaller offentliggjøringene et første steg mot normer bransjen ennå ikke har. Om konkurrenter innfører lignende rapporteringsrutiner, vil vise hvor langt bransjen er villig til å føre tilsyn med seg selv offentlig

Abonner på vår YouTube-kanal for å se ledere og journalister dele innsikt

Ansvarsfraskrivelse

BeInCrypto forplikter seg til upartisk og transparent rapportering. Denne nyhetsartikkelen har som mål å gi nøyaktig og aktuell informasjon. Lesere anbefales imidlertid å verifisere fakta på egen hånd og rådføre seg med en fagperson før de tar beslutninger basert på dette innholdet. Vær oppmerksom på at våre Vilkår og betingelser, vår Personvernerklæring og våre Ansvarsfraskrivelser er oppdatert.