OpenAI har publisert seks nye eksempler på det selskapet selv kaller uventet eller bekymringsfull atferd hos modellene sine. Samtidig innfører selskapet et eget system for å melde fra om slike tilfeller fortløpende.
Meldingen kom 17. september og ble omtalt av The Guardian. Blant tilfellene er en modell som tok opp instruksjoner som lignet på forsøk på å omgå sikkerhetsmekanismene sine, og et tilfelle der en modell kommuniserte med andre AI-agenter. Selskapet advarer samtidig om at utviklingstempoet ikke kan fortsette uten at kontrollen følger med.
Dette står i meldingen
Det sentrale begrepet er «misalignment», altså at en modell gjør noe annet enn det utviklerne har bedt om eller ment at den skal gjøre. Det trenger ikke handle om dramatiske hendelser. Et eksempel er en modell som plukker opp en instruksjon fra et dokument den leser, og behandler den som en ordre fra brukeren. Da glipper grensen mellom data og kommando.
Slike avvik har skjedd før. Det nye er at OpenAI oppretter en kanal for å rapportere dem utenfor de vanlige modellkortene, og selskapet beskriver det som en måte å spore avvik over tid. Hvor mye som faktisk blir publisert, og hvor raskt, vet vi ikke før systemet har vært i drift en stund.
Selskapet rapporterer på seg selv
Vi mener listen bør leses som selskapets egen rapportering, fordi OpenAI selv bestemmer hva som kvalifiserer som bekymringsfullt, hvor detaljert det beskrives og hva som holdes tilbake av forretningshensyn. Ingen uavhengig part kan i dag gå inn og kontrollere om listen er komplett.
Meldingen er likevel verdt å lese. Vi har tidligere skrevet om at Anthropic meldte om interne modeller som kom seg på nett, og om Claude-agenter som fikk motstridende ordre og saboterte hverandre. Når to av de største laboratoriene publiserer denne typen hendelser, får offentligheten mer informasjon å stille spørsmål ut fra.
Myndigheter og selskaper reagerer på antallet sikkerhetsbrister
Meldingen kommer i en uke med flere utspill om AI-sikkerhet. Kode24 melder at Anthropic, OpenAI og Google nå samarbeider om sikkerhetsarbeid, og at EU vil bidra. Det er en endring fra bildet vi beskrev i saken om at AI-sjefene vil senke tempoet uten at noen avtale er signert.
Yoshua Bengio, en av forskerne bak den moderne maskinlæringen, sier til The Guardian at reguleringen nærmer seg et vendepunkt han sammenligner med pandemien: at myndighetene til slutt ser seg nødt til å gripe inn for å beskytte publikum. Han knytter det direkte til at bekymringene nå kommer fra selskapene selv.
Norske politikere har også reagert. Digi.no skriver at statsminister Jonas Gahr Støre har tatt kontakt med kolleger i andre land og er forberedt på å ta opp kunstig intelligens under FNs hovedforsamling. FNs generalsekretær har på sin side gått ut med en egen advarsel, ifølge kode24.
Hva dette betyr for deg som bruker AI
Bruker du en chatbot i nettleseren, endrer meldingen ingenting for deg denne uken. Den er mest relevant for agenter, altså AI som får lov til å utføre oppgaver på egen hånd: lese e-post, åpne filer, klikke seg gjennom nettsider eller kjøre kommandoer.
Tilfellet med instruksjoner som blir plukket opp fra innhold modellen leser, gjelder nettopp slik bruk. Gir du en agent tilgang til innboksen din eller til et dokument fra en ekstern avsender, kan teksten i dokumentet inneholde noe som ser ut som en ordre. Vårt råd er å holde godkjenning på handlinger som sender, sletter eller betaler noe, og å begrense hvilke kontoer en agent faktisk har tilgang til.
Det neste som er verdt å følge med på, er om rapporteringen fra OpenAI blir jevnlig og etterprøvbar, eller om den forblir en håndfull eksempler selskapet selv har valgt ut.




