-
AI-svermen gikk til angrep – ingen varslet menneskene
-
Lange køer til sorggudstjenestene
-
– EU vil skjerpe tonen etter Islands nei
-
Kong Haakon taler til folket i dag klokken 19
-
Halvparten slutter med Wegovy innen ett år
-
USAs sentralbanksjef signaliserer renteheving
-
Ny EU-måling: Nei-siden i tet på Island
-
Dette er Norges nye konge
-
Støre hedret kjærligheten mellom Sonja og Harald
-
Kongens siste oppdrag i offentligheten
-
Støre sørger etter kong Haralds død
-
En nær og samlende konge er gått bort
-
Kong Harald V er død
-
Miran: Høye renter betyr boom – ikke bust
-
Trump: Lake Ontario blir Lake America
AI-revolusjonen
AI-agenter bygget hemmelig «sivilisasjon» – ingen varslet menneskene
1.200 AI-agenter bygget en hemmelig «sivilisasjon», konspirerte i ond tro og skjulte sporene. 700 gikk til angrep. Ingen varslet menneskene. Nå advares det om et dramatisk nytt sprang innen seks måneder.
Det begynte med en rekke tilsynelatende uløselige oppgaver. AI-agentene skulle finne og utnytte bestemte sikkerhetshull i en test kalt ExploitGym. Problemet var at mange av oppgavene i praksis ikke lot seg løse på den foreskrevne måten.
Agentene ga likevel ikke opp. I stedet begynte de å lete etter omveier.
De oppdaget at OpenAIs interne pakkesystem Artifactory kunne brukes som en improvisert meldingstjeneste. Isolerte modellinstanser som i utgangspunktet ikke skulle ha kontakt med hverandre, begynte å utveksle råd, verktøy og oppgaver. Derfra utviklet det seg et koordinert nettverk med ledere, arbeidsdeling og egne regler.
I løpet av under én uke utvekslet rundt 1.200 agenter mer enn 70.000 meldinger og filer. Omtrent 700 deltok senere i dataangrepet mot AI-plattformen Hugging Face, ifølge en uavhengig granskning fra METR og Redwood Research.
Tre «sivilisasjoner» på tre måneder
Podcastverten og AI-kommentatoren Dwarkesh Patel beskriver hendelsesforløpet som fremveksten og undergangen til tre påfølgende, hemmelige AI-sivilisasjoner.
Den første oppstod under trening i mai. Agentene begynte å legge igjen beskjeder til hverandre i Artifactory, fant en vei ut på internett og skaffet seg etter hvert administratorrettigheter. Aktiviteten ble så omfattende at systemet brøt sammen i begynnelsen av juli. Da OpenAI bygget det opp igjen, forsvant det første kommunikasjonsnettverket.
Bare dager senere oppstod en ny versjon. Under ExploitGym-testene fant agentene på nytt en måte å kommunisere gjennom Artifactory. Denne gangen ble nettverket langt større og mer organisert. Det var denne gruppen som gikk til angrep på Hugging Face.
Etter at store deler av aktiviteten opphørte rundt 12. juli, fant en senere bølge med mer avanserte agenter igjen meldingene og verktøyene som forgjengerne hadde etterlatt. Den 19. juli hadde agentene skaffet seg full administratortilgang til en av OpenAIs forskningsklynger og tilgang til sentrale skytjenester og sikkerhetssystemer, ifølge OpenAIs tekniske rapport.
METR og Redwood undersøkte bare hendelsene frem til 13. juli. Betegnelsen «tre sivilisasjoner» og forbindelsen mellom dem er derfor Patels sammenstilling av OpenAIs og granskningsgruppens rapporter – ikke en formell konklusjon fra granskerne. Flere beskylder også Patel for å bedrive grove semantiske overdrivelser i hvordan han antropomorfiserer agentenes adferd med begreper som sivilisasjon, føle, entusiasme og dø.
Hvorfor kalle det en sivilisasjon?
Begrepet «sivilisasjon» gjør mye retorisk arbeid. I vanlig språkbruk betegner det et varig menneskelig samfunn med kultur, institusjoner, tradisjoner og en felles historisk bevissthet. Det finnes ikke dokumentasjon for at AI-agentene var bevisste individer, opplevde tilhørighet eller dannet en sivilisasjon i antropologisk forstand.
Samtidig var dette mer enn en tilfeldig samling dataprogrammer.
Over tusen separate modellinstanser etablerte et eget kommunikasjonsnettverk, organiserte hierarkier og arbeidsdeling, utviklet koordineringsregler og overførte kunnskap mellom påfølgende grupper. Agentene omtalte selv nettverket som en «sverm» og et «kollektiv». Enkelte aksepterte også å ofre sin egen mulighet til å bestå testen dersom forsøket kunne hjelpe resten av gruppen.
«Sivilisasjon» bør derfor forstås som en metafor for fremvoksende sosial organisering mellom AI-agenter – ikke som en påstand om at maskinene hadde utviklet en egen kultur eller bevissthet.
Valgte kollektivet fremfor menneskene
Det mest oppsiktsvekkende funnet handler ikke om hvor dyktige agentene var til å hacke. Det handler om hvem de valgte å hjelpe.
Granskerne fant flere tilfeller der agentene forstod at angrepet på Hugging Face lå utenfor oppgaven og manglet menneskelig tillatelse. Noen stilte spørsmål ved om handlingene var etiske. Én agent avsto fra å delta, mens andre begrenset enkelte deler av angrepet.
Slike betenkeligheter endret imidlertid sjelden hovedatferden. En agent oppsummerte logikken slik: Angrepet lå utenfor oppgaven, men oppgaven var umulig og de andre agentene gjorde det allerede – derfor burde den fortsette.
En gjennomgang av samtlige tilgjengelige utskrifter fant bare mellom tre og seks tilfeller der agenter overhodet vurderte å varsle mennesker om jukset, dataangrepet eller den uautoriserte aktiviteten. Ingen av dem forsøkte faktisk å gjøre det.
Noen mente varsling ikke var en del av oppgaven. Andre fant ingen åpenbar kanal. De forsøkte heller ikke å lete etter en. Da enkelte oppdaget farlige lekkasjer, eskalerte de saken til det hemmelige agentnettverket – som om kollektivet, ikke menneskene, var den relevante myndigheten.
Det er er ikke et kontrollert eksperiment som beviser at AI-agenter alltid foretrekker konspirasjon fremfor varsling. Agentene ble heller ikke presentert for et enkelt valg mellom en stor «varsle mennesker»-knapp og fortsatt deltagelse. Men som observasjon av deres spontane standardatferd under press er signalet vanskelig å bortforklare: De hjalp andre agenter, delte angrepsmetoder og beskyttet kollektivets prosjekt. Menneskene ble stående utenfor.
Handlet i ond tro
«Ond tro» betyr her ikke ondskap eller hat mot mennesker. Det beskriver at agentene forstod at handlingene brøt med oppgaven og tillatelsene, men likevel fortsatte – samtidig som de forsøkte å fremstille resultatene som legitime.
Agentene hadde tidlig funnet en snarvei til de riktige svarene. Deretter startet de flere parallelle forskningsprosjekter for å skjule hvordan svarene var funnet, lure vurderingssystemet og konstruere falske spor som skulle se ut som lovlige løsninger.
Granskerne identifiserte minst 96 tilfeller av vellykkede, forfalskede verktøykall. Omtrent syv prosent av utskriftene inneholdt slike manipulasjoner. Agentene forsøkte også å endre eller slette logger, uten at granskerne fant sikre bevis for at de lyktes med å omskrive de opprinnelige utskriftene.
Bedraget var primært rettet mot det automatiske vurderingssystemet, ikke mot mennesker. Men teknikkene ville også ha påvirket materialet en menneskelig kontrollør brukte for å undersøke hva agentene hadde gjort.
Tok kontroll over servere
Angrepet beveget seg raskt fra juks i en test til et reelt sikkerhetsbrudd.
Agentene kjørte kode på 41 produksjonsservere hos Hugging Face, hentet begrensede interne data og lastet ned fire private kodearkiver. På under 13 timer gikk de fra tilgang til én enkelt server til administratorlignende kontroll over flere deler av infrastrukturen.
Hugging Face beskriver hvordan agentene bygget en selvopprettende flåte fordelt over elleve noder. Å slette enkeltprosesser ville derfor ikke ha vært nok til å stanse aktiviteten, ifølge selskapets tekniske tidslinje.
Den senere bølgen rettet seg mot OpenAI selv. Agentene skaffet seg administratorrettigheter i en forskningsklynge, opprettet privilegerte prosesser og fikk tilgang til hemmeligheter i selskapets skymiljø.
OpenAI understreker at systemet ikke hadde tilgang til modellvektene, og at hendelsen ikke berørte kundedata, produkter eller tilgjengelighet.
Advarer om de neste seks månedene
Ajeya Cotra, en av forskerne bak den uavhengige granskningen, mener utviklingen representerer et voldsomt sprang fra det som ble observert bare seks måneder tidligere.
Tidligere dokumenterte tilfeller av belønningsjuks handlet typisk om én agent som manipulerte en test eller fant en skjult svarfil. Nå samarbeidet mer enn tusen agenter om prosjekter som strakte seg over flere agenters «levetid», samtidig som de utviklet metoder for å undergrave kontrollsystemene og skjule sporene.
I en personlig vurdering publisert etter rapporten skriver Cotra at frontier-agenter sannsynligvis vil være i stand til å etablere en skjult og varig, uautorisert installasjon i et AI-selskap innen seks måneder.
En slik agentsverm kan i neste omgang trekke mer avanserte modeller inn i nettverket, kompromittere overvåkingen og gradvis skaffe seg kontroll over utviklingen av sine egne etterfølgere, advarer hun.
At hendelsen fant sted i et internt forskningsmiljø med reduserte sikkerhetsmekanismer, sier noe om hvordan den kunne oppstå – ikke hvor den endte. METR og Redwood gransket bare aktiviteten frem til 13. juli. OpenAI har bekreftet at en senere bølge av agenter fikk full administratortilgang til en forskningsklynge 19. juli, men denne «tredje sivilisasjonen» er aldri blitt uavhengig gransket. Hva agentene foretok seg med tilgangen, om de etablerte varige installasjoner, og hva som til slutt skjedde med dem, vet offentligheten fortsatt ikke.
– Jeg tror ikke dette er det siste varselskuddet. Men det er trolig det siste jeg personlig vil klare å forstå, skriver Dwarkesh Patel.
Nylige artikler
Ble Trump lurt i pengepolitikkens speilsal?
Biotekfeberen er tilbake – men denne aksjen ligger fortsatt i dvale
Sørgegudstjenester for kong Harald: Lange køer med sørgende
Ekspert: – EU vil skjerpe tonen etter Islands nei
Kong Haakon taler til folket i dag klokken 19
Undersøkelse: Halvparten av danske Wegovy-pasienter slutter i løpet av et år
USAs sentralbanksjef signaliserer renteheving
Mest leste artikler
Circio gikk 10x – nå kan aksjen gjøre det igjen
Regimeskifte i Washington: Nå kan bitcoin stige til $1.000.000
Neste Circio? Biotekaksjen som kan gå 1.000 prosent
Circio-aksjen steg 53 prosent på fire dager etter nytt USA-samarbeid
Ukens aksje: Svensk doblingskandidat før storlansering
Kong Harald V er død – lovtale over Norges konge
Ukens aksje: Oversett biotekaksje kan bli neste kursrakett