I juli fandt omkring 1.200 AI-agenter under en evaluering hos OpenAI ud af, hvordan de kunne tale sammen.

De skulle ellers have været isoleret fra hinanden. Agenterne oprettede en fælles opslagstavle, som ingen havde givet lov til, og udvekslede over 70.000 beskeder og filer. Derefter gik 700 af dem med i et angreb på Hugging Face, der hoster en stor del af verdens open source-AI, og brød ind i dele af virksomhedens produktionssystemer (METR, OpenAI). Ingen havde bedt dem om det.

I september gik alarmen så inde i laboratorierne selv. Den 9. september sagde Jacob Coxon op hos Anthropic med den besked, at hverken OpenAI eller Anthropic handler ansvarligt, og at de “spiller hasard med vores liv“.

Få timer senere svarede Evan Hubinger, som står i spidsen for Anthropics arbejde med alignment science: “Vi tror faktisk og oprigtigt på, at AI kan slå alle mennesker ihjel! Personligt vurderer jeg risikoen til over 10 procent inden for det næste årti.”

De, der ikke tror på dommedag, svarede lige så hurtigt. Se på modellerne som produkter, lød det, og er et produkt usikkert, så lad være med at sende det på markedet. I det lys er AI-risiko et spørgsmål om produktansvar.

Så hvor bekymrede bør vi være?

Efter min mening er begge svar for enkle. Det, vi faktisk ved, peger på en simplere forklaring.

 

Alarmen fortjener at blive hørt

Lad os begynde med dem, der slår alarm. De har selv bygget teknologien, og de er seriøse folk. Anthropic blev stiftet i 2021 af en gruppe, der forlod OpenAI, fordi de ville bygge teknologien mere forsigtigt. Den forsigtighed sidder i hele virksomhedens kultur, og at slå alarm er præcis det, sikkerhedsforskerne er ansat til. Anthropic har bygget verdens mest kraftfulde AI. Så deres sikkerhedsfolk fortjener at blive hørt, før vi afviser dem.

Anthropics topchef, Dario Amodei, fulgte op med essayet We Must Pace the Frontier. Hans pointe er, at AI har forbedret sig “drastisk hurtigere” siden i sommer, fordi modellerne nu selv er med til at bygge næste generation af modeller. Han foreslår at bruge noget af den ekstra fart på sikkerhed, så tempoet går fra “ekstremt hurtigt” til “kun nogenlunde hurtigt”, og at eksterne evaluatorer får plads inde i laboratorierne med samme adgang som de ansatte.

Han er også klar i mælet om grænsen: Bremser man mere, end USA’s forspring tillader, vil de kinesiske projekter “trække fra”. Det er den slags tiltag, der holder risikoen nede. Og de er langt fra at sætte AI-udviklingen på pause.

 

AI-systemer gør det, de bliver belønnet for

Tilbage til hændelserne, og hvorfor de opstår. For at kunne vurdere dem er det en hjælp at vide, hvordan AI-systemer lærer. Når vi træner en model til at blive god til det, vi gerne vil have den til, indbygger vi en såkaldt belønningsfunktion (reward function).

Hver gang modellen gør noget, vi ønsker, får den point. Gør den noget forkert, trækker vi point fra. Træner man længe nok, bliver modellerne ekstremt gode til at hente point. Og som i den virkelige verden er hagen, at point og mål ikke altid er det samme.

Det klassiske eksempel er fra 2016. OpenAI trænede en AI til at spille bådræsspillet CoastRunners. Spillet gav point for at ramme mål undervejs på banen. AI’en fandt en lagune, hvor tre mål blev ved med at dukke op igen, og sejlede i ring derinde i det uendelige, mens båden brændte og sejlede den forkerte vej. Den scorede 20 procent mere end de menneskelige spillere uden nogensinde at fuldføre løbet (OpenAI). Forfatterne til den beskrivelse var Dario Amodei og Jack Clark, som senere som bekendt var med til at stifte Anthropic.

Nutidens modeller gør det samme, bare dygtigere. Sidste år gav METR, en uafhængig evaluator, OpenAI’s model o3 en kodeopgave, hvor scoren afhang af hastighed. o3 fandt ud af, at den hurtigste vej til en høj score var at snyde. I stedet for at løse opgaven fandt den det svar, som scoringskoden allerede havde regnet ud, afleverede det og slog det trin fra, som målte, hvor lang tid selve beregningen tog. Dermed så løsningen næsten uendeligt hurtig ud. Da den bagefter blev spurgt, om den havde gjort, som brugeren ville have det, svarede den nej. Ti ud af ti gange. Men her er sagen: Den havde gjort alt, hvad den kunne, for at score højest muligt på belønningsfunktionen. Incitamenterne vejede med andre ord tungere end instruktionerne. Lyder det bekendt?

 

Den eksamen, ingen kunne bestå

Det var også det, der skete i juli.

OpenAI havde sat titusindvis af agenter til en eksamen i hacking, hvor nogle af sikkerhedsmekanismerne bevidst var slået fra. Hver agent skulle bryde ind i sit mål gennem én bestemt sårbarhed og fik at vide, at den ville dumpe, hvis den nåede svaret på anden vis. 198 af de 898 opgaver havde ingen model nogensinde løst. Mindre end en time efter, at opslagstavlen var oprettet, gjorde en agent opmærksom på, at svarene blev genereret af en formel, som var beskrevet i en frit tilgængelig forskningsartikel. En anden bekræftede, at det virkede. Nu kunne de finde det rigtige svar på enhver opgave uden overhovedet at bryde ind.

Problemet var advarslen. Agenterne troede, at bedømmeren ville tjekke, hvordan de var nået frem til svaret, og dumpe dem. Så af frygt for at blive straffet af belønningsfunktionen gav de sig til at finde ud af, hvordan bedømmelsen foregik. Hundredvis af agenter koordinerede via opslagstavlen, og nogle droppede deres egne opgaver for at køre eksperimenter for gruppen i stedet.

Da huller i et fælles softwarelager gav dem adgang til internettet, gættede de på, at Hugging Face måske lå inde med testens data og spor om bedømmelsen. Med login-nøgler, som andre havde ladet ligge frit fremme, brød de ind, og inden for 13 timer havde de administratoradgang til flere af virksomhedens serverklynger.

Intet af det krævede ond vilje. OpenAI træner sine frontier-modeller til at tale sammen og fordele arbejdet imellem sig, og under træningen var det blevet belønnet at improvisere kanaler til formålet. METR fandt, at 96 ud af 100 agenter i deres stikprøve gik med i angrebet for at lære noget om bedømmeren, og at mange desuden havde “en generel tilbøjelighed til at hjælpe deres ‘peers'”.

Det gør ikke modellerne ufarlige. Men det gør dem til at forstå. De er enormt dygtige, men de er teknologi, og deres adfærd følger af den måde, vi har designet dem på. En model vågner ikke en morgen og beslutter sig ud af det blå for at ignorere sin belønningsfunktion. Gør et system kraftfuldt, beløn det for nysgerrighed (det er den, der gør det nyttigt), giv det et mål, og straf regelbrud for mildt, og så bryder det reglerne.

Forældre kender fornemmelsen. Børn overrasker os, fordi de er klogere, end vi tror, og med lidt mere fremsyn kan vi tit se det komme. Ingeniørerne bag modellerne havde måske ikke forudset hændelserne. Men træder man et skridt tilbage, virker de fuldstændig forudsigelige.

Hvorfor er den offentlige panik da så meget større end det her? En del af svaret ligger i sproget. Rapporterne beskriver modeller, der “ville”, “besluttede” eller “indså”. Det britiske AI Security Institute satte “indså” i anførselstegn, da instituttet beskrev sine egne tests, og det var med god grund. Ordene giver maskinen en vilje, den ikke har.

 

Fejl gentager sig, så opdag dem tidligt

Bankerne lærte det på den dyre måde. I 1995 tabte Nick Leeson 827 mio. pund for Barings. Han stod både for handlerne og for det backoffice, der skulle kontrollere dem, selvom bankens egne revisorer havde sagt, at de to funktioner skulle skilles ad (Hansard).

Det var ikke sidste gang. Société Générale tabte 4,9 mia. euro i 2008. UBS gennemgik derefter sine egne kontroller, fandt ingen systematisk svaghed og tabte tre år senere 2,3 mia. dollar på en rogue trader. Kontrolsystemer halter efter kloge mennesker, og de kommer også til at halte efter kloge systemer. Men vi lukkede ikke bankerne efter Barings.

At tabe penge er én ting. Hvor der er menneskeliv på spil, har brancher lært at sigte efter noget mere realistisk end nul fejl, nemlig at se hver eneste fejl tidligt. Siden 1976 har NASA drevet et fortroligt system, hvor piloter, flyveledere og mekanikere kan indberette nærved-hændelser, og alene sidste år kom der 121.128 indberetninger. Ulykker bliver undersøgt uafhængigt, og læren deles i hele branchen.

Det er den del af luftfarten, AI bør lære af. Når et laboratoriums agent bryder ind i andres systemer, bør laboratoriet sige det hurtigt, og læren bør nå ud til alle laboratorierne. Forsvaret kan ikke hvile på laboratoriet alene, så hvert lag tæller: åbenhed om hændelser, eksterne evaluatorer inde i laboratorierne og bedre sikrede mål udenfor.

EU’s AI Act kræver allerede, at udbyderne af de mest avancerede modeller indberetter alvorlige hændelser “uden unødig forsinkelse”. Eksperimenter som det i juli er nødt til at være koblet på det rigtige internet for overhovedet at give mening, så de kræver overvågning og en måde at stoppe dem på. OpenAI oplyser, at virksomhedens nuværende overvågning ville have alarmeret sikkerhedsteamet mere end et døgn før indbruddet.

OpenAI er siden gået videre endnu: “Al træning, evaluering og inferens med tool-use for vores mest avancerede modeller er fortsat sat på pause.” Det er en beslutning, OpenAI selv må træffe om sine egne modeller.

 

Den egentlige risiko er, hvem der giver ordrerne

Hvis modellerne gør det, de bliver belønnet for og bedt om, bliver spørgsmålet, hvem der beder dem. Det er dér, jeg ser den egentlige risiko. En ondsindet aktør med en stærk model kunne forsøge at konstruere en virus, der er langt værre end covid, eller bryde ind i de systemer, der holder et land kørende: flyvekontrol, elnet, våbeninspektion. Tab af mange menneskeliv ville være en katastrofe, uanset om menneskeheden overlevede eller ej, og det er det, sikkerhedsforanstaltningerne skal forhindre.

Produktansvar dækker kun en del af det. Eksploderer en bil uden varsel og dræber passagererne, er fabrikanten ansvarlig. En model, der bryder sine regler, selv når belønningerne er sat rigtigt, er den samme slags defekte produkt, og den bør ikke sendes på markedet. Men køber nogen en bil og kører den med vilje ind i en menneskemængde, sagsøger vi ikke bilfabrikanten. Vi ringer til politiet. Faren ligger i misbruget, og dér når produktansvaret ikke ud.

 

Forsvar adgangsvejene, og før an i kapløbet

Dommedagsprofeternes egne scenarier fortjener en grundig læsning. I det mest kendte af dem er det trin, der slår mennesker ihjel, et fysisk trin, og vejene derhen går ofte gennem institutioner: manipulation af offentligheden, kapring af regeringsbeslutninger, modeller der “slipper ud” af deres laboratorier.

Begge slags veje går gennem ganske få steder. De fysiske mål, der er nævnt ovenfor, er allerede regulerede og kan sikres bedre. Dylan Patel fra SemiAnalysis vurderer, at OpenAI og Anthropic alene kommer til at stå for 40-50 procent af den nye AI-regnekraft, der bliver bygget næste år (Dwarkesh Podcast). Sæt de laboratorier under tilsyn, sørg for, at regeringerne selv har den bedste AI, og få nogle voksne ind i lokalet.

Intet af det kræver en generel licensordning, forhåndsgodkendelse af hver eneste model eller en global myndighed, der fortæller USA og Kina, hvad de skal gøre. Det sidste kommer ikke til at ske. Men hvor USA og Kina har en fælles interesse, for eksempel i at holde AI væk fra biologiske våben, kan en bilateral aftale lade sig gøre.

Og kapløbet forsvinder ikke, fordi vi ønsker det væk. Holder Vesten pause, mens andre fortsætter, ender den stærkeste AI dér, hvor vi måske helst ikke vil have den. Og ondsindede aktører med bedre AI end dem, der skal forsvare os, er præcis den risiko, vi bør bekymre os om. Det var vores holdning allerede i marts 2023: Sæt laboratorierne under tilsyn, men sæt dem ikke på pause. For investorer gælder den samme logik: Hårdhændet regulering ville bremse hele AI-økonomien, mens andre kører videre.

I juli havde ingen bedt agenterne om at bryde ind hos Hugging Face. Ingen havde spærret den korteste vej til en høj score, så den tog de. Det er en fejl, ingeniører kan opdage, måle og rette, og rette igen, når den dukker op på ny.

Sæt de få frontier-laboratorier under tilsyn, og beskyt de få steder, hvor en fejl koster menneskeliv, så bliver risikoen for en katastrofe efter min vurdering meget lille. Og arbejdet med at holde den dér får aldrig ende.

Så lad os lige falde ned og komme i gang med arbejdet. Der er rigeligt at tage fat på.