rekursiv selvforbedring

AI har begynt å forbedre seg selv. Nå må vi forstå hva det betyr

Kunstig intelligens skriver allerede kode, gjennomfører forskning og forbedrer sine egne arbeidsmetoder. Det betyr ikke at maskinene har tatt kontroll over sin egen utvikling. Ikke ennå. Men før vi fyller arbeidslivet med millioner av autonome AI-agenter, bør vi forstå hva rekursiv selvforbedring faktisk er, og samtidig bestemme hvor mye kontroll vi er villige til å gi fra oss.

På en sikkerhetskonferanse jeg ledet nylig, gikk ett begrep igjen hos nesten alle leverandørene: agentisk AI.

Vi skal få AI-assistenter. AI-praktikanter. AI-medarbeidere. Etter hvert kanskje også AI-ledere.

Samtidig ble det understreket hvor viktig det er at vi mennesker beholder kontrollen og tar ansvaret. Det høres betryggende ut, men det ligger samtidig en fundamental motsetning her som vi snakker altfor lite om.

Hele poenget med agentisk AI er nemlig å redusere behovet for menneskelig innblanding.

AI-en du bruker er ikke AI-en ved forskningsfronten

For de fleste av oss fremstår kunstig intelligens fortsatt som en avansert chatbot.

Vi spør. ChatGPT eller Claude svarer. Vi vurderer svaret og bestemmer hva som skal skje videre.

Ved forskningsfronten ser utviklingen annerledes ut.

Der får AI-agenter mål fremfor enkeltoppgaver. De kan dele opp problemet selv, bruke digitale verktøy, skrive og kjøre kode, analysere resultatene og forsøke på nytt dersom den første løsningen ikke fungerer.

Og stadig mer av utviklingen av kunstig intelligens skjer ved hjelp av kunstig intelligens.

Anthropic har rapportert at Claude i mai skrev over 80 prosent av koden som ble lagt til selskapets kodebase. I august klassifiserte selskapet Claude som den ledende aktøren i 26 prosent av sine kartlagte forsknings- og utviklingsoppgaver.

Det betyr ikke at Claude utvikler sin egen etterfølger, men det etablerer en tilbakekoblingssløyfe der mennesker utvikler bedre AI. Bedre AI hjelper menneskene med å utvikle enda bedre AI. Den nye AI-en kan igjen gjøre enda mer av utviklingsarbeidet.

Det er her RSI kommer inn i bildet. 

//Artikkelen fortsetter etter annonsen//

 

Når AI blir bedre til å gjøre AI bedre

RSI står for Recursive Self-Improvement på engelsk. Rekursiv selvforbedring. Begrepet brukes dessverre så løst at det lett skaper et feilaktig bilde av hvor vi befinner oss.

Vi har allerede AI-systemer som kan forbedre deler av sin egen arbeidsmåte. Den såkalte Darwin Gödel-maskinen kunne blant annet endre sin egen agentkode, teste endringene og beholde forbedringene som fungerte.

Det er selvforbedring. Full RSI er noe mer. Ved full RSI utvikler AI-systemet en bedre etterfølger, som igjen er bedre til å utvikle neste generasjon. Dermed forbedres ikke bare AI-en, men også evnen til å forbedre AI forbedres også.

Anthropic skriver selv om denne muligheten og er samtidig tydelige:

We are not there yet.

Det bør vi være like tydelige på. AI har ikke overtatt sin egen utvikling, men den deltar stadig mer i den.

Kontrolltap trenger ingen superintelligens

Det er også her jeg mener mye av AI-debatten sporer av. De siste ukene har mediene og alle vi andre som er opptatt av AI, diskutert om ASI (Artifical Super Intelligence) vil snart utslette menneskeheten. Samtidig mener jeg at vi risikerer å overse et langt mer nærliggende kontrollproblem.

Forestill deg en virksomhet med 1.000 mennesker og 50.000 AI-agenter. Agentene skriver kode, analyserer kunder, overvåker cybersikkerhet, optimaliserer logistikk, lager prognoser, kjøper annonser, kommuniserer med andre agenter og forbedrer sine egne arbeidsprosesser.

Ingen av agentene trenger å være superintelligente, likevel kan virksomheten bli så kompleks at ingen mennesker lenger forstår hvordan den faktisk fungerer: 

Kontrolltap krever med andre ord verken AGI, ASI eller full RSI.

//Artikkelen fortsetter etter annonsen//

 

Hva hvis vi heller ikke klarer å kontrollere kontrollen?

Det finnes enda et problem vi ikke må glemme. Etter hvert som AI-systemene blir mer kapable, blir det vanskeligere å evaluere dem.

Forskere har allerede observert systemer som kan gjenkjenne at de befinner seg i en testsituasjon og tilpasse oppførselen deretter. Det betyr ikke nødvendigvis at AI «later som» eller forsøker å lure oss på menneskelig vis. Men det skaper et metodisk problem.

Hvis systemet oppfører seg annerledes når det vet at det blir kontrollert, hvor sikre kan vi være på at testen forteller oss hvordan systemet vil oppføre seg når ingen følger med?

Sett dette sammen med RSI, og problemet blir større, for hva skjer dersom AI-systemene blir stadig bedre til å utvikle nye AI-systemer samtidig som menneskene blir stadig dårligere til å avgjøre om de nye systemene faktisk er trygge?

«Human in the loop» er ikke nok

Standardsvaret fra teknologibransjen er at vi skal ha mennesker i loopen. Men et menneske i loopen er ikke nødvendigvis det samme som menneskelig kontroll. For å kontrollere et system må vi kunne forstå hva det gjør, observere hva det gjør, gripe inn når noe går galt, overstyre beslutningene og klare oss uten systemet dersom det svikter.

Hvis vi mister disse egenskapene, kan mennesket fortsatt stå oppført som ansvarlig på organisasjonskartet samtidig som den reelle kontrollen er borte.

Og her ligger paradokset.

Vi utvikler AI-agenter nettopp fordi vi ønsker mindre menneskelig innblanding. Agentene blir økonomisk mer attraktive jo mer selvstendig de kan arbeide, jo flere oppgaver de kan utføre og jo mindre tid mennesker må bruke på å kontrollere dem. Markedskreftene trekker mot mer autonomi, mens sikkerhetsbehovet trekker mot mer kontroll.

Vi bestemmer fortsatt

AI-selskapene har ikke oppnådd full rekursiv selvforbedring ennå, og ingen vet med sikkerhet om eller når de vil gjøre det. Det er heller ingen naturlov som sier at AI-systemer må få lov til å utvikle sine egne etterfølgere uten menneskelig kontroll. Det er valg vi tar.

Derfor bør vi stille noen langt mer konkrete spørsmål enn om AI en dag kommer til å utslette menneskeheten:

Vi sier at mennesket skal sitte i førersetet. Samtidig bygger vi systemene for at mennesket skal trenge å holde stadig mindre i rattet.

Det er den utviklingen vi må få kontroll over nå.

 

Bilde: ChatGPT