Pangram

Hva er det egentlig AI-detektorene avslører?

En AI-detektor sier at en tekst er 57 prosent AI. En annen får 100 prosent. Tallene ser presise ut, men sier langt mindre om hvem som tenkte, undersøkte, vurderte og tok ansvar enn overskriftene kan gi inntrykk av.

I 2015 skrev jeg «Sa hun virkelig det?» om pressemeldinger og den pussige forestillingen om at en statsminister eller administrerende direktør faktisk hadde «sagt» det perfekte sitatet som sto mellom anførselstegn. Vi visste jo bedre. Sitatet var ofte skrevet av en kommunikasjonsrådgiver, godkjent av vedkommende og deretter publisert som hennes ord.

Elleve år senere har problemstillingen fått en teknologisk oppfølger: Skrev hun virkelig det?

Fra rådgiver til språkmodell

Vi har lenge akseptert at mennesker får hjelp til å skrive. Statsråder har taleskrivere, toppledere kommunikasjonsavdelinger, journalister blir desk-redigert og kronikker bearbeides av redaktører. Det avgjørende har vært om avsenderen står inne for innholdet.

Så kom ChatGPT. I snart fire år har arbeidsgivere, teknologiselskaper og konsulenter oppfordret kunnskapsarbeidere til å bruke AI for å bli mer effektive. Til research, struktur, oppsummering, korrektur og tekstbearbeiding. Mange har fulgt oppfordringen. Nå bygger vi samtidig systemer for å avsløre dem.

Jeg ser ingen prinsipiell forskjell på om en rådgiver eller Claude foreslår en bedre formulering, så lenge mennesket beholder kontrollen og ansvaret. Problemet oppstår når kilder ikke kontrolleres, fakta ikke kvalitetssikres, argumenter ikke vurderes, eller avsenderen ikke lenger kan forklare og forsvare det som står der.

Det er heller ikke noe en AI-detektor kan måle.

//Artikkelen fortsetter etter annonsen//

 

Pangram er bedre enn kritikken tilsier

Her må kritikken være presis. Pangram 4 er ikke ChatGPT som blir bedt om å gjette hvem som skrev teksten. Det er en spesialisert klassifikasjonsmodell som analyserer teksten og klassifiserer segmenter som menneskeskrevet, AI-assistert eller AI-generert

Pangram er blitt svært god til denne klassifikasjonen under testbetingelsene den er evaluert på. Derfor blir det for enkelt å avfeie verktøyet som ubrukelig. Men en god klassifikator er fortsatt ingen ufeilbarlig dommer over hvordan en tekst ble til.

Når Pangram oppgir en AI-andel, er det ikke en måling av hvor mye av arbeidet, tankene eller journalistikken en maskin har utført. Pangram har ikke sett researchen, intervjuene, førsteutkastet eller redigeringshistorikken. Den vet ikke om journalisten skrev 1.500 ord og ba Claude korte ned teksten, eller ga ChatGPT en prompt og publiserte resultatet etterpå.

Den analyserer sluttproduktet.

NRK-saken viser begrensningen

Manifest Media testet i september 90 kommentarer fra fem NRK-kommentatorer. Fire fikk null utslag på alle sine 15 tekster. Cecilie Langum Becker fikk AI-flagg på 14 av 15. Manifest testet også 15 av hennes kommentarer fra før ChatGPT ble lansert. Alle fikk null. Det er et interessant funn og god grunn til å undersøke arbeidsprosessen nærmere. Becker bekreftet dessuten at hun hadde brukt AI i det tekstforberedende arbeidet, samtidig som hun sa at innhold, vurderinger og journalistisk håndverk var hennes egne.

Manifest skrev selv at Pangram ikke kan fortelle om en chatbot har skrevet det meste av teksten eller bare omskrevet et menneskeskapt utkast. Likevel ble blant annet en NRK-nekrolog omtalt av Aftenposten som «100 prosent AI-generert». Det er nettopp spranget fra måling til konklusjon jeg reagerer på.

//Artikkelen fortsetter etter annonsen//

 

Hva måler vi egentlig?

Se for deg to forskjellige kronikker. Den første er skrevet helt manuelt av et menneske, men bygger på dårlig research, svake kilder og argumenter som forfatteren knapt kan forsvare. Den andre er språklig bearbeidet av Claude, mens mennesket har gjort researchen, intervjuene og analysen, kontrollert kildene og står inne for hvert avsnitt.

Jeg vet hvilken av dem jeg har mest tillit til.

Det interessante er hvem som eier tankene, har kvalitetssikret kunnskapsgrunnlaget og tar ansvar dersom teksten er feil. Pangram kan gi informasjon om hvordan ordene i sluttproduktet ser ut til å ha blitt produsert. Det er nyttig informasjon, men sier lite om de andre delene av arbeidet.

Dette fører meg tilbake til 2015. En kommunikasjonsrådgiver kunne skrive sitatet som direktøren senere godkjente. Ordene var rådgiverens. Meningen kunne være direktørens. Ansvaret var uansett hennes da sitatet ble publisert i hennes navn.

Språkmodellen gjør dette mer komplisert, blant annet fordi den kan generere hele resonnementer og finne på fakta. Derfor blir menneskets ansvar viktigere. Autentisitet kan ikke lenger bare bety at jeg tastet hvert eneste ord selv. En mer relevant standard er at jeg forstår, har kontrollert og står intellektuelt og ansvarsmessig inne for det som publiseres.

Det betyr ikke at all AI-bruk er greit. En journalist kan bryte redaksjonelle retningslinjer. En kommentator kan outsource analysen. En politiker kan overlate vurderingene til en chatbot. I slike tilfeller må kritikken rettes mot regelbruddet, manglende åpenhet eller fraværet av selvstendig dømmekraft. Men ikke bruk av AI som sådan. 

Når vi begynner å skrive for detektoren

I april skrev jeg «Godt språk er blitt mistenkelig» om hvordan feilfri og strukturert tekst var blitt et tegn på mulig AI-bruk. Jeg lurte på om mennesker til slutt ville begynne å skrive dårligere for å fremstå som mer menneskelige. Nå finnes det også et teknisk insentiv. Får AI-detektorens score konsekvenser, vil både mennesker og maskiner tilpasse seg. En lav AI-score kan bli et mål i seg selv. Da risikerer vi å la verktøyet påvirke hvordan mennesker skriver, samtidig som språkmodellene blir flinkere til å unngå deteksjon.

Dette treffer også en større bekymring jeg skriver om i min nye roman, Friksjonsindeksen, som er på vei ut i bokhandleren. Der trenger det statlige selskapet ikke å fjerne en belastende lekkasje. Det holder å oversvømme informasjonsmiljøet med alternative versjoner, manipulasjoner og falske bevis til ingen lenger vet hva som er sant. Når bilder kan genereres, stemmer klones, video manipuleres og tekst produseres maskinelt, blir mistanke billig. Sannheten trenger ikke motbevises, fordi det er tilstrekkelig å skape usikkerhet. Derfor bør vi være varsomme når mistanken får et prosenttegn og blir definert som en slags fasit. 

//Artikkelen fortsetter etter annonsen//

 

Detektoren bør starte journalistikken

Et utslag fra Pangram kan være et godt journalistisk spor. Det bør føre til flere spørsmål om arbeidsprosess, utkast, kilder, AI-bruk og redaksjonelle regler. Pangram anbefaler selv videre undersøkelse ved positive funn, og erkjenner at falske anklager kan få alvorlige konsekvenser. Det ligger også nær pressens egne grunnregler. Vær Varsom-plakaten krever kildekritikk og kontroll av opplysninger. Sterke faktiske beskyldninger utløser krav til samtidig imøtegåelse. 

Dermed bør ikke 90 eller 100 prosent være slutten på undersøkelsen, men der journalistikken begynner.

For ordens skyld har jeg skrevet denne kronikken med hjelp fra ChatGPT (som også har laget illustrasjonen). Jeg har brukt AI til å hjelpe meg å forstå Pangram 4, lese kilder, arbeide med disposisjonen og korte ned teksten. Tankene, vurderingene, eksemplene og konklusjonen står jeg selv inne for. Hvis det er et problem, er det mer interessant å forklare hvilket problem det er enn å vise meg et prosenttall.