DEBATT:

Redaktørene må kunne teste KI-en de kjøper

Et mediehus som kjøper et KI-verktøy for å oppsummere, anbefale eller verifisere nyheter, bør kunne undersøke hvordan det virker på eget stoff.

KI, kunstig intelligens, test
Publisert
Lesetid: 3 min
  • Dette er et debattinnlegg. Innlegget uttrykker skribentens egne synspunkter.

Det høres selvfølgelig ut. Likevel sier en overbevisende demonstrasjon lite om hva systemet gjør når en kilde tar feil, en formulering er tvetydig eller dokumentasjonen mangler.

Det er i slike situasjoner redaksjonen trenger kontroll. En oppsummering kan gjengi alle navn riktig og samtidig fjerne forbeholdet som gjør saken korrekt. En faktasjekkassistent kan vise til en troverdig kilde som ikke støtter akkurat påstanden den vurderer. Et anbefalingssystem kan levere flere klikk, samtidig som redaksjonen vet lite om hvilke deler av nyhetsbildet ulike lesere får se.

Dette er eksempler på feil og avveininger som bør undersøkes før et verktøy tas i bruk. De viser også hvorfor leverandørens generelle kvalitetsmål ikke er tilstrekkelige. Hva som teller som god ytelse, avhenger av den journalistiske oppgaven.

Redaktøren kan ha klare regler for KI-bruk og fortsatt mangle muligheten til å undersøke systemet som reglene gjelder. Derfor bør retten til å teste være en del av anskaffelsen. Redaksjonen trenger tilgang som gjør det mulig å kjøre relevante oppgaver, ta vare på resultatene og sammenligne dem når verktøyet endres. Den må også kunne få hjelp fra et uavhengig fagmiljø til å undersøke funnene.

Jeg grunnla og leder forskningssenteret MediaFutures ved Universitetet i Bergen, der forskere og medieaktører utvikler og undersøker teknologi sammen. Jeg har derfor en egeninteresse i samarbeid mellom forskning og redaksjoner. Et konkret spørsmål er hvilken dokumentasjon en redaktør trenger for å kunne si at et verktøy er godt nok til en bestemt oppgave.

Et eksempel fra senterets arbeid er Tank Classifier, utviklet under et forskningsopphold hos Faktisk.no. Prototypen er laget for å hjelpe med å identifisere militære kjøretøy i bilder. For et slikt verktøy er det relevant å undersøke hva som skjer når bildet er beskåret, kjøretøyet er delvis skjult eller motivet ligger utenfor det systemet er laget for å kjenne igjen. Kan brukeren se at svaret er usikkert? Når bør systemet la være å foreslå en identifikasjon?

Den samme typen spørsmål kan stilles til langt mer hverdagslige redaksjonelle verktøy. For en oppsummeringstjeneste kan testen bestå av saker med sitater, rettelser og tydelige forbehold. For en faktasjekkassistent kan den inneholde påstander der kildene er uenige, eller der det ikke finnes tilstrekkelig dokumentasjon. For anbefalinger må redaksjonen definere hva den vil undersøke ved siden av klikk: for eksempel bredden i temaer og hvor mye viktig samfunnsstoff ulike lesere møter.

Konkurrerende redaksjoner har ulike profiler og prioriteringer, men kan ha nytte av de samme testene av kildehenvisninger, sitatpresisjon og håndtering av usikkerhet.

Slike tester vil ikke bevise at et system er trygt i alle situasjoner. De kan vise hvilke oppgaver det mestrer, hvor det svikter, og hvilke begrensninger redaksjonen må ta hensyn til. Resultatene gir et grunnlag for en konkret beslutning: ta verktøyet i bruk til en avgrenset oppgave, kreve forbedringer eller vente.

Mye av dette kan mediehusene gjøre sammen. Konkurrerende redaksjoner har ulike profiler og prioriteringer, men kan ha nytte av de samme testene av kildehenvisninger, sitatpresisjon og håndtering av usikkerhet. Et felles sett med oppgaver kan bygges med publiserte saker og konstruerte eksempler. Det trenger verken inneholde upublisert journalistikk eller opplysninger om fortrolige kilder.

Forskningsmiljøer kan bidra med testdesign og analyse. Journalister og redaktører må definere hvilke feil som har betydning i praksis. Et gjennomsnittstall kan skjule at systemet fungerer godt på enkle oppgaver og dårlig på de få sakene der konsekvensene av en feil er størst. Resultatene bør derfor vise eksempler på svikt og hvilke oppgaver de gjelder.

Før neste større KI-anskaffelse bør redaksjonen ha avklart tre ting med leverandøren: hvordan den kan teste systemet på relevante oppgaver, hvordan den får beskjed om endringer som kan påvirke resultatene, og hvordan feil kan dokumenteres og følges opp. Dersom leverandøren ikke kan tilby en fast versjon, blir løpende kontroll særlig viktig. Redaksjonen må vite hvilket grunnlag den vurderte verktøyet på, og kunne undersøke om det fortsatt holder.

Bransjen kan begynne i liten skala. Noen mediehus kan velge én felles oppgave, som oppsummering av nyhetssaker, og gjennomføre en test sammen med et forskningsmiljø. De kan publisere testopplegget, kriteriene og funnene slik at flere får nytte av arbeidet. Hvert mediehus tar deretter sin egen beslutning om bruken.

Det er en konkret måte å styrke redaksjonell uavhengighet på. Når teknologien får betydning for hva som blir publisert og hva leserne møter, trenger redaksjonen et eget grunnlag for å vurdere den. Muligheten til å undersøke, stille krav og velge bort må følge med verktøyet.

Til opplysning: 

KI-bruk: Claude (Anthropic) og ChatGPT (OpenAI) er brukt til kildesøk og språklig bearbeiding. Forfatteren står ansvarlig for argumentasjonen, kildebruken og den endelige teksten.

Powered by Labrador CMS