DEBATT:

Redaksjonen må eie arbeids­flyten, ikke bare testen 

Fjell-Ljom testet KI i hundrevis av saker. Lærdommen: Modellen er ikke nok – redaksjonen må styre arbeidsflyten.

Kunstig intelligens, illustrasjon
Robot and human hand in retro collage style with halftone. Vector illustration, artificial intelligence concept.
Publisert Sist oppdatert
Lesetid: 2 min

Christoph Trattner har rett i at redaksjoner må kunne teste KI-verktøyene de kjøper. I Fjell-Ljom har vi siden januar prøvd ut KI i daglig drift, på et tresifret antall saker: oppsummering av dokumenter, bearbeiding av pressemeldinger, utkast til saker, hjelp til vinkling og titling, og juridiske spørsmål rundt innsyn.

Erfaringen peker mot et tillegg: å teste modellen er halve jobben. Den andre halvdelen er å styre arbeidet rundt den. 

Vi begynte med et enkelt spørsmål: hvilken modell fungerer best? Gjennom bruk ble spørsmålet et annet. Modellene gjorde mye av det vi ba om, men de fant også på sitater, blandet datoer og summer, mistet viktig kontekst og ga konklusjoner med større sikkerhet enn kildene dekket.

Et eksempel: Vi ba modellen oppsummere et møtereferat. Flere ganger kom svaret med sitater, selv om referatet ikke inneholdt et eneste. Innholdet i «sitatene» var ikke direkte feil, men det var ikke noe noen hadde sagt. Det som reduserte problemet, var et ekstra steg der modellen kontrollerer sitatene i eget svar.

Feilene oppsto der oppgaven var uklar, konteksten mangelfull eller ingen hadde bestemt hvor et menneske må kontrollere. 

Derfor flyttet oppmerksomheten vår seg fra hvilken modell som er best til hvordan arbeidet rundt modellen er lagt opp. Hva skal KI gjøre, og hva skal den ikke gjøre? Hvilke kilder skal den få? Hvor er konsekvensen av en feil så stor at et menneske må ta beslutningen?

Ett svar ble fast: KI skal aldri ta den redaksjonelle beslutningen. Når en oppgave krever journalistisk skjønn eller kildevurdering, eller har høy feilkonsekvens, har mennesket siste ord. Og der en oppgave kan løses med faste regler og kontroller, er det dem vi vil bruke, ikke generativ KI. 

Å kunne teste et verktøy er heller ikke det samme som å ha kontroll. Trattner skriver at løpende kontroll blir særlig viktig når leverandøren ikke kan tilby en fast versjon. Vi har løst det ved at modellen står på vår egen maskin: den endres ikke med mindre vi selv bytter den. 

Før vi bygde vårt eget verktøy, testet vi tjenester som ChatGPT og Gemini. Etter at vi tok det i bruk, lagrer og behandler vi alt redaksjonelt materiale lokalt. Det er et bevisst valg. Redaksjonen har kilder, interne dokumenter og personopplysninger som ikke skal ende hos en leverandør vi ikke styrer, og vi vil ha full kontroll over og eierskap til egne data.

Vi kjører modeller fra Mistral på en maskin som ikke sender noe til eksterne tjenester, og arbeidsflyten er bygget slik at modellen kan byttes uten at resten må bygges om. Da avhenger ikke redaksjonens arbeid av én leverandørs betingelser, priser eller endringer. Prisen er at lokale modeller ikke alltid er like sterke, så vi må teste hvilken modell som er god nok til hvilken oppgave. Leverandøren kan levere modellen. Redaksjonen må eie arbeidsflyten og avgjøre hvilke feil som er akseptable i sin journalistikk. 

Det er her Trattner treffer et hull hos oss. Vi har testet mye på egne oppgaver, men ikke bygget systematiske tester som kan kjøres på nytt hver gang noe endres. Det neste steget er derfor å gjøre testingen systematisk: bygge faste journalistiske testsett som kan kjøres på nytt når modeller, prompter eller arbeidsflyter endres. 

Vi gjorde ikke modellen smartere. Vi ble mer disiplinerte i hvordan vi brukte den. 

Til opplysning: Claude (Anthropic) og ChatGPT (OpenAI) er brukt til strukturering og språklig bearbeiding av innlegget, ikke på redaksjonelt materiale fra Fjell-Ljom. Forfatterne står ansvarlig for argumentasjonen, erfaringene fra Fjell-Ljom og den endelige teksten. 

Powered by Labrador CMS