Kolla alltid var siffrorna kommer ifrån

TL;DR: AI-sammanfattningar ser ofta väldigt trovärdiga ut. Tyvärr är det inte ovanligt att de återger påståenden och siffror rätt, samtidigt som de tappar var de kommer ifrån. Så kontrollerar du siffrorna du tänker använda, och varför det kan löna sig att börja med dina egna frågor.

Schematisk bild: en rapport där frågorna Var, När och Hur är besvarade, och en AI-sammanfattning där När saknas.

All information kommer inte alltid med i AI-sammanfattningar. Kontrollera alltid viktiga påståenden och siffror så att det inte blir fel.

Att låta AI sammanfatta en lång rapport är lockande: Du laddar upp dokumentet, skriver en enkel prompt och får tillbaka en prydlig text med rubriker och siffror. Men hur vet du att siffrorna betyder samma sak i sammanfattningen som i rapporten? Kortfattat: det gör du inte alltid.

AI-sammanfattningar tappar ibland sammanhanget

Inför den här artikeln gjorde jag ett test. Jag bad AI-modellen Gemini 3 Flash sammanfatta en kort rapport från fackförbundet Akavia (Källa: AI i kommunens tjänst) om hur Sveriges kommuner använder AI. Testet var väldigt enkelt: jag laddade upp rapporten som bifogad fil och skrev bara "sammanfatta rapporten", utan några särskilda instruktioner. Efter någon minut fick jag tillbaka en sammanfattning som både såg snygg och rimlig ut. De flesta siffrorna verkade stämma med rapporten, och sammanfattningen innehöll även information om urvalet (de 170 kommuner som svarade på enkäten, av alla landets 290 kommuner). So far - so good, vilket man också kan förvänta sig av en såpass kort rapport (22 sidor).

När jag jämförde siffrorna lite mer detaljerat visade det sig dock att en av dem inte kom från samma undersökning som de andra. Enligt sammanfattningen hade knappt 1 av 10 fackligt förtroendevalda i kommunal sektor varit delaktiga när AI implementerades. Eftersom sammanfattningen inte sa något annat antog jag att siffran kom från samma enkät. I själva rapporten står det dock (i meningen före påståendet) att siffran kommer från "tidigare undersökningar från Akavia". Alltså en annan datakälla med andra tillfrågade, se Figur 1. I det här specifika fallet är kanske inte skillnaden särskilt katastrofal. Men det vittnar ändå om en tydlig risk med att förlita sig blint på sammanfattningar gjorda med AI-modeller.

Siffran i sammanfattningen från Gemini 3 Flash. Samma siffra i Akavias rapport.

Figur 1. Siffran i sammanfattningen (bilden över) från Gemini 3 Flash, och samma siffra i Akavias rapport (bilden under). Notera att meningen före påståendet i rapporten inte följde med.

Fel i sammanfattningar är ofta svåra att se

Siffran var inte påhittad. Den fanns i rapporten och var rätt återgiven. Det som försvann var sammanhanget om var den kom ifrån: vilka som hade tillfrågats, när och hur den hade mätts. Med andra ord, all den information som avgör vad siffran faktiskt betydde.

Det luriga är att sammanfattningen inte såg ut som om något saknades. Sammanfattningen såg tvärtom noggrann ut, och beskrivningen av metod längst ned gjorde att påståendet såg ut att komma från samma enkät som resten. Ingenstans stod det att rapporten även använder siffror från andra undersökningar bland Akavias medlemmar, även om detta gick att läsa i själva rapporten under kapitlet "Om undersökningen".

För att se om det var en slump gjorde jag om testet med ett annat konto i en ny chat. Denna gång kom facksiffran inte med alls, men tyvärr tappade en annan siffra sitt sammanhang i stället. I rapporten svarar fyra av tio av de största kommunerna att AI "i viss mån" används i hela verksamheten. AI-modellen översatte detta till att 40 procent har "en bredare användning över hela organisationen", vilket inte är samma sak. En tydlig lärdom är alltså att det inte är samma siffra varje gång som kan feltolkas, och du kan tyvärr inte veta i förväg vilken det gäller.

Jag märkte dessutom en sak till. När jag ställde följdfrågor i den första chatten kom det detaljer som inte stämde, och när jag bad om ett ordagrant citat från sidan 18 svarade AI-modellen att bara de tre första sidorna hade lästs in, se Figur 2. Om det verkligen stämde är omöjligt att veta, sammanfattningen innehöll ju rätt siffror från sidor långt in i rapporten. I det andra testet var det däremot inga problem med citat. Samtidigt lät båda sammanfattningarna lika säkra på sin sak. Hur säkert ett svar låter säger alltså ingenting om hur mycket av dokumentet det bygger på.

AI-modellens svar på min kontrollfråga om den kunde ge mig ett ordagrant citat på sidan 18.

Figur 2. AI-modellens svar på min kontrollfråga om den kunde ge mig ett ordagrant citat på sidan 18.

Ställ dig samma frågor som för en kollegas arbete

För att få bukt med problemet kan du (än en gång) fundera på hur du själv beter dig mot en kollega som bett dig granska hennes sammanfattning. För min egen del brukar jag tänka såhär: hur mycket jag kontrollerar någon annans siffra beror helt på hur mycket förtroende jag har för personen som gjort beräkningen. Har jag mindre förtroende vill jag kolla det mesta. Har jag mer förtroende kollar jag någon enstaka siffra och lägger sedan mest tid på resonemang, osäkerheter och slutsatser.

Samtidigt känns det lite svårare med en AI-sammanfattning. I exemplen ovan såg alla delarna lika trovärdiga ut, oavsett om de stämde eller inte. AI-modellen sa själv heller ingenting om att vissa siffror kom från ett annat underlag. Med det i bakhuvudet behöver du behandla sammanfattningen som ett arbete från en ny kollega, vars styrkor och svagheter du ännu inte känner. I praktiken innebär detta tre grundläggande frågor till varje siffra du tänker använda. Samma frågor gäller för påståenden:

  1. För vilka gäller siffran? Alla, de som svarade eller en viss grupp?

  2. När samlades datan in? Vid samma tillfälle som resten av underlaget eller tidigare?

  3. Hur mättes den? Till exempel i en enkät där någon själv uppger något (och i så fall vilken enkät)?

Så här gör du i praktiken

Kontrollen behöver inte omfatta allt, bara det du faktiskt ska använda. Så här gör du:

  1. Välj ut siffrorna. Utgå från en sammanfattning du redan har använt eller tänker skicka vidare, och ta bara med de siffror du själv ska använda.

  2. Jämför beskrivningen av underlaget. Läs vad sammanfattningen säger att rapporten bygger på och jämför med rapportens eget avsnitt om metoden (i Akavias rapport låg detta under rubriken "Om undersökningen"). Nämner rapporten fler undersökningar eller förbehåll än sammanfattningen, finns det en risk att någon av dina siffror kommer från en annan källa.

  3. Be om sidhänvisningar. Be AI-tjänsten om sidnummer och ett ordagrant citat för varje siffra. Be den även att ta med meningen före och efter så att du ser allt i ett sammanhang. Notera att detta inte är ett bevis på att allt stämmer; i mitt första test kom det som sagt med detaljer som inte stämde. Se det snarare som en möjlighet för dig att hitta rätt i originalrapporten.

  4. Kontrollera i originalrapporten. Leta upp siffran, läs meningen före och efter och ställ de tre frågorna. Detta är ett sätt att stresstesta siffran.

  5. Använd siffran med sitt sammanhang. När siffran ska användas skriver du ut vilka den gäller, när och hur den mättes. Säger källan inte det, skriver du att det inte framgår. På så sätt har du varit tydlig med vad du vet, och vilka osäkerheter man kan förvänta sig.

Så här kan det se ut med siffran från exemplet:

Notera att kontrollen ibland slutar i ett svar som inte går att få fram; rapporten säger helt enkelt inte när de tidigare undersökningarna gjordes. Då behöver du själv göra en bedömning om det är något du själv kan stå för, eller om du ska låta bli att använda siffran i det du skriver. Hur mycket du i slutändan behöver kontrollera beror självklart på vad sammanfattningen ska användas till, vilket jag skrev mer om i slutet av Granska AI-modellens svar som om det vore din kollegas arbete.

Varför sammanfatta överhuvudtaget?

I dessa AI-tider finns det dock en fråga till som är värd att ställa: varför be om en sammanfattning överhuvudtaget? Akavias rapport hade redan en egen sammanfattning på två sidor, varför inte bara utgå från den? En motsvarande AI-sammanfattning som i exemplen ovan blir dessutom ofta för generell, av samma skäl som jag skrev om i AI är ingen sökmotor. Utan kontext fyller AI-modellen själv i luckorna.

Jag har därför istället börjat ställa de frågor jag själv vill ha svar på i dokumentet, och därefter se sammanfattningen som ett komplement. Med AI kan du nämligen få en sammanfattning som huvudsakligen utgår från de perspektiv som är viktiga för dig. Och skulle du inte veta vilka perspektiv du är mest intresserad av, kan du istället låta AI-modellen ställa frågorna först (precis som i Låt AI ställa frågorna). I samma vända kan du också bygga in de tre kontrollfrågorna direkt i din prompt, så att den slutliga AI-sammanfattningen både blir specifik och kontrollerbar.

OBS! Ladda endast upp offentliga dokument, alternativt använd en AI-modell som din arbetsgivare har godkänt. Ladda aldrig upp personuppgifter eller sekretessbelagd information i en tjänst som inte är godkänd.

Så här såg det ut när jag testade att ställa mina egna frågor till Akavias rapport:

Prompt (Sammanfattningsfrågor baserat på ett hypotetiskt exempel):

Jag arbetar med kompetensförsörjning i en kommun och ska ta fram ett underlag till min chef om AI-utbildning för medarbetare. Svara utifrån den bifogade rapporten på två frågor:

1. Hur har kommunerna utbildat sina medarbetare i AI, och vad vill medarbetarna själva?
2. Hur delaktigt är facket när kommuner inför AI?

För varje siffra du använder: ange vilka den gäller, när den mättes, hur den mättes och på vilken sida den står. Skriv "framgår inte" om rapporten inte säger det.

De två sista meningarna, där de tre frågorna ligger, är de som går att återanvända om du vill anpassa prompten till ett eget exempel. Resten byter du mot din egen roll och dina egna frågor. Räkna med att svaret blir långt, men sidhänvisningarna gör det snabbare att kontrollera (se Figur 3).

Del av svaret från Gemini 3 Flash när frågorna ställs direkt och tjänsten ombeds ange vilka, när, hur och sida för varje siffra.

Figur 3. Del av svaret från Gemini 3 Flash när frågorna ställs direkt och tjänsten ombeds ange vilka, när, hur och sida för varje siffra.

Notera att resultatet i Figur 3 blev mycket mer användbart för det vidare arbetet än den mer generella sammanfattningen i början av artikeln. De flesta siffror redovisades med kontrollfrågorna (dvs. om vilka, när och hur), och för facksiffran skrev tjänsten att det inte framgår när den mättes, se Figur 4.

Samma påstående som i den generella sammanfattningen, men nu med korrekt information om kontrollfrågorna.

Figur 4. Samma påstående som i den generella sammanfattningen, men nu med korrekt information om kontrollfrågorna.

Helt rätt blev det dock inte. Jag körde prompten två gånger, och båda gångerna angav tjänsten ett exakt datum för tre siffror om Akavias medlemmar. Det är ett datum som rapporten inte kopplar till dem.

Sammanfattningsvis kan vi alltså säga att en mer specifik prompt ger ett mer användbart svar, men inte nödvändigtvis ett svar som är mer sant. Även en skräddarsydd sammanfattning är en sammanfattning, så de tre kontrollfrågorna gäller fortfarande för alla siffror eller påståenden du tänker använda.

Har du frågor eller invändningar? Mejla mig gärna. Fler artiklar publiceras efterhand.

Lycka till!

För organisationer

erik@enkelai.net

Nya artiklar direkt i inkorgen

Jag skickar ett mejl när jag publicerar en ny artikel om AI i arbetslivet. Inget annat, ingen reklam.