Granska AI-modellens svar som om det vore din kollegas arbete

TL;DR: Fyra frågor du antagligen redan ställer när du granskar en kollegas arbete, och hur du använder dem på AI-modellens svar.

Illustration: en person med skrivplatta och checklista ställer en fråga till ett moln med texten AI. Molnet svettas.

Granska AI-svaret som du granskar en kollegas utkast: är slutsatsen rimlig, hur stark är den, vilket underlag bygger den på och vilka osäkerheter finns?

Det tar inte lång tid när man pratar om AI-användning innan någon påpekar hur viktigt det är att alltid granska svaren. Men hur gör man det i praktiken? Magkänsla? Kontrollera varje mening i varje svar? Min gissning är att du redan vet hur du ska göra, speciellt om du någon gång har granskat en kollegas arbete eller fått ditt eget granskat. Det vill säga: vanan och kunskapen finns, den har bara aldrig riktats mot AI.

Granska AI-modellen på samma sätt som en kollega

När jag granskar en kollegas eller en nyanställds arbete börjar jag ofta med att ställa mig fyra frågor:

  1. Är slutsatsen rimlig och förväntad? Alltså, stämmer den med det du själv hade gissat eller rentav vet? En slutsats som förvånar kan självklart vara en ny insikt, men den kan också vittna om att resonemanget blivit fel längs med vägen. Båda två anledningarna är skäl att titta närmare på delar av arbetet. När du arbetar med en AI-modell finns dessutom en till fälla (Källa: Anthropic): har du i frågan redan avslöjat vad du tror (exempelvis genom en ledande fråga), kan modellen bygga sitt resonemang för att hålla med dig. Att svaret stämmer med din gissning säger då mindre än när en kollega kommit fram till samma sak på egen hand.

  2. Hur stark är slutsatsen i förhållande till resultatet? Det är lätt att göra misstaget att hoppa från enskilda observationer till generella principer, både för människor och för en AI-modell.

  3. Vilket underlag har de utgått ifrån? För en medarbetare kan det vara vetenskapliga artiklar, myndighetsrapporter, nyhetsartiklar eller rena inlägg på sociala medier. För en AI-modell kan det på samma sätt vara ett dokument du gav den, en sökning den gjort på webben eller bara den data modellen har tränats på. Om svaret bara bygger på det modellen tränats på finns det inget underlag att kontrollera emot. I det fallet kan svaret låta rimligt utan att stämma.

  4. Vilka osäkerheter har de redovisat? Att känna sig säker på sin sak är mänskligt och vi har alla en tendens att vara övertygade om våra egna slutsatser. Liknande tendenser kan du ibland se i AI-modeller, och som jag skrev i AI är ingen sökmotor säger AI-modellen sällan till om något är osäkert om du inte ber om det explicit.

Notera att ingen av frågorna kräver att du kan ämnet bättre än den vars arbete du granskar. Det handlar snarare om ett kritiskt förhållningssätt kring hur resultatet och slutsatsen har kommit till, inte om du själv vet svaret. Den första frågan kräver förvisso att du har en förväntan, men de tre andra fungerar även när du frågar AI om något du inte kan själv.

Det finns dock en viktig skillnad. Med en kollega kan du ställa kontrollfrågorna direkt och få ett svar. Det kan du förvisso med AI också, men svaret du får är baserat på sannolikhet. När du ber AI-modellen motivera sitt svar skriver den motiveringen i efterhand, och den kan låta helt rimlig utan att vara det som faktiskt låg bakom svaret. Det kan alltså vara en efterkonstruktion. Till exempel har Anthropic, företaget som utvecklar AI-tjänsten Claude, visat att en av deras modeller ibland gör en sak men säger en annan. Till exempel om man frågar hur den räknar ut 36 + 59 beskriver den skolmetoden med minnessiffror, samtidigt som modellen gör på ett helt annat sätt (Källa: Anthropic).

På grund av detta räcker det sällan med att be om en generell motivering för slutsatsen eller arbetet som helhet. Istället behöver vi be AI-modellen bryta ned sitt resonemang i de resultat, antaganden och villkor den utgått ifrån. Först då går det att kontrollera varje länk i kedjan själv, och avgöra om du håller med i resonemanget. Oavsett hur modellen säger att den tänkte. Ett sätt att göra detta är genom en enkel granskningsprompt:

Prompt (granskning):

Jag vill kunna kontrollera ditt svar. Lista exakt vilka resultat, antaganden och villkor din slutsats bygger på. Motivera varje punkt. Bedöm sedan för varje motivering om den är rimlig eller en efterkonstruktion. Om något bygger på data eller en källa, ange vilken (inklusive url eller var jag kan finna informationen) så att jag kan kontrollera den manuellt. Ange också vad du är mest osäker på.

Glöm dock inte att den sista bedömningen ändå alltid är din, eftersom AI-modellens granskning av sig själv också är ett AI-svar. Skulle en källa inte finnas (t.ex. en så kallad hallucination) eller säga något annat, vet du vad svaret är värt.

Så här kör du granskningen i praktiken

  1. Ta ett AI-svar du har fått nyligen i jobbet, gärna ett som du tänkte använda till något.

  2. Klistra in granskningsprompten ovan i samma chatt du arbetat i, så att AI-modellen har sitt eget svar framför sig.

  3. Kör prompten.

  4. Välj slutligen ut några av de viktigaste påståendena och kontrollera dem i källan.

Stämde det? Höll du med om slutsatserna och den logiska kopplingen mellan antaganden, villkor och resultat? För min egen del brukar det ofta stämma, men titt som tätt upptäcker jag att jag inte håller med AI-modellens resonemang. Se Figur 1 för hur det kan se ut när du kör prompten. I detta exempel har jag frågat vad man ska tänka på när man skriver blogginlägg.

Ett exempel på hur det kan se ut när du ber om att få granska AI-modellens resonemang.

Figur 1. Ett exempel på hur det kan se ut när du ber om att få granska AI-modellens resonemang. Här för frågan om vad som är viktigt att tänka på när man skriver blogginlägg, besvarad av Claude (gratisversionen).

Granska det som är viktigt, inte allt

Är man oroligt lagd är det lätt att tro att man måste granska varje påstående som AI-modellen utgår ifrån. Detta är inte alltid realistiskt, och ibland helt omöjligt. Samtidigt är det få av oss som granskar varje mening i en kollegas rapport. Istället behöver du anpassa hur kritiskt du granskar arbetet i förhållande till hur jobbigt det är om det blir fel. Alltså, ställ dig frågan: vad ska svaret användas till? Ett utkast till ett internt mejl klarar sig med en snabb läsning. Ett underlag till ett beslut, en siffra i en rapport eller något som ska vidare till din chef, en kund eller en medborgare är värt de extra minuterna det tar att kontrollera.

Förhoppningsvis kan de här frågorna hjälpa dig att avgöra när du kan lita på ett AI-svar och när du behöver kolla vidare.

Har du frågor eller invändningar? Mejla mig gärna. Fler artiklar publiceras efterhand.

Lycka till!

För organisationer

erik@enkelai.net

Nya artiklar direkt i inkorgen

Jag skickar ett mejl när jag publicerar en ny artikel om AI i arbetslivet. Inget annat, ingen reklam.