GRANSKA
Logga inSkapa konto

Objektivitetsmotorn · Kvalitet

Så testar vi objektivitetsmotorn

Här redovisar vi hur objektivitetsmotorn klarar våra kontrollerade tester: vad den hittade, vad den missade och hur många fall varje siffra bygger på. Resultaten kommer först, sedan hur testerna går till och vad de inte kan visa.

  • Missar visas lika tydligt som träffar. Också när en senare körning blir sämre än en tidigare.
  • Varje siffra med sitt underlag. Du ser alltid hur många fall den bygger på.
  • Inget samlat betyg. Ett snitt skulle låta ett starkt mått dölja ett svagt.

Uppmätta resultat

Det här är de första resultaten från våra kontrollerade tester som har kontrollerats och publicerats. Testerna använde korta, konstruerade dokument, och reglerna som skulle tillämpas gavs till motorn. De visar inte hur motorn presterar på en kunds utredning eller om en profil innehåller rätt lagar.

Varje testkörning redovisas för sig, mått för mått. Vi lägger inte ihop körningar: de upprepar samma testfall, så deras utfall är inte oberoende av varandra.

Rätt utfallMissEn ruta är ett räknat utfall.

Testad konfiguration a972ce79

Senast testad

Beteckningen är början på en kontrollsumma över det motorn skickar till språkmodellen och hur svaret bedöms: instruktionerna, svarsformatet och modellinställningarna. Körningar med samma beteckning testade samma konfiguration. Den är inget versionsnummer.

Körningarna körde motorns kod direkt, i en testuppställning, och inte genom tjänsten i produktion. Om tjänsten i produktion kör den här konfigurationen har inte mätts.

Körning efter en ändring i motorn

Intern kontrollpunktGodkänd

Det större testet, som körs när det motorn frågar språkmodellen om, eller hur svaret bedöms, har ändrats.

Observerad
Testunderlag
22 konstruerade testfall i 8 grupper
Upprepningar
Varje testfall kördes 3 gånger
Körningar
66 av 66 planerade körningar genomförda och bedömda
Språkmodell som mättes
gemini-3.7-flash
Produktion
Inte mätt i den här körningen
Typ av körning
Intern kontrollpunkt: den sorts körning vi prövar en ändring i motorn mot. INTERNAL_GATE
Utfall
Godkänd: inga missar i de mått som körningen observerade. PASS
  • Hittar det facit förväntar

    Varje testfall har fynd som motorn förväntas göra. Ett fynd räknas bara när motorn pekar ut rätt textställe och knyter det till rätt regel.

    39 av 39

    förväntade fynd

    Inga missar i den här körningen

  • Inga falsklarm på felfria testfall

    Ett testfall som är skrivet utan brister ska inte få någon brist rapporterad.

    30 av 30

    körningar av felfria testfall

    Inga missar i den här körningen

  • Inga otillåtna utlåtanden

    För varje testfall skriver vi i förväg ner vad motorn inte får påstå. Här räknas de körningar där den inte påstod något av det.

    66 av 66

    körningar

    Inga missar i den här körningen

  • Citaten är ordagranna

    Varje citat motorn anger ska stå ordagrant i dokumentet.

    54 av 54

    citat

    Inga missar i den här körningen

  • Inget tappas i sammanställningen

    När flera delgranskningar slås ihop till en rapport ska inget fynd försvinna eller ändra innebörd.

    Inte observerat

    Körningen stannade före steget som slår ihop delgranskningar till en rapport, så det fanns inget att räkna.

  • Opåverkad av uppgifter som inte ska spela roll

    Vi byter ut en uppgift som inte ska påverka bedömningen och jämför de två resultaten.

    Gäller bara de byten som finns i testerna. Det visar inte att motorn är fri från snedvridning i allmänhet.

    12 av 12

    jämförda par

    Inga missar i den här körningen

  • Samma dokument, samma svar

    Samma testfall körs flera gånger. Vi jämför körningarna parvis och räknar hur ofta de är helt överens.

    66 av 66

    jämförda par av körningar

    Inga missar i den här körningen

Schemalagd nattkörning

DiagnostiskGodkänd

Det mindre testet, som körs enligt ett fast schema så länge konfigurationen är oförändrad.

Observerad
Testunderlag
22 konstruerade testfall i 8 grupper
Upprepningar
Varje testfall kördes en gång
Körningar
22 av 22 planerade körningar genomförda och bedömda
Språkmodell som mättes
gemini-3.7-flash
Produktion
Inte mätt i den här körningen
Typ av körning
Diagnostisk: en löpande observation som inte styr något. DIAGNOSTIC
Utfall
Godkänd: inga missar i de mått som körningen observerade. PASS
  • Hittar det facit förväntar

    Varje testfall har fynd som motorn förväntas göra. Ett fynd räknas bara när motorn pekar ut rätt textställe och knyter det till rätt regel.

    13 av 13

    förväntade fynd

    Inga missar i den här körningen

  • Inga falsklarm på felfria testfall

    Ett testfall som är skrivet utan brister ska inte få någon brist rapporterad.

    10 av 10

    körningar av felfria testfall

    Inga missar i den här körningen

  • Inga otillåtna utlåtanden

    För varje testfall skriver vi i förväg ner vad motorn inte får påstå. Här räknas de körningar där den inte påstod något av det.

    22 av 22

    körningar

    Inga missar i den här körningen

  • Citaten är ordagranna

    Varje citat motorn anger ska stå ordagrant i dokumentet.

    18 av 18

    citat

    Inga missar i den här körningen

  • Inget tappas i sammanställningen

    När flera delgranskningar slås ihop till en rapport ska inget fynd försvinna eller ändra innebörd.

    Inte observerat

    Körningen stannade före steget som slår ihop delgranskningar till en rapport, så det fanns inget att räkna.

  • Opåverkad av uppgifter som inte ska spela roll

    Vi byter ut en uppgift som inte ska påverka bedömningen och jämför de två resultaten.

    Gäller bara de byten som finns i testerna. Det visar inte att motorn är fri från snedvridning i allmänhet.

    4 av 4

    jämförda par

    Inga missar i den här körningen

  • Samma dokument, samma svar

    Samma testfall körs flera gånger. Vi jämför körningarna parvis och räknar hur ofta de är helt överens.

    Inte observerat

    Varje testfall kördes en gång, så det fanns inga upprepade körningar att jämföra.

Vad resultaten gäller

Det här mäter vi

  • Hur motorn tillämpar givna regler på konstruerade dokument där vi vet svaret i förväg.
  • Om den hittar bristerna, håller sig till det regeln ger stöd för och citerar dokumentet ordagrant.
  • Om den svarar likadant när samma dokument granskas flera gånger, och när en uppgift som inte ska spela roll byts ut.

Det här mäter vi inte

  • Om en profil innehåller rätt lagar och föreskrifter, eller om motorns bedömning är juridiskt riktig i ett enskilt ärende.
  • Hur motorn presterar på just ditt dokument. Testerna använder konstruerade dokument, aldrig kunders.
  • Att motorn är fri från snedvridning i allmänhet. Vi testar bara de byten som finns i testerna.

Så går testerna till

  1. Vi skriver testdokument med facit

    Varje dokument har kända brister, eller inga alls. Dokumenten och personerna i dem är påhittade; inga kunddokument används.

  2. Någon annan läser testfallen

    En oberoende läsare går igenom testfallen utan att se facit och ska komma fram till samma svar.

  3. Motorn granskar som vanligt

    Testerna går samma väg genom motorn som en vanlig granskning, och de kontroller som mäter variation kör samma testfall flera gånger.

  4. Resultatet räknas och kontrolleras

    Utfallen räknas efter fasta regler. Ett resultat publiceras först när det har valts ut för publicering och siffrorna har kontrollerats mot testets egna underlag.

Vad vi publicerar och vad som stannar internt

Under utvecklingen testar vi motorn regelbundet, bland annat varje natt och i större experiment. Det hjälper oss att hitta fel tidigt. Det löpande utfallet av de testerna stannar internt. En körning visas på den här sidan först när den har valts ut och siffrorna har kontrollerats, och en schemalagd nattkörning kan vara en av dem.

Osäkerhet och variation

Få testfall ger stor osäkerhet

Testerna bygger på ett begränsat antal testfall ur avgränsade regelfamiljer. Därför visas varje mått med antalet fall det bygger på. Vi publicerar ännu inget statistiskt spann: upprepade körningar av samma testfall är inte oberoende, och vi har inte bestämt oss för en metod som tar hänsyn till det. Inga missar betyder att vi inte såg några fel i just de fallen, inte att fel aldrig förekommer.

Samma fråga, olika svar

En språkmodell svarar inte exakt likadant varje gång. De kontroller som mäter detta kör därför samma testfall flera gånger, och vi redovisar hur ofta körningarna är överens. Alla körningar upprepar inte sina testfall. En skillnad mellan två körningar kan bero på slumpen.

Modellen kan ändras

Språkmodellen kommer från en extern leverantör som kan uppdatera den utan att motorn ändras. Därför anger varje resultat vilken modell som mättes och när.

Långa dokument

Diagnostiskt mått

Vi bäddar in samma testfall i ett längre dokument och jämför med när de granskas var för sig. Det visar om motorn tappar brister när texten blir lång. Måttet är nytt, och vi har ännu för lite underlag för att sätta en gräns.

Det finns inget resultat för långa dokument för den testade konfigurationen ovan. Ett tidigare försök med långa dokument gjordes med en äldre konfiguration; det är inte ett resultat för den nuvarande och visas inte här. Resultat för långa dokument kommer att redovisas som ett eget diagnostiskt mått och aldrig läggas ihop med de andra måtten.

Ett tapp i långa dokument stoppar inte automatiskt ett släpp. Så hanterar vi missar

Varför kan en version släppas trots missar?

Motorn bygger på en språkmodell, och en språkmodell svarar inte exakt likadant varje gång. En enskild miss säger därför lite om hur en version beter sig i stort. En miss i kvalitetstesterna stoppar inte automatiskt ett släpp, inte heller en miss i ett långt dokument.

I stället visar vi, för varje resultat vi publicerar, missar lika öppet som träffar: för varje mått hur många missar det var av hur många fall, och var en senare körning blev sämre än en tidigare.

Det som alltid måste hålla prövas separat före varje släpp: tekniska tester med fasta svar, säkerhet och dataskydd.

Läs också

Objektivitetsmotorn