Dunning-Kruger-kurven, set indefra i en sprogmodel
Paper 21 · Pødenphant Lund (2026) · Læs på Zenodo
Jeg arbejdede med noget helt andet, kiggede på en kurve og udbrød: "det er jo Dunning-Kruger!" Jeg troede, jeg havde opdaget den i en sprogmodel. Det viste sig, at andre havde set det i sprogmodeller før mig (Ghosh og Panday beskrev det tidligt i 2026).Dunning-Kruger-effekten er den iagttagelse, at folk ofte er mest sikre, når de ved mindst, og den er blevet diskuteret i årtier, fordi ingen kan se det, der faktisk driver den. I et menneske er selvtillid noget, man må gætte sig til ud fra hvad folk siger, og hvor godt de klarer sig. I en sprogmodel kan man kigge lige ind og se, hvor hårdt svarene konkurrerer, før den binder sig. Det nye her er, at man kan følge selve kurven indefra og se, hvor den kommer fra.
Det du aldrig kan se i et menneske
Dunning-Kruger-kurven har fire pejlemærker. En begynder starter passende usikker. Så kommer en stejl stigning til en top af selvsikker uvidenhed, ofte kaldet "Mount Stupid." Så et dyk, "fortvivlelsens dal," efterhånden som den lærende begynder at se hvor meget han gik glip af. Så en langsom klatren tilbage, mens rigtig kunnen indhenter det.
Hele diskussionen handler om én skjult størrelse: hvor hårdt et menneskes konkurrerende svar slås om det inde i hovedet, før man vælger ét. Det kan man aldrig se direkte. Man rekonstruerer det fra selvtillidsvurderinger og testresultater, og kritikere har vist at den rekonstruktion kan fremstille kurven helt på egen hånd, gennem statistiske finurligheder, før der overhovedet kommer rigtig overmod ind i billedet.
Så vi flyttede blikket
En sprogmodel vælger hvert ord ved en slags kapløb mellem kandidater, og man kan læse stillingen. For hvert svar den giver, kan man se hvor mange muligheder der var i spil, og hvor langt vinderen var foran. Det er præcis den størrelse ingen kan aflæse i en menneskehjerne. Her ligger den lige i tallene.
Før vi brugte den, tjekkede vi at den måler det vi tror. Forspringet mellem det øverste svar og toeren (vi kalder det balancen i evidensen) forudsiger om modellen har ret, slår det enklere mål feltet hidtil har brugt, og kan endda skelne rigtige fra forkerte svar i tilfælde hvor det enklere mål siger de ligner hinanden. Det virker på vidensspørgsmål og på en visuel "er det her mest rødt eller grønt?"-opgave. Den aflæser en ægte beslutningsstørrelse, ikke en tilfældighed.
Så byggede vi en Mount Stupid med vilje
For at få kurven skal man bruge et sted hvor en selvsikker-men-forkert overbevisning dannes og så bliver rettet. Forestil dig en lærer med en skjult karakterregel: en elevs karakter er lig med deres nummer på klasselisten, bortset fra at hver elev hvis nummer er deleligt med fem får lagt 100 til, så elev 10 får 110, ikke 10. Vis kun modellen de nemme tilfælde (1→1, 2→2, op til 9→9) og aldrig et tal deleligt med fem. Den gør præcis hvad et menneske gør: den spotter "nummer = karakter" og bliver sikker på det. Spørg hvad elev 10 får, og tilbage kommer "10," selvsikkert, sikker og forkert. Det er toppen: ét svar vandt nemt, fordi intet konkurrerede med det endnu, og en nem sejr føles som selvtillid.
Så ankommer sandheden lidt ad gangen ("faktisk fik elev 5 105"). Et andet svar bliver lagt ned, og det at blive modsagt får det til at lande hårdere, så nu konkurrerer to svar og den nemme sejr skrumper. Det er dalen. Bliv ved, og det rigtige svar vinder til sidst rent. Det er vejen op igen.
Hvad vi fandt
Tre dele af kurven dukkede op helt uden biologi. De kommer direkte fra måden læring konkurrerer på:
- Den selvsikre stigning til Mount Stupid. Mens den halvlærte regel danner sig, løber modellens selvtillid forud for dens faktiske kunnen. Den er sikker og forkert præcis dér hvor reglen gemmer en overraskelse. På de nemme tilfælde, hvor den virkelig er kompetent, er der ikke noget sådant gab.
- Genkendelsens øjeblik. I det øjeblik modsigelsen lander, falder de to svar til næsten dødt løb inde i modellen. Det er dalens tvivl, synlig i tallene.
- Vejen tilbage op. Med nok eksempler vinder det rigtige svar. Større modeller klatrer hurtigere tilbage; den mindste kommer sig aldrig og bliver selvsikkert forkert.
To andre dele opførte sig anderledes, og forskellen er det interessante. De manglede ikke rigtig. De var skjult af måden modellen normalt tvinges til at svare på:
- Begynderens ydmyghed. Tvunget til at give et tal ser modellen født-overmodig ud. Men i samme øjeblik vi lod den sige "jeg er ikke sikker," sagde den præcis det, hver eneste gang, når den var ægte uvidende. Ydmygheden var der hele tiden. Vi havde bare kneblet den. (Mennesker gør det samme: lad dem vælge hvad de vil svare i stedet for at tvinge det frem, og det de faktisk siger bliver mere præcist.)
- Fortvivlelsens dal. I sit udtalte svar viste modellen intet dyk. Men indeni, i modsigelsens øjeblik, sad det vindende og det tabende svar næsten lige. Den gængse måde at aflæse "det ene mest sandsynlige svar" smider det dødt løb væk, og derfor så dykket ud til at forsvinde. Læs forspringet i stedet, og dalen er umiskendelig.
En anvendelse: troen på at man kan klare det
Måleredskabet rækker videre end kurven. I psykologien kalder man troen på, at man kan gennemføre en bestemt opgave, for self-efficacy. Albert Bandura beskrev den i 1977, og det er den vurdering man laver, inden man går i gang: kan jeg det her? Set indefra i modellen er det ikke en selvopfattelse, der ligger et andet sted end præstationen. Det er en aflæsning af det samme kapløb mellem svar, som resten af papiret måler.
Det giver to ting, som sidder filtret sammen i et menneske og ligger hver for sig her. Den første: kapløbet trækker i to retninger på én gang, og det er den samme størrelse der gør begge dele. Konkurrencen mellem kandidatsvarene forringer svaret, for jo hårdere de slås, jo oftere vinder det forkerte. Og præcis det samme forspring mellem vinderen og toeren er også dét, modellen aflæser, når den vurderer om den overhovedet kan svare og i stedet siger "jeg er ikke sikker". Friktionen, der forringer svaret, og signalet, der rapporterer selvtillid i det, er altså ikke to ting, der følges ad. Det er én størrelse, læst to gange.
Den anden: de to sider kan skilles ad, og det er den del intet menneskeforsøg kan lave. Den forringende side er billig. Selv en lille model bliver dårligere, når kandidaterne konkurrerer hårdt. Den rapporterende side er dyr, for at aflæse sit eget kapløb godt nok til at melde pas kræver kapacitet. Den mindste model vi kørte melder pas på hvert eneste trin, også når den udmærket kan svare, mens modeller fra omkring 70 milliarder parametre og op rammer rigtigt. En lille model beholder altså forringeren og mister rapportøren: signalet ligger der stadig i tallene, men systemet kan ikke handle på det. Man kan ikke tage evnen til at aflæse sin egen tvivl fra et menneske og lade tvivlen blive.
Én detalje er værd at tage med, for den peger på hvorfor vi læser tallene i stedet for at spørge modellen. Da et andet hold gav ti sprogmodeller det spørgeskema, mennesker udfylder om egen mestring, svarede modellerne stabilt fra gang til gang, men svarene passede ikke på, hvad de faktisk kunne. Den kanal, det udtalte selvskøn, er ikke den vi bruger. Den størrelse vi læser, forspringet lige før modellen binder sig, forudsiger både om svaret bliver rigtigt, og hvornår modellen melder pas.
Det er en anvendelse af måleredskabet, ikke et nyt forsøg. Det er de samme resultater som ovenfor, stillet op under et begreb psykologien i forvejen bruger. Det arvede fra Bandura er, at en vurdering af egen kunnen er aflæsningen af en beslutningsstørrelse, og at den bliver bedre kalibreret med kapacitet. Det, substratet lægger til, er at forringeren og rapportøren er den samme størrelse, og at de skilles ad, når kapaciteten er lille.
Hvorfor det betyder noget
Retningen er vendt om i forhold til resten af arbejdet. Paper 0 bruger kapløbet mellem svar til at forklare, hvordan et menneske træffer en beslutning. Her går det den anden vej: modellens aflæselige tal bliver måleinstrumentet for den slags begrænsede beslutning, mennesker også træffer. Selvtillid følger hvordan de konkurrerende svar afgøres, ikke hvor god du faktisk er. At blive klogere er ikke mere mystisk end at gå fra ét svar der vinder for nemt til flere svar der konkurrerer, indtil det rigtige vinder. Den selvsikre stigning kom i hver eneste model vi prøvede, fra den mindste til den største, så Dunning-Kruger er ikke en sær menneskelig fejl. Det er formen på læring, der begynder med en regel, der er for simpel.
Det sorterer også kurven i to bunker. Den selvsikre stigning, genkendelsen og vejen tilbage er egenskaber ved selve beslutningsmaskineriet. Ingen neuroner krævet. Den følte ydmyghed og den følte fortvivlelse er den del som den biologiske hjerne ser ud til at lægge oveni. Det er et mere brugbart svar end "modeller viser eller viser ikke Dunning-Kruger": det siger præcis hvilke stykker der er mekaniske, og hvilke der er menneskelige.
Citat
Læs på Zenodo → · Teknisk version · Plain English version
Relateret på sitet:
- Dunning-Kruger-effekten — en gennemgang af fænomenet i hverdagssprog, fra start til slut.
- Paper 0 (BFT) — den biologiske version af samme maskineri.
- Paper 3 (Giv modellen en chance til) — den samme aflæsning, brugt til at forbedre svarene i stedet for at måle.