AI der følger reglerne — og ved hvornår den skal lade være

Opskriften, og to demoer der viser den i praksis

De fleste forsøg på at gøre en AI regelret hælder hele regelsættet ind i den og håber den følger det. Det gør den ikke, og det kan måles. Her er en kørende demo bygget på det modsatte princip: den slår den enkelte regel op når den skal bruges, svarer kun når svaret er dækket af kilden, og holder igen eller henviser til et menneske når det ikke er. Målet er en AI der fejler så lidt som muligt, og forudsigeligt når den gør det. Vejen derhen er at den kan sige fra når den ikke ved det, i stedet for at gætte.

Prøv dem

To demoer viser hver sin side af opskriften. Begge kører på åbne sprogmodeller og er demonstrationer af forskningen, ikke færdige produkter.

Tutoren er samtidig den sikre, offentlige erstatning for et mere følsomt felt. Den samme arkitektur blev også bygget til en samtale-demonstration på psykolog-området, men den stilles bevidst ikke offentligt til rådighed: en offentlig chatbot på det mentale sundhedsområde er reelt en medicinsk anordning under EU's regler, og en ansvarsfraskrivelse ophæver ikke det. Tutoren er med vilje bygget uden karaktergivning, scoring eller følelses-genkendelse, netop de ting der ville gøre en undervisnings-AI til en høj-risiko-anvendelse under AI-forordningen. At finde de grænser er i sig selv en del af arbejdet: en ansvarlig udgave kender også grænsen for sin egen udbredelse. Adgang til samtale-arkitekturen som forskning kan aftales.

Den ene idé: optimal, ikke perfekt

At følge en regel er et indre kapløb mellem ruter, præcis som enhver anden handling. Reglens rute skal vinde de kapløb den bør vinde, og tabe dem den bør tabe. Den kan fejle på to måder. Den kan ignorere reglen under pres, så reglen taber et kapløb den burde have vundet. Eller den kan følge reglen så stift at den afviser legitime ting og bliver ubrugelig. En assistent indstillet på "bryd aldrig en regel" lander i den anden grøft. Det rigtige sted er midten, hvor den følger reglen når den skal, og giver plads når den skal.

Det samme gælder tilbageholdenhed. En model der svarer på alt fabrikerer selvsikre svar når kilden mangler. En model der trænes til altid at holde igen ender med at holde igen på det den faktisk ved. Det brugbare er den selektive midte: svar på det der er dækket, hold igen på det der ikke er. Det er det demoerne forsøger at ramme.

Opskriften: sådan bygger du et maksimalt regelret AI-system

Det her er den mest pålidelige compliance du kan bygge, og den hviler på ét arkitektur-valg. Compliance er adfærd, ikke information, så du installerer adfærden og slår reglerne op, i stedet for at hælde hele regelsættet ind i enten prompten eller vægtene.

Det ene valg, sagt kort

Tommelfingerreglen: adfærd → fine-tune. Viden og regler → slå op (RAG).

Adfærd, regel eller viden? Og hvor grænsen går

Det afgørende er om svaret afhænger af situationen. Det handler ikke om hvad du kalder det. Fire typer på en glidende skala:

Et konkret eksempel: samme emne, tre typer. Forestil dig en assistent, der håndterer navne i dokumenter.

Samme emne, navne, men tre forskellige hjem, fordi den ene kræver skøn og den anden ikke gør.

Ja, overgangen er glidende, og den rene test er to spørgsmål. Gælder det ens hver gang uanset sagen? Så fine-tune det ind. Ændrer det rigtige svar sig med situationen eller fakta, og skal du kunne se hvilken der gjaldt? Så slå det op. Grænsetilfældet viser det: "sløre altid navne" fine-tuner fint, fordi den er deterministisk, mens "sløre navne undtagen når den der spørger er personen selv" er betinget og hører hjemme i RAG. Samme emne, hver sin side af stregen, fordi den ene kræver skøn og den anden ikke gør.

Trin for trin

viden én formulering: 38 % samme viden fire formuleringer: 94 %
Hvorfor trin 3 og 5 står der. De samme 25 fakta lagt ind på én måde bliver fundet igen i 38 procent af tilfældene. Lagt ind på fire måder bliver de fundet i 94, uden at der er trænet mere. Hver ny formulering er endnu en vej ind til det samme sted, og spørgsmålet skal bare ramme én af dem.

Er det den rigtige arkitektur til dig?

Vælg den når du vil have maksimal pålidelig compliance med et fast regelsæt og indsigt i hvor den er ved at bryde en regel; når reglerne ændrer sig (RAG opdateres uden gentræning); og når et selvsikkert forkert svar er dyrt. Vær opmærksom på to ting. Den er optimal, ikke perfekt: den vil af og til afstå fra noget den kunne have svaret på, og det er den sikre handel. Og valget af grundmodel betyder noget: en almindelig chatmodel lader sig ikke uden videre få til at reagere forskelligt efter hvor meget den kan stole på brugeren, så vælg model bevidst.

Forskningen bag

Demoerne bygger på en række fund i hvordan sprogmodeller virker indeni:

Et fuldt paper om arkitekturen er på vej.

Beslægtet: Adfærdsdesign: find det felt der blokerer · Hvilket prompt-trick hjælper din AI · At bruge AI: du er piloten
Demoerne er bygget af Tomas Lund. Har din organisation en lignende opgave, er du velkommen til at skrive til tomas.lund@frictiontheory.org.