Hvorfor indtryk ikke er nok
Det er fristende at vælge en sprogmodel baseret på, hvordan dens svar føles i nogle få forsøg. Dette er dog upålideligt: en håndfuld eksempler fortæller dig ikke, hvordan modellen præsterer på tværs af hundredvis af reelle tilfælde, og afslører heller ikke, hvor modellen konsekvent fejler. Et pålideligt valg kræver systematisk evaluering, hvor modeller sammenlignes på samme testsæt med samme mål.
Byg dit eget testsæt
Generelle benchmarks fortæller kun en del af sandheden, fordi de ikke matcher dit specifikke anvendelsestilfælde. Den bedste evaluering hviler på dit eget testsæt: saml et sæt reelle spørgsmål og deres korrekte svar fra dit eget domæne. Jo tættere testsættet er på reel brug, desto mere pålideligt forudsiger det, hvordan modellen vil præstere i produktion. Dette sæt er også værdifuldt, når modeller eller modelversioner ændres.
Hvad man skal måle
De vigtige mål afhænger af opgaven, men almindelige er: korrekthed (er svaret faktuelt rigtigt), relevans (svarer det på spørgsmålet), konsistens (holder kvaliteten sig på tværs af lignende input) og sikkerhed (undgås skadelige eller vildledende svar). I et flersproget miljø måler du også, om modellen præsterer lige godt på alle de nødvendige sprog. Mål bør defineres før test, så evalueringen er ærlig.
Automatisering og menneskelig vurdering
En del af evalueringen kan automatiseres: sammenlign modelsvaret med det rigtige svar, eller brug en anden model som dommer. Dette skalerer godt. I kritiske tilfælde er der dog også brug for menneskelig vurdering, fordi et menneske bemærker nuancer, som et automatisk mål ikke fanger. Bedste praksis kombinerer begge: automatisering til bred screening og et menneske til de vigtigste beslutninger.
Evaluering er løbende
Modeller og deres versioner opdateres løbende, og den samme model kan opføre sig forskelligt på forskellige tidspunkter. Derfor foretages evaluering ikke én gang, men gentagne gange. Med testsættet og målene på plads går evalueringen af en ny model eller version hurtigt, og du kan træffe beslutninger på tal i stedet for mavefornemmelse. Dette er den samme disciplin, vi anvender på alle produktionsløsninger.
Opsummering
Valget af en sprogmodel skal hvile på måling, ikke indtryk. Byg dit eget testsæt, definer tydelige mål, kombiner automatisering og menneskelig vurdering, og gentag evalueringen regelmæssigt. Sådan ved du, hvilken model der virkelig passer til din opgave, og du kan begrunde dit valg med tal.