Hvorfor inntrykk ikke er nok
Det er fristende å velge en språkmodell basert på hvordan svarene føles i noen få forsøk. Dette er imidlertid upålitelig: en håndfull eksempler forteller deg ikke hvordan modellen presterer på tvers av hundrevis av reelle tilfeller, og avslører heller ikke hvor modellen konsekvent feiler. Et pålitelig valg krever systematisk evaluering der modeller sammenlignes på samme testsett med samme mål.
Bygg ditt eget testsett
Generelle referansetester forteller bare en del av sannheten, fordi de ikke samsvarer med ditt spesifikke bruksområde. Den beste evalueringen hviler på ditt eget testsett: sett sammen et sett med reelle spørsmål og deres riktige svar fra ditt eget domene. Jo nærmere testsettet er reell bruk, desto mer pålitelig forutsier det hvordan modellen vil prestere i produksjon. Dette settet er også verdifullt når modeller eller modellversjoner endres.
Hva man skal måle
De viktige målene avhenger av oppgaven, men vanlige er: korrekthet (er svaret faktisk riktig), relevans (svarer det på spørsmålet), konsistens (holder kvaliteten seg på tvers av lignende inndata) og sikkerhet (unngås skadelige eller villedende svar). I et flerspråklig miljø måler du også om modellen presterer like godt på alle de nødvendige språkene. Mål bør defineres før testing, slik at evalueringen er ærlig.
Automatisering og menneskelig vurdering
En del av evalueringen kan automatiseres: sammenlign modellsvaret med det riktige svaret, eller bruk en annen modell som dommer. Dette skalerer godt. I kritiske tilfeller trengs imidlertid også menneskelig vurdering, fordi et menneske legger merke til nyanser som et automatisk mål ikke fanger opp. Beste praksis kombinerer begge: automatisering for bred screening og et menneske for de viktigste beslutningene.
Evaluering er kontinuerlig
Modeller og deres versjoner oppdateres kontinuerlig, og den samme modellen kan oppføre seg forskjellig til forskjellige tider. Derfor gjøres evaluering ikke én gang, men gjentatte ganger. Med testsettet og målene på plass går evalueringen av en ny modell eller versjon raskt, og du kan ta beslutninger på tall i stedet for magefølelse. Dette er den samme disiplinen vi anvender på alle produksjonsløsninger.
Oppsummering
Valget av en språkmodell må hvile på måling, ikke inntrykk. Bygg ditt eget testsett, definer tydelige mål, kombiner automatisering og menneskelig vurdering, og gjenta evalueringen regelmessig. Slik vet du hvilken modell som virkelig passer oppgaven din, og du kan begrunne valget med tall.