I dette kapittelet vil vi diskutere viktigheten av å tilby data av høy kvalitet når man trener en AI-modell, i tillegg til å evaluere hvilke kriterier data må oppfylle for å bli ansett som høy kvalitet.
Det finnes systemer som bruker simulert læring der en AI samhandler med et simulert miljø og lærer ved prøving og feiling gjennom forsterkning (dette vil bli forklart i kapittel 4). For andre AI-modeller er treningsdata den eneste kilden til forståelse for AI-en. Alle mønstrene som observeres av modellen er basert på dataene den blir matet med. Dette er fordi AI-en, i motsetning til mennesker, ikke har noen kroppslig eller personlig erfaring å trekke kunnskap fra og er avhengig av input for å definere dens sannhet. Den har ingen ytterligere måte å teste konklusjonene sine på med mindre den senere får beskjed om at informasjonen er feil. Dette er grunnen til at data av høy kvalitet er nødvendige for at AI-modeller skal fungere. Når det er sagt, hva utgjør data av høy kvalitet?
Den første vurderingen er nøyaktighet. Selv om det finnes både merkede og umerkede datasett, er nøyaktighet avgjørende for begge. Når merkede data brukes i kombinasjon med veiledet læring (mer om dette i kapittel 4), er nøyaktigheten av dataene relatert til hvor detaljerte og korrekte etikettene er i forhold til dataene. For eksempel kan du trene en AI til å identifisere objekter i et bilde.
Eksempel på inndatabilde https://www.rspb.org.uk/birds-and-wildlife/robin
Hvis vi ønsker å gi et eksempel på nøyaktighet i konteksten av umerkede data brukt i uovervåket trening, kan vi forestille oss en stor språkmodell (LLM). LLM-er som ChatGPT kan trenes på umerkede data som artikler, tweets, Reddit-innlegg, vitenskapelige tidsskrifter osv. Dette er umerkede data, og AI-en bruker dem til å identifisere mønstre i setningsstrukturen og danner relasjoner mellom ord. Ved å trene den på nok av disse dataene, begynner AI-en å produsere setninger som et menneske kan skrive. Hvis du derimot trener den på skolelekser skrevet av barn på 6 år, kan du få uønskede resultater fra AI-en. Dette er hva kvalitet betyr i konteksten av umerkede data.
Kort sagt, hvis du lærer den ting som ikke er sanne, har ikke AI-en noen måte å korrigere dette på. Sørg for at dataene som brukes til å trene en AI er av høy kvalitet, ellers kan den identifisere katter som hunder. Hvis du trener den på tekst, sørg for at den er skrevet i sammenhengende og grammatisk korrekt tekst, ellers kan resultatene være meningsløse. Selv om et lite delsett av dataene er av lav kvalitet, kan det forurense modellen siden AI jobber med mønstre og vil gjøre feil koblinger. Kvaliteten på inndataene er direkte korrelert med kvaliteten på resultatene.
En annen faktor når det gjelder data av høy kvalitet er innebygde skjevheter. Selv om det teknisk sett ikke er noe galt med dataene, kan du fortsatt få store problemer hvis du overser skjevheter. I en PR-skandale ser det ut til at en kunstig intelligens for bildegjenkjenning hovedsakelig ble trent på kaukasiske menneskeansikter, noe som førte til at den identifiserte mennesker fra andre raser som primater. Dette kan løses ved å ta hensyn til de to neste kriteriene for data av høy kvalitet – volum og mangfold.
Jo større hjernen til AI-en er – målt i antall parametere – desto mer data trengs for å kode verdier nøyaktig og effektivt inn i nodene, siden hver inngang bare vil endre nodeverdiene litt. Tenk på noder som matematiske funksjoner – de tar litt inngang og gir noe utdata etter å ha gjort litt matematikk. Av denne grunn er det viktig å ha tilstrekkelig volum når du trener en AI. Det finnes forskjellige forslag på nettet for hvor mye data som er nok, men den eneste virkelige måten å vite det på er å teste AI-en. Dette tester selvfølgelig hele systemet og ikke bare mengden inngangsdata, så det er vanskelig å identifisere det svake punktet, men ved å teste modellen vil du få en følelse av resultatene du kan forvente.
Den siste viktige faktoren for treningsdata er mangfoldet. Hvis du gir AI-en for mye av én type input, vil den overtilpasse og ikke gjenkjenne generelle mønstre, men bare optimaliseres for det ene spørsmålet. Dette avhenger selvfølgelig av formålet med AI-en, men for store språkmodeller er det avgjørende at de har en bred forståelse og prøver å resonnere på egenhånd. La oss se på noen eksempler: Hvis du bare viser den ved å legge til spørsmål, vil den ikke vite hvordan den skal multiplisere. Hvis du viser den for mange artikler, vil den høres ut som en reporter i alle sammenhenger, så du vil kanskje inkludere Reddit-tråder eller tweets. I en AI for bildegjenkjenning kan du mate den med for mange lignende bilder – hvis alle bilder med en fugl har en blå himmelbakgrunn, kan den anta at den blå fargen bidrar til at bildet er en fugl.