В тази глава ще обсъдим важността на предоставянето на висококачествени данни при обучението на модел с изкуствен интелект, както и ще оценим критериите, на които данните трябва да отговарят, за да се считат за висококачествени.
Съществуват системи, които използват симулирано обучение, при които изкуственият интелект взаимодейства със симулирана среда и се учи чрез проба-грешка чрез подсилване (това ще бъде обяснено в глава 4). За други модели на изкуствен интелект данните за обучение са единственият източник на разбиране за изкуствения интелект. Всички модели, наблюдавани от модела, се основават на данните, които му се подават. Това е така, защото изкуственият интелект, за разлика от хората, няма телесен или личен опит, от който да черпи знания, и разчита на входните данни, за да определи истинността си. Той няма друг начин да тества заключенията си, освен ако по-късно не му се каже, че информацията е неправилна. Ето защо са необходими висококачествени данни, за да функционират моделите на изкуствен интелект. Въпреки това, какво представляват висококачествените данни?
Първото съображение е точността. Въпреки че има както етикетирани, така и немаркирани набори от данни, точността е от решаващо значение и за двата. Когато използвате етикетирани данни в комбинация с контролирано обучение (повече за това в глава 4), точността на данните е свързана с това колко подробни и правилни са етикетите спрямо данните. Например, можете да обучите изкуствен интелект да идентифицира обекти в изображение.
Ако искаме да дадем пример за точност в контекста на немаркирани данни, използвани в обучение без надзор, можем да си представим модел на голям език (Large Language Model – LLM). LLM като ChatGPT могат да бъдат обучени върху немаркирани данни, като статии, туитове, публикации в Reddit, научни списания и др. Това са немаркирани данни и изкуственият интелект ги използва, за да идентифицира модели в структурата на изреченията и да формира връзки между думите. Чрез обучение върху достатъчно от тези данни, изкуственият интелект започва да генерира изречения, които човек би могъл да напише. Ако обаче го обучите върху домашни, написани от деца на 6-годишна възраст, може да получите нежелани резултати от изкуствения интелект. Това всъщност означава качество в контекста на немаркирани данни.
Накратко, ако го научите на неща, които не са верни, изкуственият интелект няма начин да коригира това. Уверете се, че данните, използвани за обучението на изкуствения интелект, са с високо качество, в противен случай той може да разпознае котки като кучета. Ако го обучавате върху текст, уверете се, че е написан свързано и граматически правилно, в противен случай резултатите може да са безсмислени. Дори ако малка част от данните е с ниско качество, това може да повлияе на модела, тъй като изкуственият интелект работи върху шаблони и ще прави неправилни връзки. Качеството на входните данни е пряко свързано с качеството на резултатите.
Друго съображение за висококачествени данни са вградените пристрастия. Дори ако технически няма нищо нередно в данните, все пак можете да имате огромни проблеми, ако пренебрегнете пристрастията. В един PR скандал изкуствен интелект за разпознаване на изображения изглежда е бил обучен предимно върху кавказки човешки лица, което е довело до идентифицирането на хора от други раси като примати. Това може да се реши, като се вземат предвид следващите 2 критерия за висококачествени данни – обем и разнообразие.
Колкото по-голям е мозъкът на изкуствения интелект (ИИ) – измерен в брой параметри – толкова повече данни са необходими за точното и ефективно кодиране на стойности в неговите възли, тъй като всеки вход само леко ще промени стойностите на възлите. Мислете за възлите като за математически функции – те приемат входни данни и дават изходни данни след извършване на някои математически изчисления. Поради тази причина е важно да имате достатъчен обем при обучението на ИИ. В интернет има различни предложения за това колко данни са достатъчни, но единственият реален начин да се определи е чрез тестване на ИИ. Това, разбира се, тества цялата система, а не само количеството входни данни, така че е трудно да се идентифицира слабото място, но чрез тестване на модела ще получите представа за резултатите, които можете да очаквате.
Последното важно съображение за данните за обучение е разнообразието. Ако дадете на ИИ твърде много от един тип входни данни, той ще се пренастрои и няма да разпознава общи модели, а ще бъде оптимизиран само за този един въпрос. Разбира се, това зависи от целта на ИИ, но за моделите с големи езици е критично те да имат широко разбиране и да се опитват да разсъждават самостоятелно. Нека видим някои примери: ако му покажете само добавяне на въпроси, тогава той няма да знае как да умножава. Ако му покажете твърде много статии, тогава ще звучи като репортер във всички контексти, така че може да искате да включите теми или туитове в Reddit. В ИИ за разпознаване на изображения може да му предоставите твърде много подобни снимки – ако всички снимки с птица имат син небесен фон, тогава той може да предположи, че синьото допринася за това изображението да е птица.