Ինչու՞ վարժեցնել AI մոդելները ձեր տվյալների հետ

Արհեստական ինտելեկտի մոդելի ուսուցումը սեփական տվյալների հետ այժմ ավելի մատչելի է, քան երբեւէ: Պետք չէ ծրագրավորող լինել՝ հարմարեցված AI համակարգ ստեղծելու համար, որը կհասկանա ձեր բիզնեսի, ձեր հաճախորդների կամ ձեր հատուկ կարիքների համատեքստը:

Ընդհանուր մոդելի եւ ձեր տվյալների հետ վերապատրաստված մոդելի օգտագործման միջեւ տարբերությունը հսկայական է: մինչ ChatGPT-ն գիտի հանրային տեղեկատվություն, ձեր տվյալների հետ վերապատրաստված մոդելը գիտի ձեր քաղաքականությունը, ձեր շուկան, ձեր ներքին գործընթացները եւ ձեր լեզուն: Ընկերությունները գործառնական արդյունավետության մեջ ստանում են 30%-ից 50%՝ իրականացնելով AI, որը պատրաստված է սեփական տվյալների հետ:

Փոքր գործակալությունները, խորհրդատուները, ֆրիլանսերները եւ փոքր բիզնեսներն այժմ կարող են ավտոմատացնել կրկնվող առաջադրանքները, բարելավել հաճախորդների սպասարկումը, ստեղծել ավելի համապատասխան բովանդակություն եւ ավելի արագ որոշումներ կայացնել՝ առանց տվյալների գիտնականի վարձելու:

Արհեստական ինտելեկտի ուսուցման համար առանց կոդի հարթակներ

Առանց կոդերի հարթակները վերացրել են ծրագրավորման անհրաժեշտությունը: Նրանք առաջարկում են տեսողական ինտերֆեյսներ եւ ինտուիտիվ հոսքեր, որտեղ դուք բեռնում եք տվյալները, կարգավորում հիմնական պարամետրերը եւ րոպեների ընթացքում ունենում եք ֆունկցիոնալ մոդել:

Google Teachable մեքենա

Google- ի Teachable մեքենան անվճար է եւ իդեալական սկսնակների համար: Դուք վարժեցնում եք մոդելներին ճանաչել պատկերները՝ ձայները կամ դիրքերը: Պարզապես բեռնել 50-ից 100 օրինակ յուրաքանչյուր կատեգորիայի՝ որը մոդելը սովորում է միայնակ: Շատ փոքր բիզնեսներ օգտագործում են սա՝ ապրանքները դասակարգելու՝ լուսանկարների թերությունները հայտնաբերելու կամ տեսանյութերի վարքագիծը ճանաչելու համար: Դասընթացից հետո դուք ստանում եք կոդ՝ որը կարող եք ինտեգրել ցանկացած կայք:

Microsoft AutoML

Microsoft Azure AutoML ավտոմատացնում է ամբողջ գործընթացը ընտրության եւ ճշգրտման մոդելների: Դուք վերբեռնում եք CSV ֆայլ ձեր տվյալների՝ սահմանել որ սյունակում ցանկանում եք կանխատեսել՝ եւ համակարգը փորձարկում է տասնյակ ալգորիթմներ ավտոմատ կերպով՝ վերադարձնելով լավագույն արդյունքը:

Գրավիչ դեմքի տարածքներ

The Hugging Face ունի ժողովրդավարացված մուտք դեպի առաջադեմ AI մոդելներ: Դուք կարող եք ճշգրտել (նուրբ tun) լեզվի եւ տեսողության մոդելները՝ առանց գրելու կոդը: Պլատֆորմը տրամադրում է պատրաստի ձեւանմուշներ; դուք պարզապես հարմարվում եք ձեր տվյալներին եւ տեղակայվում րոպեների ընթացքում: Շատերն օգտագործում են սա չաթ-բոտերի, տեքստի դասակարգման եւ զգացմունքների վերլուծության համար:

Պատրաստել Ձեր տվյալները վերապատրաստման համար

Վերապատրաստման որակը կախված է տվյալների որակից: Վատ տվյալներ են գալիս՝ վատ կանխատեսումներ են հայտնվում: Հետեւաբար՝ տվյալների պատրաստումը ամենակարեւոր եւ հաճախ ամենաանտեսված քայլն է:

Հավաքածու եւ կազմակերպում

Սկսեք հավաքել խնդրի համապատասխան օրինակներ՝ որոնք ցանկանում եք լուծել: Եթե դուք պատրաստում եք մոդել՝ որպեսզի դասակարգել էլ: նամակները որպես սպամ կամ օրինական՝ հավաքեք 500-ից 1000 օրինակ յուրաքանչյուր տեսակի: Եթե դա արտադրանքի թերության հայտնաբերում է՝ լուսանկարեք առնվազն 200 լավ արտադրանք եւ 200 թերի տարբեր տեսանկյուններից եւ լուսավորություններից:

Կազմակերպեք ձեր տվյալները տրամաբանական թղթապանակներում կամ կառուցվածքային ֆայլում (CSV:Excel կամ JSON): Աղյուսակային տվյալների համար յուրաքանչյուր տող օրինակ է, եւ յուրաքանչյուր սյունակ՝ հատկանիշ: Պատկերների համար տեղադրեք դրանք ենթապանակներում, որոնք կոչվում են ըստ իրենց ներկայացրած դասի:

Մաքրում եւ հավասարակշռում

Հեռացրեք կրկնօրինակ, թերի կամ ակնհայտորեն սխալ օրինակներ: Եթե դուք պատրաստում եք մոդել մի դասից 900 օրինակով եւ մյուսից՝ 100 օրինակով, այն կսովորի նախընտրել մեծամասնության դասը: Իդեալում, դուք պետք է ունենաք նմանատիպ գումարներ: եթե չեք կարող, շատ հարթակներ առաջարկում են կշռման տարբերակներ կամ ավտոմատ ավելացում (փոքրամասնությունների օրինակների սինթետիկ ստեղծում):

Ստանդարտացնել ձեւաչափերը: բոլոր պատկերները նույն չափի եւ ձեւաչափի, բոլոր տեքստերը նույն կոդավորման հետ, ամսաթվերը նույն ձեւով: Նման փոքր մանրամասները տարբերություն են դնում գործող մոդելի եւ ձախողվող մոդելի միջեւ:

Բաժանում դեպի հավաքածուներ

Միշտ բաժանեք ձեր տվյալները երեք մասի: ուսուցում (70%)՝ վավերացում (15%) եւ թեստավորում (15%): Ուսուցումն այն է՝ որտեղ մոդելը սովորում է՝ վավերացումը կարգավորում է հիպեր-պարամետրերը (կարգավորումներ) եւ թեստավորումը գնահատում է իրական կատարումը: Ոչ կոդային հարթակները դա անում են ավտոմատ կերպով՝ բայց հասկացությունը հասկանալն օգնում է ձեզ գնահատել՝ թե արդյոք արդյունքը իմաստ ունի:

Գործնական քայլ առ քայլ: Սկսելով այսօր

1: Ընտրեք ձեր խնդիրը

Դա "բարելավված բիզնես" չէ: դա "հաճախորդների ակնարկները դասակարգելն է որպես դրական կամ բացասական" կամ "հայտնաբերում է, երբ հաճախորդը շատ հավանական է, որ բաժանորդագրվի":

2: Հավաքեք օրինակելի տվյալներ

Հավաքեք 100-ից 1000 օրինակ այն մասին՝ ինչ ցանկանում եք կանխատեսել: Եթե դուք ունեք տվյալների պատմություն (հին էլ: նամակներ՝ հին լուսանկարներ՝ գրառումներ)՝ օգտագործեք այն: Եթե չեք՝ ստեղծեք՝ լուսանկարեք ապրանքներ՝ հարցրեք հաճախորդներին օրինակներ՝ օգտագործեք համապատասխան հանրային տվյալներ: Որակը ավելի շատ կարեւոր է՝ քան քանակը; 200 լավ ընտրված օրինակները գերազանցում են 2000 պատահական օրինակները:

3: Ստանդարտ ձեւաչափով դասավորություն

Տեքստի դասակարգման համար: երկու սյունակով ֆայլ (տեքստ, կատեգորիա): Պատկերների համար՝ ներսում դասի կողմից նշված թղթապանակներ: Թվային տվյալների համար՝ CSV լավ պիտակավորված սյունակներով: Ստուգեք բացակայող արժեքները եւ որոշեք՝ հեռացնել կամ լրացնել միջին/միջինով:

4: Ընտրեք հարթակը

Սկսնակների համար՝ Google Teachable Machine (պատկերներ/հնչյուններ) կամ Hugging Face (տեքստեր): Աղյուսակային տվյալների համար՝ Azure AutoML կամ Google Cloud AutoML: Ստեղծեք անվճար հաշիվ՝ կարդացեք արագ փաստաթղթերը (15 րոպե) եւ փորձեք այն:

5: Բեռի տվյալներ եւ կազմաձեւում

Վերբեռնել ֆայլը կամ թղթապանակները ըստ պլատֆորմի մեթոդի: Սահմանել, թե որ սյունակն է թիրախը (ինչ եք ուզում կանխատեսել) եւ թույլ տալ, որ համակարգը գործի: Պլատֆորմների մեծ մասը ցույց է տալիս առաջընթաց իրական ժամանակում:

6: Գնահատել արդյունքները

Մարզվելուց հետո դուք ստանում եք ճշգրտություն (հարվածների տոկոսը): Եթե այն 80%-ից բարձր է՝ դա լավ է իրական դեպքերի մեծ մասի համար: 70%-ից ցածր՝ վերանայեք ձեր տվյալները: կարող են լինել կրկնօրինակներ՝ սխալ պիտակավորված տվյալներ կամ անհավասարակշիռ դասեր:

7: Թեստ եւ իրականացում

Օգտագործեք ձեւանմուշը արտադրության մեջ: Պլատֆորմն առաջարկում է URL կամ կոդ՝ որը դուք ինտեգրվում եք ձեր կայքում՝ հավելվածում կամ համակարգում: Դիտեք կատարողականը վաղ օրերին: իրական աշխարհը տարբերվում է վերապատրաստման տվյալներից՝ ուստի խնդիրների մասին տեղյակ լինելը օգնում է արագ բարելավումներ կատարել:

Ընդհանուր սխալներ եւ ինչպես խուսափել դրանցից

Մոդելի ուսուցումն առանց սովորական որոգայթների մեջ ընկնելու խնայում է շաբաթների վերամշակումը: Ամենամեծ սխալը փորձարկման տվյալների հետ խառնված մարզումների տվյալների օգտագործումն է: դուք կչափեք ուռճացված ճշգրտությունը, որը չի արտացոլում իրական կատարումը:

Մեկ այլ հաճախակի սխալ: շփոթեցնող հարաբերակցությունը պատճառահետեւանքային կապի հետ: Եթե ձեր մոդելը կանխատեսում է՝ որ որոշակի ծագման ազգանուններով հաճախորդները չեղյալ են հայտարարում՝ դա այն պատճառով չէ՝ որ ազգանունը չեղյալ է հայտարարում: դա այն պատճառով՝ որ այլ գործոններ (գտնվելու՝ եկամուտ՝ լեզու) փոխկապակցված են: Խուսափեք մոդելի ուսուցումից տվյալների հետ՝ որոնք առաջացնում են խտրական կողմնակալություն:

2022 թվականի տվյալների վրա վերապատրաստված մոդելը կարող է ձախողվել 2024 թվականին, եթե օգտագործողի վարքագիծը փոխվել է: Շարունակաբար վերահսկել ճշգրտությունը եւ վերապատրաստել յուրաքանչյուր 3-6 ամիսը մեկ՝ թարմացված տվյալներով:

Հաջորդ քայլերը եւ շարունակական զարգացումը

Ձեր առաջին մոդելի աշխատանքից հետո ընդլայնեք: Ավելացնել ավելի շատ տվյալներ, փորձարկել տարբեր հարթակներ, մեծացնել բարդությունը: Մոդելը, որը սկսել է պարզ, կարող է վերածվել ամբողջական համակարգի, որն ավտոմատացնում է ձեր գործառնական աշխատանքի 40%-ը:

Դիտարկենք տարբեր առաջադրանքների համար բազմաթիվ մոդելների ուսուցում: Մարքեթինգային գործակալությունը կարող է ունենալ մեկ մոդել՝ առաջատարների դասակարգման համար, մյուսը՝ վերնագրեր ստեղծելու, մյուսը՝ ավելի լավ կանխատեսելու տեղադրման ժամանակները:

Միացեք առցանց համայնքներին: գրկախառնվել դեմքի ֆորումներ՝ AI subreddits՝ դասընթացներ YouTube- ում: Ուրիշների փորձառություններից սովորելը արագացնում է ձեր վարպետությունը: Ռեսուրսների մեծ մասն անվճար է եւ գործնական: