Ինչու՞ վարժեցնել AI մոդելները ձեր տվյալների հետ
Արհեստական ինտելեկտի մոդելի ուսուցումը սեփական տվյալների հետ այժմ ավելի մատչելի է, քան երբեւէ: Պետք չէ ծրագրավորող լինել՝ հարմարեցված AI համակարգ ստեղծելու համար, որը կհասկանա ձեր բիզնեսի, ձեր հաճախորդների կամ ձեր հատուկ կարիքների համատեքստը:
Ընդհանուր մոդելի եւ ձեր տվյալների հետ վերապատրաստված մոդելի օգտագործման միջեւ տարբերությունը հսկայական է: մինչ ChatGPT-ն գիտի հանրային տեղեկատվություն, ձեր տվյալների հետ վերապատրաստված մոդելը գիտի ձեր քաղաքականությունը, ձեր շուկան, ձեր ներքին գործընթացները եւ ձեր լեզուն: Ընկերությունները գործառնական արդյունավետության մեջ ստանում են 30%-ից 50%՝ իրականացնելով AI, որը պատրաստված է սեփական տվյալների հետ:
Փոքր գործակալությունները, խորհրդատուները, ֆրիլանսերները եւ փոքր բիզնեսներն այժմ կարող են ավտոմատացնել կրկնվող առաջադրանքները, բարելավել հաճախորդների սպասարկումը, ստեղծել ավելի համապատասխան բովանդակություն եւ ավելի արագ որոշումներ կայացնել՝ առանց տվյալների գիտնականի վարձելու:
Արհեստական ինտելեկտի ուսուցման համար առանց կոդի հարթակներ
Առանց կոդերի հարթակները վերացրել են ծրագրավորման անհրաժեշտությունը: Նրանք առաջարկում են տեսողական ինտերֆեյսներ եւ ինտուիտիվ հոսքեր, որտեղ դուք բեռնում եք տվյալները, կարգավորում հիմնական պարամետրերը եւ րոպեների ընթացքում ունենում եք ֆունկցիոնալ մոդել:
Google Teachable մեքենա
Google- ի Teachable մեքենան անվճար է եւ իդեալական սկսնակների համար: Դուք վարժեցնում եք մոդելներին ճանաչել պատկերները՝ ձայները կամ դիրքերը: Պարզապես բեռնել 50-ից 100 օրինակ յուրաքանչյուր կատեգորիայի՝ որը մոդելը սովորում է միայնակ: Շատ փոքր բիզնեսներ օգտագործում են սա՝ ապրանքները դասակարգելու՝ լուսանկարների թերությունները հայտնաբերելու կամ տեսանյութերի վարքագիծը ճանաչելու համար: Դասընթացից հետո դուք ստանում եք կոդ՝ որը կարող եք ինտեգրել ցանկացած կայք:
Microsoft AutoML
Microsoft Azure AutoML ավտոմատացնում է ամբողջ գործընթացը ընտրության եւ ճշգրտման մոդելների: Դուք վերբեռնում եք CSV ֆայլ ձեր տվյալների՝ սահմանել որ սյունակում ցանկանում եք կանխատեսել՝ եւ համակարգը փորձարկում է տասնյակ ալգորիթմներ ավտոմատ կերպով՝ վերադարձնելով լավագույն արդյունքը:
Գրավիչ դեմքի տարածքներ
The Hugging Face ունի ժողովրդավարացված մուտք դեպի առաջադեմ AI մոդելներ: Դուք կարող եք ճշգրտել (նուրբ tun) լեզվի եւ տեսողության մոդելները՝ առանց գրելու կոդը: Պլատֆորմը տրամադրում է պատրաստի ձեւանմուշներ; դուք պարզապես հարմարվում եք ձեր տվյալներին եւ տեղակայվում րոպեների ընթացքում: Շատերն օգտագործում են սա չաթ-բոտերի, տեքստի դասակարգման եւ զգացմունքների վերլուծության համար:
Պատրաստել Ձեր տվյալները վերապատրաստման համար
Վերապատրաստման որակը կախված է տվյալների որակից: Վատ տվյալներ են գալիս՝ վատ կանխատեսումներ են հայտնվում: Հետեւաբար՝ տվյալների պատրաստումը ամենակարեւոր եւ հաճախ ամենաանտեսված քայլն է:
Հավաքածու եւ կազմակերպում
Սկսեք հավաքել խնդրի համապատասխան օրինակներ՝ որոնք ցանկանում եք լուծել: Եթե դուք պատրաստում եք մոդել՝ որպեսզի դասակարգել էլ: նամակները որպես սպամ կամ օրինական՝ հավաքեք 500-ից 1000 օրինակ յուրաքանչյուր տեսակի: Եթե դա արտադրանքի թերության հայտնաբերում է՝ լուսանկարեք առնվազն 200 լավ արտադրանք եւ 200 թերի տարբեր տեսանկյուններից եւ լուսավորություններից:
Կազմակերպեք ձեր տվյալները տրամաբանական թղթապանակներում կամ կառուցվածքային ֆայլում (CSV:Excel կամ JSON): Աղյուսակային տվյալների համար յուրաքանչյուր տող օրինակ է, եւ յուրաքանչյուր սյունակ՝ հատկանիշ: Պատկերների համար տեղադրեք դրանք ենթապանակներում, որոնք կոչվում են ըստ իրենց ներկայացրած դասի:
Մաքրում եւ հավասարակշռում
Հեռացրեք կրկնօրինակ, թերի կամ ակնհայտորեն սխալ օրինակներ: Եթե դուք պատրաստում եք մոդել մի դասից 900 օրինակով եւ մյուսից՝ 100 օրինակով, այն կսովորի նախընտրել մեծամասնության դասը: Իդեալում, դուք պետք է ունենաք նմանատիպ գումարներ: եթե չեք կարող, շատ հարթակներ առաջարկում են կշռման տարբերակներ կամ ավտոմատ ավելացում (փոքրամասնությունների օրինակների սինթետիկ ստեղծում):
Ստանդարտացնել ձեւաչափերը: բոլոր պատկերները նույն չափի եւ ձեւաչափի, բոլոր տեքստերը նույն կոդավորման հետ, ամսաթվերը նույն ձեւով: Նման փոքր մանրամասները տարբերություն են դնում գործող մոդելի եւ ձախողվող մոդելի միջեւ:
Բաժանում դեպի հավաքածուներ
Միշտ բաժանեք ձեր տվյալները երեք մասի: ուսուցում (70%)՝ վավերացում (15%) եւ թեստավորում (15%): Ուսուցումն այն է՝ որտեղ մոդելը սովորում է՝ վավերացումը կարգավորում է հիպեր-պարամետրերը (կարգավորումներ) եւ թեստավորումը գնահատում է իրական կատարումը: Ոչ կոդային հարթակները դա անում են ավտոմատ կերպով՝ բայց հասկացությունը հասկանալն օգնում է ձեզ գնահատել՝ թե արդյոք արդյունքը իմաստ ունի:

Գործնական քայլ առ քայլ: Սկսելով այսօր
1: Ընտրեք ձեր խնդիրը
Դա "բարելավված բիզնես" չէ: դա "հաճախորդների ակնարկները դասակարգելն է որպես դրական կամ բացասական" կամ "հայտնաբերում է, երբ հաճախորդը շատ հավանական է, որ բաժանորդագրվի":
2: Հավաքեք օրինակելի տվյալներ
Հավաքեք 100-ից 1000 օրինակ այն մասին՝ ինչ ցանկանում եք կանխատեսել: Եթե դուք ունեք տվյալների պատմություն (հին էլ: նամակներ՝ հին լուսանկարներ՝ գրառումներ)՝ օգտագործեք այն: Եթե չեք՝ ստեղծեք՝ լուսանկարեք ապրանքներ՝ հարցրեք հաճախորդներին օրինակներ՝ օգտագործեք համապատասխան հանրային տվյալներ: Որակը ավելի շատ կարեւոր է՝ քան քանակը; 200 լավ ընտրված օրինակները գերազանցում են 2000 պատահական օրինակները:
3: Ստանդարտ ձեւաչափով դասավորություն
Տեքստի դասակարգման համար: երկու սյունակով ֆայլ (տեքստ, կատեգորիա): Պատկերների համար՝ ներսում դասի կողմից նշված թղթապանակներ: Թվային տվյալների համար՝ CSV լավ պիտակավորված սյունակներով: Ստուգեք բացակայող արժեքները եւ որոշեք՝ հեռացնել կամ լրացնել միջին/միջինով:
4: Ընտրեք հարթակը
Սկսնակների համար՝ Google Teachable Machine (պատկերներ/հնչյուններ) կամ Hugging Face (տեքստեր): Աղյուսակային տվյալների համար՝ Azure AutoML կամ Google Cloud AutoML: Ստեղծեք անվճար հաշիվ՝ կարդացեք արագ փաստաթղթերը (15 րոպե) եւ փորձեք այն:
5: Բեռի տվյալներ եւ կազմաձեւում
Վերբեռնել ֆայլը կամ թղթապանակները ըստ պլատֆորմի մեթոդի: Սահմանել, թե որ սյունակն է թիրախը (ինչ եք ուզում կանխատեսել) եւ թույլ տալ, որ համակարգը գործի: Պլատֆորմների մեծ մասը ցույց է տալիս առաջընթաց իրական ժամանակում:
6: Գնահատել արդյունքները
Մարզվելուց հետո դուք ստանում եք ճշգրտություն (հարվածների տոկոսը): Եթե այն 80%-ից բարձր է՝ դա լավ է իրական դեպքերի մեծ մասի համար: 70%-ից ցածր՝ վերանայեք ձեր տվյալները: կարող են լինել կրկնօրինակներ՝ սխալ պիտակավորված տվյալներ կամ անհավասարակշիռ դասեր:
7: Թեստ եւ իրականացում
Օգտագործեք ձեւանմուշը արտադրության մեջ: Պլատֆորմն առաջարկում է URL կամ կոդ՝ որը դուք ինտեգրվում եք ձեր կայքում՝ հավելվածում կամ համակարգում: Դիտեք կատարողականը վաղ օրերին: իրական աշխարհը տարբերվում է վերապատրաստման տվյալներից՝ ուստի խնդիրների մասին տեղյակ լինելը օգնում է արագ բարելավումներ կատարել:
Ընդհանուր սխալներ եւ ինչպես խուսափել դրանցից
Մոդելի ուսուցումն առանց սովորական որոգայթների մեջ ընկնելու խնայում է շաբաթների վերամշակումը: Ամենամեծ սխալը փորձարկման տվյալների հետ խառնված մարզումների տվյալների օգտագործումն է: դուք կչափեք ուռճացված ճշգրտությունը, որը չի արտացոլում իրական կատարումը:
Մեկ այլ հաճախակի սխալ: շփոթեցնող հարաբերակցությունը պատճառահետեւանքային կապի հետ: Եթե ձեր մոդելը կանխատեսում է՝ որ որոշակի ծագման ազգանուններով հաճախորդները չեղյալ են հայտարարում՝ դա այն պատճառով չէ՝ որ ազգանունը չեղյալ է հայտարարում: դա այն պատճառով՝ որ այլ գործոններ (գտնվելու՝ եկամուտ՝ լեզու) փոխկապակցված են: Խուսափեք մոդելի ուսուցումից տվյալների հետ՝ որոնք առաջացնում են խտրական կողմնակալություն:
2022 թվականի տվյալների վրա վերապատրաստված մոդելը կարող է ձախողվել 2024 թվականին, եթե օգտագործողի վարքագիծը փոխվել է: Շարունակաբար վերահսկել ճշգրտությունը եւ վերապատրաստել յուրաքանչյուր 3-6 ամիսը մեկ՝ թարմացված տվյալներով:
Հաջորդ քայլերը եւ շարունակական զարգացումը
Ձեր առաջին մոդելի աշխատանքից հետո ընդլայնեք: Ավելացնել ավելի շատ տվյալներ, փորձարկել տարբեր հարթակներ, մեծացնել բարդությունը: Մոդելը, որը սկսել է պարզ, կարող է վերածվել ամբողջական համակարգի, որն ավտոմատացնում է ձեր գործառնական աշխատանքի 40%-ը:
Դիտարկենք տարբեր առաջադրանքների համար բազմաթիվ մոդելների ուսուցում: Մարքեթինգային գործակալությունը կարող է ունենալ մեկ մոդել՝ առաջատարների դասակարգման համար, մյուսը՝ վերնագրեր ստեղծելու, մյուսը՝ ավելի լավ կանխատեսելու տեղադրման ժամանակները:
Միացեք առցանց համայնքներին: գրկախառնվել դեմքի ֆորումներ՝ AI subreddits՝ դասընթացներ YouTube- ում: Ուրիշների փորձառություններից սովորելը արագացնում է ձեր վարպետությունը: Ռեսուրսների մեծ մասն անվճար է եւ գործնական:




