अपने डेटा के साथ एआई मॉडल को प्रशिक्षित क्यों करें

अपने स्वयं के डेटा के साथ एक कृत्रिम बुद्धिमत्ता मॉडल को प्रशिक्षित करना अब पहले से कहीं अधिक सुलभ है। आपको एक अनुकूलित एआई सिस्टम बनाने के लिए प्रोग्रामर होने की आवश्यकता नहीं है जो आपके व्यवसाय, आपके ग्राहकों या आपकी विशिष्ट आवश्यकताओं के संदर्भ को ठीक से समझता हो।

एक सामान्य मॉडल का उपयोग करने और आपके डेटा के साथ प्रशिक्षित एक के बीच का अंतर बहुत बड़ा है: जबकि चैटजीपीटी सार्वजनिक जानकारी जानता है, आपके डेटा के साथ प्रशिक्षित एक मॉडल आपकी नीतियों, आपके बाजार, आपकी आंतरिक प्रक्रियाओं और आपकी भाषा को जानता है, कंपनियां अपने स्वयं के डेटा के साथ प्रशिक्षित एआई को लागू करके परिचालन दक्षता में ३०% से ५०% तक लाभ प्राप्त करती हैं।

छोटी एजेंसियां, सलाहकार, फ्रीलांसर और छोटे व्यवसाय अब दोहराए जाने वाले कार्यों को स्वचालित कर सकते हैं, ग्राहक सेवा में सुधार कर सकते हैं, अधिक प्रासंगिक सामग्री उत्पन्न कर सकते हैं और तेजी से निर्णय ले सकते हैं - यह सब डेटा वैज्ञानिक को काम पर रखे बिना।

प्रशिक्षण एआई के लिए नो-कोड प्लेटफार्म

नो-कोड प्लेटफ़ॉर्म ने प्रोग्रामिंग की आवश्यकता को समाप्त कर दिया है। वे विज़ुअल इंटरफ़ेस और सहज प्रवाह प्रदान करते हैं जहां आप डेटा लोड करते हैं, बुनियादी मापदंडों को कॉन्फ़िगर करते हैं और मिनटों में एक कार्यात्मक मॉडल रखते हैं।

गूगल टीचेबल मशीन

गूगल की टीचेबल मशीन शुरुआती लोगों के लिए मुफ्त और आदर्श है आप छवियों, ध्वनियों या पोज़ को पहचानने के लिए मॉडल को प्रशिक्षित करते हैं बस प्रत्येक श्रेणी के ५० से १०० उदाहरण लोड करें जो मॉडल अकेले सीखता है कई छोटे व्यवसाय उत्पादों को वर्गीकृत करने, फ़ोटो में दोषों का पता लगाने या वीडियो में व्यवहार को पहचानने के प्रशिक्षण के बाद, आपको एक कोड मिलता है जिसे आप किसी भी वेबसाइट में एकीकृत कर सकते हैं।

माइक्रोसॉफ्ट ऑटोएमएल

Microsoft Azure AutoML मॉडल चुनने और समायोजित करने की पूरी प्रक्रिया को स्वचालित करता है। आप अपने डेटा के साथ एक CSV फ़ाइल अपलोड करते हैं, परिभाषित करते हैं कि आप किस कॉलम की भविष्यवाणी करना चाहते हैं, और सिस्टम स्वचालित रूप से दर्जनों एल्गोरिदम का परीक्षण करता है, जिससे सर्वोत्तम परिणाम मिलता है।

चेहरे के स्थानों को गले लगाना

हगिंग फेस ने उन्नत एआई मॉडल तक पहुंच को लोकतांत्रिक बना दिया है आप कोड लिखने के बिना भाषा और दृष्टि मॉडल को ठीक कर सकते हैं (ठीक-ट्यून) मंच तैयार किए गए टेम्पलेट प्रदान करता है; आप बस अपने डेटा के अनुकूल हैं और मिनटों में तैनात करते हैं चैटबॉट, टेक्स्ट वर्गीकरण और भावना विश्लेषण के लिए इसका कई उपयोग करें।

प्रशिक्षण के लिए अपना डेटा तैयार करना

प्रशिक्षण की गुणवत्ता पूरी तरह से डेटा की गुणवत्ता पर निर्भर करती है खराब डेटा आता है, खराब भविष्यवाणियां बाहर आती हैं इसलिए, डेटा तैयार करना सबसे महत्वपूर्ण और अक्सर सबसे उपेक्षित कदम है।

संग्रह और संगठन

समस्या के प्रासंगिक उदाहरणों को इकट्ठा करके शुरू करें जिसे आप हल करना चाहते हैं यदि आप ईमेल को स्पैम या वैध के रूप में वर्गीकृत करने के लिए एक मॉडल का प्रशिक्षण दे रहे हैं, तो प्रत्येक प्रकार के ५०० से १,००० उदाहरण एकत्र करें यदि यह उत्पाद दोष का पता लगाने वाला है, तो कम से कम २०० अच्छे उत्पादों और २०० दोषपूर्ण लोगों को विभिन्न कोणों और रोशनी से फोटोग्राफ करें।

अपने डेटा को तार्किक फ़ोल्डरों में या एक संरचित फ़ाइल (सीएसवी, एक्सेल, या जेएसओएन) में व्यवस्थित करें सारणीबद्ध डेटा के लिए, प्रत्येक पंक्ति एक उदाहरण है और प्रत्येक कॉलम एक विशेषता है छवियों के लिए, उन्हें उस वर्ग द्वारा नामित सबफ़ोल्डर्स में रखें जो वे प्रतिनिधित्व करते हैं।

सफाई एवं संतुलन

डुप्लिकेट, अपूर्ण या स्पष्ट रूप से गलत उदाहरणों को हटा दें यदि आप एक वर्ग से ९०० उदाहरणों और दूसरे से १०० के साथ एक मॉडल को प्रशिक्षित करते हैं, तो यह बहुसंख्यक वर्ग का पक्ष लेना सीख जाएगा आदर्श रूप से, आपके पास समान मात्रा होनी चाहिए: यदि आप नहीं कर सकते हैं, तो कई प्लेटफ़ॉर्म वेटिंग विकल्प या स्वचालित वृद्धि (अल्पसंख्यक उदाहरणों का सिंथेटिक निर्माण) प्रदान करते हैं।

प्रारूपों को मानकीकृत करें: सभी छवियां एक ही आकार और प्रारूप में, सभी पाठ एक ही एन्कोडिंग के साथ, एक ही पैटर्न में दिनांक। इस तरह के छोटे विवरण काम करने वाले मॉडल और विफल होने वाले मॉडल के बीच अंतर करते हैं।

सेटों में विभाजन

हमेशा अपने डेटा को तीन भागों में विभाजित करें: प्रशिक्षण (७०%), सत्यापन (१५%) और परीक्षण (१५%) प्रशिक्षण वह जगह है जहां मॉडल सीखता है, सत्यापन हाइपर-पैरामीटर (सेटिंग्स) को समायोजित करता है, और परीक्षण वास्तविक प्रदर्शन का मूल्यांकन नहीं करता है-कोड प्लेटफॉर्म स्वचालित रूप से करते हैं, लेकिन अवधारणा को समझने से आपको यह आकलन करने में मदद मिलती है कि परिणाम समझ में आता है या नहीं।

व्यावहारिक कदम से कदम: आज से शुरू

१ अपनी समस्या चुनें

यह "व्यवसाय में सुधार" नहीं है; यह "ग्राहक समीक्षाओं को सकारात्मक या नकारात्मक के रूप में वर्गीकृत करना" या "यह पता लगाना है कि ग्राहक द्वारा सदस्यता समाप्त करने की अत्यधिक संभावना कब है"।

२ अनुकरणीय डेटा इकट्ठा

१०० और १,००० उदाहरणों के बीच इकट्ठा करें जो आप भविष्यवाणी करना चाहते हैं यदि आपके पास डेटा इतिहास (पुराने ईमेल, पुरानी तस्वीरें, रिकॉर्ड) हैं, तो इसका उपयोग करें यदि आप नहीं करते हैं, तो बनाएं: फोटोग्राफ उत्पाद, उदाहरण के लिए ग्राहकों से पूछें, संबंधित सार्वजनिक डेटा की गुणवत्ता मात्रा से अधिक मायने रखती है; २०० अच्छी तरह से चुने गए उदाहरण २,००० यादृच्छिक उदाहरणों से अधिक हैं।

३ मानक प्रारूप में व्यवस्थित करें

पाठ वर्गीकरण के लिए: दो कॉलम (पाठ, श्रेणी) के साथ एक फ़ाइल छवियों के लिए: अंदर वर्ग द्वारा नामित फ़ोल्डर संख्यात्मक डेटा के लिए: सीएसवी अच्छी तरह से लेबल किए गए कॉलम के साथ लापता मूल्यों की जांच करें और तय करें कि औसत/माध्यिका को हटाने या भरने के लिए।

४ प्लेटफॉर्म चुनें

शुरुआती लोगों के लिए: गूगल टीचेबल मशीन (छवियां/ध्वनियां) या हगिंग फेस (पाठ) सारणीबद्ध डेटा के लिए: एज़्योर ऑटोएमएल या गूगल क्लाउड ऑटोएमएल मुफ्त खाता बनाएं, त्वरित दस्तावेज (१५ मिनट) पढ़ें और इसे आज़माएं।

५ डेटा लोड करें और कॉन्फ़िगर करें

प्लेटफ़ॉर्म विधि के अनुसार फ़ाइल या फ़ोल्डर्स अपलोड करें सेट करें कि कौन सा कॉलम लक्ष्य है (आप क्या भविष्यवाणी करना चाहते हैं) और सिस्टम प्रक्रिया को जाने दें अधिकांश प्लेटफ़ॉर्म वास्तविक समय में प्रगति दिखाते हैं।

६ परिणामों का मूल्यांकन करें

प्रशिक्षण के बाद, आपको एक सटीकता (हिट का प्रतिशत) मिलता है यदि यह ८०% से ऊपर है, तो यह अधिकांश वास्तविक मामलों के लिए अच्छा है ७०% से नीचे, अपने डेटा की समीक्षा करें: डुप्लिकेट, गलत लेबल वाले डेटा या असंतुलित कक्षाएं हो सकती हैं।

७ परीक्षण और कार्यान्वयन

उत्पादन में टेम्पलेट का उपयोग करें मंच एक यूआरएल या कोड प्रदान करता है जिसे आप अपनी वेबसाइट, ऐप या सिस्टम में एकीकृत करते हैं शुरुआती दिनों में प्रदर्शन की निगरानी करें: वास्तविक दुनिया प्रशिक्षण डेटा से अलग है, इसलिए समस्याओं के बारे में जागरूक होने से त्वरित सुधार करने में मदद मिलती है।

सामान्य गलतियाँ और उनसे कैसे बचें

सामान्य नुकसान में पड़े बिना एक मॉडल को प्रशिक्षित करने से हफ्तों तक दोबारा काम करना पड़ता है। सबसे बड़ी गलती परीक्षण डेटा के साथ मिश्रित वर्कआउट डेटा का उपयोग करना है: आप बढ़ी हुई सटीकता को मापेंगे जो वास्तविक प्रदर्शन को प्रतिबिंबित नहीं करती है।

एक और लगातार गलती: कारणता के साथ सहसंबंध भ्रमित करना यदि आपका मॉडल भविष्यवाणी करता है कि एक निश्चित मूल के उपनाम वाले ग्राहक अधिक रद्द करते हैं, तो ऐसा इसलिए नहीं है क्योंकि उपनाम रद्द करने का कारण बनता है, ऐसा इसलिए है क्योंकि अन्य कारक (स्थान, आय, भाषा) मॉडल को डेटा के साथ प्रशिक्षण देने से बचें जो भेदभावपूर्ण पूर्वाग्रह का कारण बनता है।

२०२२ डेटा पर प्रशिक्षित एक मॉडल २०२४ में विफल हो सकता है यदि उपयोगकर्ता व्यवहार बदल गया है सटीकता की लगातार निगरानी करें और अद्यतन डेटा के साथ हर ३ से ६ महीने में फिर से प्रशिक्षित करें।

अगले कदम और सतत विकास

अपने पहले मॉडल के काम करने के बाद, विस्तार करें अधिक डेटा जोड़ें, विभिन्न प्लेटफार्मों के साथ प्रयोग करें, जटिलता बढ़ाएं एक मॉडल जो सरल शुरू हुआ वह एक पूर्ण प्रणाली में विकसित हो सकता है जो आपके परिचालन कार्य का ४०% स्वचालित करता है।

विभिन्न कार्यों के लिए कई मॉडलों को प्रशिक्षित करने पर विचार करें। एक मार्केटिंग एजेंसी के पास लीड रैंक करने के लिए एक मॉडल हो सकता है, दूसरा हेडलाइन उत्पन्न करने के लिए, दूसरा पोस्टिंग समय की बेहतर भविष्यवाणी करने के लिए हो सकता है।

ऑनलाइन समुदायों में शामिल हों: चेहरे मंचों को गले लगाना, एआई सबरेडिट्स, यूट्यूब पर पाठ्यक्रम दूसरों के अनुभवों से सीखना आपकी महारत को तेज करता है अधिकांश संसाधन मुफ्त और व्यावहारिक हैं।