AIUnlimited
🌳

AI की नींव

🌱
AI Seeds

शून्य से शुरू करें

🌿
AI Sprouts

नींव बनाएं

🌳
AI Branches

व्यवहार में लागू करें

🏕️
AI Canopy

गहराई में जाएं

🌲
AI Forest

AI में महारत हासिल करें

🔨

AI में महारत

✏️
AI Sketch

शून्य से शुरू करें

🪨
AI Chisel

नींव बनाएं

⚒️
AI Craft

व्यवहार में लागू करें

💎
AI Polish

गहराई में जाएं

🏆
AI Masterpiece

AI में महारत हासिल करें

📘

AI व्यावहारिक

📖
ओपन-सोर्स मॉडल को समझना

ओपन-सोर्स मॉडल की बुनियादी बातें और संसाधन

🎯
समस्या से मॉडल कार्य तक

व्यावसायिक समस्याओं को मॉडल कार्यों में बदलना

⚡
अपना पहला मॉडल चलाना

30 मिनट में अपने पहले परिणाम देखें

🔧
फाइन-ट्यूनिंग और मूल्यांकन

मॉडल फाइन-ट्यून करें और प्रदर्शन का मूल्यांकन करें

🚀
अनुप्रयोग प्रणालियाँ

वास्तविक AI अनुप्रयोग बनाएं

🎨
जनरेटिव AI

ओपन-सोर्स AIGC मॉडल का अन्वेषण करें

🤖
एजेंट

एजेंट फ्रेमवर्क और MCP टूल सीखें

📐
पूरक बुनियादी बातें

LLM की बुनियादी बातें और मूल्यांकन

🎓

क्लाउड अकादमी

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

लैब

7 प्रयोग लोड हुए
🧬Neural Network Playground🤖AI या इंसान?🥋Prompt Engineering Dojo🏁Algorithm Race🧠AI ट्रिविया चैलेंज🏗️सिस्टम डिज़ाइन कैनवस
🎯मॉक इंटरव्यूलैब में जाएँ→
🚀

करियर विकास

🚀
इंटरव्यू लॉन्चपैड

अपनी यात्रा शुरू करें

🌟
व्यवहारिक इंटरव्यू में महारत

सॉफ्ट स्किल्स में महारत

💻
तकनीकी इंटरव्यू

कोडिंग राउंड में सफल हों

🤖
AI और ML इंटरव्यू

ML इंटरव्यू में महारत

🏆
ऑफर और उससे आगे

सबसे अच्छा ऑफर पाएं

सीखना शुरू करें - यह बुनियादी है
AIUnlimited

MIT लाइसेंस

沪ICP备18025655号-11

सीखें

  • AI बुनियादी बातें
  • AI व्यावहारिक
  • क्लाउड अकादमी
  • लैब
  • करियर विकास

समुदाय

  • हमारे बारे में
  • सामान्य प्रश्न

सहायता

  • footer.terms
  • footer.privacy
  • footer.contact
AI और इंजीनियरिंग प्रोग्राम›🌿 AI Sprouts›पाठ›Supervised बनाम Unsupervised Learning: मुख्य अंतर समझाए गए
🔀
AI Sprouts • मध्यम⏱️ 25 मिनट पढ़ने का समय

Supervised बनाम Unsupervised Learning: मुख्य अंतर समझाए गए

पर्यवेक्षित बनाम अपर्यवेक्षित शिक्षण: मुख्य अंतरों की व्याख्या

जब आप मशीन लर्निंग सीखना शुरू करते हैं, तो रास्ते में पहला कांटा यह होता है: आप किस तरह की लर्निंग कर रहे हैं? उत्तर सब कुछ बदल देता है - आपके लिए उपलब्ध एल्गोरिदम, आपके लिए आवश्यक डेटा, और आप अपने मॉडल से क्या करने की उम्मीद कर सकते हैं।

दो मूलभूत श्रेणियां हैं पर्यवेक्षित शिक्षण और पर्यवेक्षित शिक्षण। अंतर को समझना केवल अकादमिक नहीं है - किसी भी नई एमएल समस्या पर विचार करते समय यह पहला निर्णय है जो आप लेंगे।

🏷️ मुख्य भेद: लेबल

पर्यवेक्षित और बिना पर्यवेक्षित शिक्षण के बीच सबसे बुनियादी अंतर यह है कि क्या आपके प्रशिक्षण डेटा में लेबल शामिल हैं।

लेबल डेटा का अर्थ है कि आपके डेटासेट में प्रत्येक उदाहरण "सही उत्तर" के साथ आता है - वह परिणाम जो आप चाहते हैं कि मॉडल भविष्यवाणी या वर्गीकृत करे:

# Labelled dataset (supervised)
email_text                          | label
------------------------------------|-------
"Congratulations! You've won £1000" | spam
"Meeting rescheduled to Thursday"   | not_spam
"URGENT: Your account is suspended" | spam

बिना लेबल वाला डेटा का मतलब है कि आपके पास इनपुट तो हैं लेकिन कोई पूर्व-परिभाषित उत्तर नहीं हैं - केवल कच्ची टिप्पणियाँ:

# Unlabelled dataset (unsupervised)
customer_id | age | annual_spend | frequency | location
------------|-----|--------------|-----------|----------
C001        | 34  | £2,400       | 12/year   | London
C002        | 52  | £18,000      | 52/year   | Manchester
C003        | 28  | £650         | 3/year    | London

लेबल किया गया डेटा महंगा और समय लेने वाला है - इसके लिए मनुष्यों को उदाहरणों को मैन्युअल रूप से एनोटेट करने की आवश्यकता होती है। बिना लेबल वाला डेटा प्रचुर मात्रा में है (दुनिया के अधिकांश डेटा में कोई लेबल नहीं है)। यह व्यावहारिक बाधा यह निर्धारित करती है कि किसी दी गई समस्या के लिए कौन सा दृष्टिकोण संभव है।

✅ पर्यवेक्षित शिक्षण

पर्यवेक्षित शिक्षण में, मॉडल लेबल किए गए उदाहरणों का अध्ययन करके इनपुट से आउटपुट तक मैपिंग सीखता है। "पर्यवेक्षक" स्वयं लेबल किया गया डेटा है - प्रत्येक प्रशिक्षण उदाहरण मॉडल को बताता है कि सही आउटपुट क्या होना चाहिए।

वर्गीकरण

जब आउटपुट अलग श्रेणी होता है, तो यह एक वर्गीकरण समस्या है।

उदाहरण:

  • क्या यह ईमेल स्पैम है या स्पैम नहीं है?
  • क्या इस छवि में बिल्ली या कुत्ता है?
  • क्या यह ऋण आवेदक डिफॉल्ट करेगा? (हां/नहीं)
पाठ 14 / 160% पूर्ण
←Feature Engineering: मशीनों को महत्वपूर्ण बातें सिखाना

चर्चा

साइन इन करें चर्चा में शामिल हों

  • यह हस्तलिखित संख्या किस अंक (0-9) को दर्शाती है?
  • सामान्य एल्गोरिदम:

    • लॉजिस्टिक रिग्रेशन
    • निर्णय वृक्ष और यादृच्छिक वन
    • सपोर्ट वेक्टर मशीनें (एसवीएम)
    • तंत्रिका नेटवर्क
    from sklearn.ensemble import RandomForestClassifier
    from sklearn.model_selection import train_test_split
    
    X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)
    
    classifier = RandomForestClassifier(n_estimators=100)
    classifier.fit(X_train, y_train)
    
    accuracy = classifier.score(X_test, y_test)
    print(f"Test accuracy: {accuracy:.2%}")
    

    प्रतिगमन

    जब आउटपुट निरंतर संख्या होता है, तो यह एक प्रतिगमन समस्या है।

    उदाहरण:

    • यह घर किसमें बिकेगा?
    • कल इस शेयर की कीमत क्या होगी?
    • अगले महीने हम कितनी इकाइयाँ बेचेंगे?
    • छह माह में मरीज का रक्तचाप कितना होगा?

    सामान्य एल्गोरिदम:

    • रेखीय प्रतिगमन
    • रिज / लासो रिग्रेशन
    • ग्रेडिएंट बूस्टिंग (XGBoost, LightGBM)
    • तंत्रिका नेटवर्क
    from sklearn.ensemble import GradientBoostingRegressor
    
    model = GradientBoostingRegressor(n_estimators=200, learning_rate=0.1)
    model.fit(X_train, y_train)
    
    predictions = model.predict(X_test)
    # predictions = [245000, 182000, 412000, ...]  (house prices in £)
    
    🤯
    ग्रेडिएंट बूस्टिंग मॉडल (XGBoost, LightGBM, CatBoost) ने किसी भी अन्य एल्गोरिदम श्रेणी की तुलना में अधिक कागल मशीन लर्निंग प्रतियोगिताएं जीती हैं। वे उद्योग में संरचित/सारणीबद्ध डेटा के लिए पसंदीदा विकल्प बने हुए हैं।

    🔍 बिना पर्यवेक्षण के सीखना

    बिना पर्यवेक्षित शिक्षण में, मॉडल बिना किसी लेबल के डेटा की संरचना का पता लगाता है। किसी ज्ञात आउटपुट के लिए मैपिंग सीखने के बजाय, यह अपने आप ही छिपे हुए पैटर्न, समूह या प्रतिनिधित्व की खोज करता है।

    क्लस्टरिंग

    क्लस्टर एल्गोरिदम समान डेटा बिंदुओं को एक साथ समूहित करते हैं, बिना यह बताए कि समूह क्या होने चाहिए।

    उदाहरण:

    • क्रय व्यवहार के आधार पर ग्राहकों को विभाजित करें (पूर्व-परिभाषित खंडों के बिना)
    • विषय के आधार पर दस्तावेज़ों को समूहित करें
    • सामाजिक नेटवर्क में समुदायों की पहचान करें
    • विसंगतियों का पता लगाएं (ऐसे बिंदु जो किसी क्लस्टर से संबंधित नहीं हैं)

    सामान्य एल्गोरिदम:

    • के-मीन्स क्लस्टरिंग
    • DBSCAN (घनत्व-आधारित, अनियमित आकृतियों को संभालता है)
    • पदानुक्रमित क्लस्टरिंग
    from sklearn.cluster import KMeans
    
    # We don't know how many customer segments exist — let's try 4
    kmeans = KMeans(n_clusters=4, random_state=42)
    kmeans.fit(customer_data_scaled)
    
    # Each customer now has a cluster label (0, 1, 2, or 3)
    df['segment'] = kmeans.labels_
    
    # Analyse what each segment looks like
    print(df.groupby('segment')[['age', 'annual_spend', 'frequency']].mean())
    

    आयामीता में कमी

    यथासंभव अधिक संरचना को संरक्षित करते हुए उच्च-आयामी डेटा को कम आयामों में संपीड़ित करें। विज़ुअलाइज़ेशन, प्री-प्रोसेसिंग और अनावश्यक जानकारी को हटाने के लिए उपयोग किया जाता है।

    सामान्य एल्गोरिदम:

    • पीसीए (प्रिंसिपल कंपोनेंट एनालिसिस) - रैखिक संपीड़न
    • टी-एसएनई - गैर-रैखिक, विज़ुअलाइज़ेशन के लिए उत्कृष्ट
    • यूएमएपी - तेज़, स्थानीय और वैश्विक संरचना दोनों को संरक्षित करता है
    • ऑटोएन्कोडर्स - तंत्रिका नेटवर्क-आधारित संपीड़न
    from sklearn.decomposition import PCA
    import matplotlib.pyplot as plt
    
    # Reduce 50-dimensional data to 2D for visualisation
    pca = PCA(n_components=2)
    X_2d = pca.fit_transform(X_scaled)
    
    plt.scatter(X_2d[:, 0], X_2d[:, 1], c=cluster_labels, cmap='tab10')
    plt.title('Customer segments visualised in 2D')
    plt.show()
    
    🤔
    Think about it:एक खुदरा विक्रेता के पास 10 मिलियन ग्राहकों का लेनदेन डेटा है लेकिन कोई पूर्व-निर्धारित ग्राहक खंड नहीं है। अप्रकाशित क्लस्टरिंग यहाँ क्यों उपयोगी होगी? खोजे गए खंड कौन से व्यावसायिक निर्णय सूचित कर सकते हैं?

    🔄 बाइनरी से परे: अन्य शिक्षण प्रतिमान

    पर्यवेक्षित/अपर्यवेक्षित भेद मूलभूत है, लेकिन एमएल परिदृश्य इन दो श्रेणियों की तुलना में अधिक समृद्ध है।

    अर्ध-पर्यवेक्षित शिक्षण

    लेबल किए गए डेटा की छोटी मात्रा को बिना लेबल किए गए डेटा की बड़ी मात्रा के साथ मिलाकर उपयोग करता है। यह बहुत व्यावहारिक है क्योंकि लेबलिंग महंगी है।

    उदाहरण: आपके पास 1,000 लेबल वाले मेडिकल स्कैन और 100,000 बिना लेबल वाले स्कैन हैं। अर्ध-पर्यवेक्षित शिक्षण आपको बिना लेबल वाले डेटा से लाभ उठाकर प्रदर्शन में सुधार करने की सुविधा देता है, जो अकेले 1,000 लेबल हासिल कर सकते हैं।

    स्व-पर्यवेक्षित शिक्षण

    एक विशेष मामला जहां लेबल डेटा से ही स्वचालित रूप से उत्पन्न होते हैं। इस प्रकार आधुनिक बड़े भाषा मॉडलों को पूर्व-प्रशिक्षित किया जाता है।

    उदाहरण: एक वाक्य लें, कुछ शब्द छिपाएँ, और छूटे हुए शब्दों की भविष्यवाणी करने के लिए मॉडल को प्रशिक्षित करें। "लेबल" (सही शब्द) मुफ़्त हैं - वे सीधे पाठ से ही आते हैं। इस प्रकार BERT को प्रशिक्षित किया गया।

    Input:  "The cat sat on the [MASK]."
    Target: "mat"
    

    स्व-पर्यवेक्षित शिक्षण परिवर्तनकारी रहा है क्योंकि यह मानव एनोटेशन के बिना इंटरनेट-स्केल डेटा पर प्रशिक्षण की अनुमति देता है।

    सुदृढीकरण सीखना

    एक एजेंट वातावरण में कार्रवाई करके और पुरस्कार या दंड प्राप्त करके सीखता है। कोई लेबल नहीं हैं - केवल परिणामों से प्रतिक्रिया संकेत हैं।

    उदाहरण: शतरंज खेलना, रोबोट को चलने का प्रशिक्षण देना, डेटा सेंटर की शीतलन प्रणाली को अनुकूलित करना। हम इसे इसके अपने पाठ में गहराई से कवर करते हैं।

    🗺️ सही दृष्टिकोण का चयन करना

    यहां एक व्यावहारिक निर्णय रूपरेखा है:

    Do you have labelled data?
    ├── YES → Supervised Learning
    │         ├── Output is a category? → Classification
    │         │     (spam/not spam, dog/cat, fraud/legit)
    │         └── Output is a number?  → Regression
    │               (price, temperature, sales volume)
    └── NO  → Unsupervised Learning
              ├── Want to find groups?      → Clustering
              │     (customer segments, document topics)
              ├── Want to compress data?    → Dimensionality Reduction
              │     (visualisation, pre-processing)
              └── Want to detect anomalies? → Anomaly Detection
                    (fraud, equipment failure)
    
    Partially labelled? → Semi-Supervised Learning
    Learning from interaction? → Reinforcement Learning
    
    🧠त्वरित जांच

    आपके पास बिना स्टार रेटिंग या सेंटीमेंट लेबल वाली 50,000 उत्पाद समीक्षाएँ हैं। आप उन्हें विषय के आधार पर स्वचालित रूप से समूहित करना चाहते हैं। आपको किस शिक्षण दृष्टिकोण का उपयोग करना चाहिए?

    चाबी छीनना

    • पर्यवेक्षित शिक्षण को लेबल किए गए डेटा की आवश्यकता होती है; मॉडल इनपुट से ज्ञात आउटपुट तक मैपिंग सीखता है - वर्गीकरण (अलग आउटपुट) और प्रतिगमन (निरंतर आउटपुट) के लिए उपयोग किया जाता है
    • अनसुपरवाइज्ड लर्निंग बिना लेबल वाले डेटा के साथ काम करता है; मॉडल छिपी हुई संरचना का पता लगाता है - जिसका उपयोग क्लस्टरिंग, आयामीता में कमी और विसंगति का पता लगाने के लिए किया जाता है
    • पर्यवेक्षित और अपर्यवेक्षित के बीच का चुनाव मुख्य रूप से इस बात पर निर्भर करता है कि क्या आपने डेटा लेबल किया है और आप किस प्रश्न का उत्तर देने का प्रयास कर रहे हैं
    • अर्ध-पर्यवेक्षित शिक्षण बड़ी मात्रा में बिना लेबल वाले डेटा के साथ-साथ लेबल किए गए डेटा की थोड़ी मात्रा का उपयोग करके अंतर को पाटता है।
    • स्व-पर्यवेक्षित शिक्षण डेटा से अपने स्वयं के लेबल उत्पन्न करता है - यह बीईआरटी और जीपीटी जैसे आधुनिक एलएलएम के पीछे की तकनीक है
    • सुदृढीकरण सीखना दोनों से अलग है: एक एजेंट बिना किसी लेबल के पर्यावरण के साथ बातचीत के माध्यम से इनाम संकेतों से सीखता है
    • निर्णय ढांचे का उपयोग करें: लेबल + श्रेणी आउटपुट → वर्गीकरण; लेबल + निरंतर आउटपुट → प्रतिगमन; लेबल रहित + समूह खोजें → क्लस्टरिंग