AIUnlimited
🌳

AI की नींव

🌱
AI Seeds

शून्य से शुरू करें

🌿
AI Sprouts

नींव बनाएं

🌳
AI Branches

व्यवहार में लागू करें

🏕️
AI Canopy

गहराई में जाएं

🌲
AI Forest

AI में महारत हासिल करें

🔨

AI में महारत

✏️
AI Sketch

शून्य से शुरू करें

🪨
AI Chisel

नींव बनाएं

⚒️
AI Craft

व्यवहार में लागू करें

💎
AI Polish

गहराई में जाएं

🏆
AI Masterpiece

AI में महारत हासिल करें

📘

AI व्यावहारिक

📖
ओपन-सोर्स मॉडल को समझना

ओपन-सोर्स मॉडल की बुनियादी बातें और संसाधन

🎯
समस्या से मॉडल कार्य तक

व्यावसायिक समस्याओं को मॉडल कार्यों में बदलना

⚡
अपना पहला मॉडल चलाना

30 मिनट में अपने पहले परिणाम देखें

🔧
फाइन-ट्यूनिंग और मूल्यांकन

मॉडल फाइन-ट्यून करें और प्रदर्शन का मूल्यांकन करें

🚀
अनुप्रयोग प्रणालियाँ

वास्तविक AI अनुप्रयोग बनाएं

🎨
जनरेटिव AI

ओपन-सोर्स AIGC मॉडल का अन्वेषण करें

🤖
एजेंट

एजेंट फ्रेमवर्क और MCP टूल सीखें

📐
पूरक बुनियादी बातें

LLM की बुनियादी बातें और मूल्यांकन

🎓

क्लाउड अकादमी

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

लैब

7 प्रयोग लोड हुए
🧬Neural Network Playground🤖AI या इंसान?🥋Prompt Engineering Dojo🏁Algorithm Race🧠AI ट्रिविया चैलेंज🏗️सिस्टम डिज़ाइन कैनवस
🎯मॉक इंटरव्यूलैब में जाएँ→
🚀

करियर विकास

🚀
इंटरव्यू लॉन्चपैड

अपनी यात्रा शुरू करें

🌟
व्यवहारिक इंटरव्यू में महारत

सॉफ्ट स्किल्स में महारत

💻
तकनीकी इंटरव्यू

कोडिंग राउंड में सफल हों

🤖
AI और ML इंटरव्यू

ML इंटरव्यू में महारत

🏆
ऑफर और उससे आगे

सबसे अच्छा ऑफर पाएं

सीखना शुरू करें - यह बुनियादी है
AIUnlimited

MIT लाइसेंस

沪ICP备18025655号-11

सीखें

  • AI बुनियादी बातें
  • AI व्यावहारिक
  • क्लाउड अकादमी
  • लैब
  • करियर विकास

समुदाय

  • हमारे बारे में
  • सामान्य प्रश्न

सहायता

  • footer.terms
  • footer.privacy
  • footer.contact
AI और इंजीनियरिंग प्रोग्राम›📖 ओपन-सोर्स मॉडल को समझना›पाठ›Data: The Foundation of Fine-Tuning
📊
ओपन-सोर्स मॉडल को समझना • शुरुआती⏱️ 12 मिनट पढ़ने का समय

Data: The Foundation of Fine-Tuning

डेटा: ओपन सोर्स मॉडल फाइन-ट्यूनिंग की नींव

क्या आपने कभी ऐसा मॉडल देखा है जो कोडिंग और गणित में उत्कृष्ट है, लेकिन रोज़मर्रा के सवालों का बेतरतीब जवाब देता है?

हम सभी जानते हैं कि प्रशिक्षण के दौरान किसी विशेष क्षमता को बेहतर बनाने के लिए उस प्रकार का डेटा खोजना होता है,

लेकिन कई डेटासेट सीधे इंटरनेट खोज में मिलना मुश्किल है। एक एकीकृत डाउनलोड पोर्टल प्रशिक्षकों के लिए बहुत मेहत बचाता है।

उदाहरण के लिए, हमारे चीनी DeepSeek-R1 डिस्टिल्ड डेटासेट का कच्चा डेटा ModelScope से सीधे डाउनलोड किया गया,

चित्र

मॉडल की फाइन-ट्यूनिंग मौजूदा ओपन सोर्स डेटासेट से शुरू हो सकती है, जिससे पूरी प्रक्रिया जल्दी चलाई जा सकती है।

डेटा खोजना, पहले जानें आप क्या करने की योजना बना रहे हैं

ModelScope में 40,000 से अधिक ओपन सोर्स डेटासेट हैं, खोज, पूर्वावलोकन, फ़ील्ड विवरण और संस्करण प्रदान करता है।

ModelScope कीवर्ड टैग और कार्य श्रेणियों के अनुसार खोज का समर्थन करता है, जैसे चीनी बाइनरी टेक्स्ट वर्गीकरण डेटा।

चित्र

डाउनलोड करने से पहले, कुछ नमूने देखें

फ़िल्टरिंग के बाद, एक डेटासेट चुनें और 'डेटा पूर्वावलोकन' पर क्लिक करें। simpleai/HC3-Chinese जैसे।

चित्र

कौन सा कॉलम प्रश्न, उत्तर, लेबल रखता है, और क्या प्रत्येक रिकॉर्ड टेक्स्ट है या संवाद — यह सब पहले से जाँचा जा सकता है।

QA डेटा के लिए, मानव उत्तर और मॉडल उत्तर अलग-अलग फ़ील्ड में हो सकते हैं। प्रशिक्षण से पहले तय करें कि कौन से फ़ील्ड पढ़ने हैं।

डेटासेट फ़ाइलें और संस्करण देखें। डेटासेट अपडेट होते हैं; पुनरुत्पादन के लिए उपयोग किया गया संस्करण नोट करें।

चित्र

डेटासेट विवरण और लाइसेंस भी देखने योग्य हैं। डाउनलोड किया गया डेटा अनुसंधान, प्रशिक्षण या वाणिज्यिक उपयोग के लिए अलग-अलग आवश्यकताएं रख सकता है।

पहले डेटा लोड करें, फिर तय करें कि क्या उपयोग करना है

ModelScope MsDataset.load इंटरफ़ेस प्रदान करता है जिससे Python में डेटासेट लोड किए जा सकते हैं। इंस्टॉल के बाद, डेटासेट पेज के निर्देशों का पालन करें।

पहले एक पूर्ण डेटासेट लोड करें

DAMO_NLP/jd उदाहरण के रूप में, डिफ़ॉल्ट कॉन्फ़िगरेशन इस तरह पढ़ा जा सकता है,

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'DAMO_NLP/jd',
    trust_remote_code=True,
)
print(ds)
चित्र

यदि केवल एक सबसेट चाहिए, तो नाम स्पष्ट रूप से लिखें

पाठ 3 / 40% पूर्ण
←Model Discovery and Downloads

चर्चा

साइन इन करें चर्चा में शामिल हों

कुछ डेटासेट स्रोत, क्षेत्र या उपयोग के अनुसार डेटा अलग करते हैं। यदि केवल एक भाग चाहिए, subset_name का उपयोग करें।

जैसे, HC3-Chinese के baike सबसेट को पढ़ना।

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    trust_remote_code=True,
)
print(ds)
चित्र

डेटासेट बदलते समय, उपलब्ध सबसेट जांचें। baike इस डेटासेट का विशिष्ट नाम है।

प्रशिक्षण और परीक्षण सेट अलग-अलग लोड किए जा सकते हैं

सबसेट डेटा श्रेणी चुनता है, जबकि split डेटा विभाजन चुनता है। सामान्य हैं train, validation, और test।

baike सबसेट से केवल प्रशिक्षण सेट लोड करने के लिए, एक पैरामीटर जोड़ें।

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    split='train',
    trust_remote_code=True,
)
print(ds[0])
चित्र

हर डेटा सेट ये तीनों विभाजन एक साथ नहीं देता, विशिष्ट नाम डेटासेट विवरण देखने होंगे। ट्रेनिंग सेट मिलने के बाद, पहले एक सैंपल प्रिंट करें, पुष्टि करें कि फ़ील्ड और सामग्री अपेक्षा के अनुसार हैं, फिर आगे की प्रोसेसिंग कोड चलाएँ।

प्रयोग पुनर्सृजित करने के लिए, संस्करण भी नोट करें

अपडेट के बाद, वही कोड अलग सामग्री पढ़ सकता है। HC3-Chinese v1 उदाहरण के रूप में, version के माध्यम से निर्दिष्ट करें।

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    version='v1',
    trust_remote_code=True,
)
print(ds)
चित्र

वास्तविक संचालन में, डेटासेट पेज पर उपलब्ध संस्करण जांचें। यदि संस्करण लगातार अपडेट होता है, तो उपयोग की गई फ़ाइलें या चेकसम सहेजें।

डेटा डाउनलोड हो गया? तुरंत मॉडल को न दें

पहले कुछ नमूने जांचें रिक्त मान, टूटे अक्षर या स्पष्ट त्रुटियों के लिए, फिर पुष्टि करें कि फ़ील्ड कोड आवश्यकताओं को पूरा करते हैं।

प्रशिक्षण और परीक्षण डेटा अलग रखें। परीक्षण नमूनों को प्रशिक्षण सेट में न मिलाएं।