क्या आपने कभी ऐसा मॉडल देखा है जो कोडिंग और गणित में उत्कृष्ट है, लेकिन रोज़मर्रा के सवालों का बेतरतीब जवाब देता है?
हम सभी जानते हैं कि प्रशिक्षण के दौरान किसी विशेष क्षमता को बेहतर बनाने के लिए उस प्रकार का डेटा खोजना होता है,
लेकिन कई डेटासेट सीधे इंटरनेट खोज में मिलना मुश्किल है। एक एकीकृत डाउनलोड पोर्टल प्रशिक्षकों के लिए बहुत मेहत बचाता है।
उदाहरण के लिए, हमारे चीनी DeepSeek-R1 डिस्टिल्ड डेटासेट का कच्चा डेटा ModelScope से सीधे डाउनलोड किया गया,
मॉडल की फाइन-ट्यूनिंग मौजूदा ओपन सोर्स डेटासेट से शुरू हो सकती है, जिससे पूरी प्रक्रिया जल्दी चलाई जा सकती है।
ModelScope में 40,000 से अधिक ओपन सोर्स डेटासेट हैं, खोज, पूर्वावलोकन, फ़ील्ड विवरण और संस्करण प्रदान करता है।
ModelScope कीवर्ड टैग और कार्य श्रेणियों के अनुसार खोज का समर्थन करता है, जैसे चीनी बाइनरी टेक्स्ट वर्गीकरण डेटा।
फ़िल्टरिंग के बाद, एक डेटासेट चुनें और 'डेटा पूर्वावलोकन' पर क्लिक करें। simpleai/HC3-Chinese जैसे।
कौन सा कॉलम प्रश्न, उत्तर, लेबल रखता है, और क्या प्रत्येक रिकॉर्ड टेक्स्ट है या संवाद — यह सब पहले से जाँचा जा सकता है।
QA डेटा के लिए, मानव उत्तर और मॉडल उत्तर अलग-अलग फ़ील्ड में हो सकते हैं। प्रशिक्षण से पहले तय करें कि कौन से फ़ील्ड पढ़ने हैं।
डेटासेट फ़ाइलें और संस्करण देखें। डेटासेट अपडेट होते हैं; पुनरुत्पादन के लिए उपयोग किया गया संस्करण नोट करें।
डेटासेट विवरण और लाइसेंस भी देखने योग्य हैं। डाउनलोड किया गया डेटा अनुसंधान, प्रशिक्षण या वाणिज्यिक उपयोग के लिए अलग-अलग आवश्यकताएं रख सकता है।
ModelScope MsDataset.load इंटरफ़ेस प्रदान करता है जिससे Python में डेटासेट लोड किए जा सकते हैं। इंस्टॉल के बाद, डेटासेट पेज के निर्देशों का पालन करें।
DAMO_NLP/jd उदाहरण के रूप में, डिफ़ॉल्ट कॉन्फ़िगरेशन इस तरह पढ़ा जा सकता है,
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)
साइन इन करें चर्चा में शामिल हों
कुछ डेटासेट स्रोत, क्षेत्र या उपयोग के अनुसार डेटा अलग करते हैं। यदि केवल एक भाग चाहिए, subset_name का उपयोग करें।
जैसे, HC3-Chinese के baike सबसेट को पढ़ना।
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

डेटासेट बदलते समय, उपलब्ध सबसेट जांचें। baike इस डेटासेट का विशिष्ट नाम है।
सबसेट डेटा श्रेणी चुनता है, जबकि split डेटा विभाजन चुनता है। सामान्य हैं train, validation, और test।
baike सबसेट से केवल प्रशिक्षण सेट लोड करने के लिए, एक पैरामीटर जोड़ें।
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

हर डेटा सेट ये तीनों विभाजन एक साथ नहीं देता, विशिष्ट नाम डेटासेट विवरण देखने होंगे। ट्रेनिंग सेट मिलने के बाद, पहले एक सैंपल प्रिंट करें, पुष्टि करें कि फ़ील्ड और सामग्री अपेक्षा के अनुसार हैं, फिर आगे की प्रोसेसिंग कोड चलाएँ।
अपडेट के बाद, वही कोड अलग सामग्री पढ़ सकता है। HC3-Chinese v1 उदाहरण के रूप में, version के माध्यम से निर्दिष्ट करें।
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

वास्तविक संचालन में, डेटासेट पेज पर उपलब्ध संस्करण जांचें। यदि संस्करण लगातार अपडेट होता है, तो उपयोग की गई फ़ाइलें या चेकसम सहेजें।
पहले कुछ नमूने जांचें रिक्त मान, टूटे अक्षर या स्पष्ट त्रुटियों के लिए, फिर पुष्टि करें कि फ़ील्ड कोड आवश्यकताओं को पूरा करते हैं।
प्रशिक्षण और परीक्षण डेटा अलग रखें। परीक्षण नमूनों को प्रशिक्षण सेट में न मिलाएं।