కోడింగ్ మరియు గణితంలో అద్భుతంగా పనిచేసే, కానీ ప్రతిరోజూ ప్రశ్నలకు యాదృచ్ఛికంగా సమాధానం ఇచ్చే మోడల్ను ఎదుర్కొన్నారా?
మనందరికీ తెలుసు, శిక్షణ సమయంలో నిర్దిష్ట సామర్థ్యాన్ని మెరుగుపరచాలంటే ఆ రకమైన డేటాను కనుగొనాలి,
కానీ చాలా డేటాసెట్లు నేరుగా ఇంటర్నెట్ శోధనలో కనుగొనడం కష్టం. ఏకీకృత డౌన్లోడ్ పోర్టల్ శిక్షణదారులకు చాలా శ్రమను ఆదా చేస్తుంది.
ఉదాహరణకు, మా చైనీస్ DeepSeek-R1 డిస్టిల్డ్ డేటాసెట్ ముడి డేటాలో చాలా భాగం ModelScope నుండి నేరుగా డౌన్లోడ్ చేయబడింది,
మోడల్ ఫైన్-ట్యూనింగ్ ఉన్న ఓపెన్ సోర్స్ డేటాసెట్ నుండి ప్రారంభించవచ్చు, పూర్తి ప్రక్రియను వేగంగా నడపవచ్చు.
ModelScope 40,000 కంటే ఎక్కువ ఓపెన్ సోర్స్ డేటాసెట్లను అందిస్తుంది, శోధన, ప్రివ్యూ, ఫీల్డ్ వివరణలు మరియు వెర్షన్లతో.
ModelScope కీవర్డ్ ట్యాగ్లు మరియు పని వర్గాల ప్రకారం శోధనను మద్దతు ఇస్తుంది, చైనీస్ బైనరీ టెక్స్ట్ క్లాసిఫికేషన్ డేటా వంటివి.
ఫిల్టర్ చేసిన తర్వాత, ఒక డేటాసెట్ ఎంచుకుని 'డేటా ప్రివ్యూ' క్లిక్ చేయండి. simpleai/HC3-Chinese వంటివి.
ఏ కాలమ్ ప్రశ్న, సమాధానం, లేబుల్స్ కలిగి ఉంటుంది, మరియు ప్రతి రికార్డ్ టెక్స్ట్ లేదా సంభాషణ — ఇది ముందుగానే తనిఖీ చేయవచ్చు.
QA డేటా కోసం, మానవ మరియు మోడల్ సమాధానాలు వేర్వేరు ఫీల్డ్లలో ఉండవచ్చు. శిక్షణ ముందు ఏ ఫీల్డ్లు చదవాలో నిర్ణయించండి.
డేటాసెట్ ఫైల్స్ మరియు వెర్షన్లు చూడండి. డేటాసెట్లు అప్డేట్ అవుతాయి; పునరుత్పత్తి కోసం ఉపయోగించిన వెర్షన్ నోట్ చేయండి.
డేటాసెట్ వివరణలు మరియు లైసెన్స్ కూడా చూడదగినవి. డౌన్లోడ్ చేసిన డేటా పరిశోధన, శిక్షణ లేదా వాణిజ్య ఉపయోగం కోసం వేర్వేరు అవసరాలు కలిగి ఉండవచ్చు.
ModelScope MsDataset.load ఇంటర్ఫేస్ అందిస్తుంది, Python లో డేటాసెట్లను లోడ్ చేయవచ్చు. ఇన్స్టాల్ తర్వాత, డేటాసెట్ పేజీ సూచనలను అనుసరించండి.
DAMO_NLP/jd ఉదాహరణగా, డిఫాల్ట్ కాన్ఫిగరేషన్ ఇలా చదవవచ్చు,
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)
సైన్ ఇన్ చర్చలో చేరండి
కొన్ని డేటాసెట్లు మూలం, రంగం లేదా ఉపయోగం ప్రకారం డేటాను వేరు చేస్తాయి. మీకు ఒక భాగం మాత్రమే కావాలంటే, subset_name ఉపయోగించండి.
ఉదాహరణకు, HC3-Chinese నుండి baike సబ్సెట్ లోడ్ చేయండి.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

డేటాసెట్ మార్చేటప్పుడు, అందుబాటులో ఉన్న సబ్సెట్లను తనిఖీ చేయండి. baike ఈ డేటాసెట్ యొక్క ప్రత్యేక పేరు.
సబ్సెట్ డేటా వర్గాన్ని ఎంచుకుంటుంది, split డేటా విభజనను ఎంచుకుంటుంది. సాధారణంగా train, validation, మరియు test.
baike సబ్సెట్ నుండి శిక్షణ సెట్ మాత్రమే లోడ్ చేయాలంటే, మరొక పారామీటర్ జోడించండి.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

ప్రతి డేటా కూడా ఈ మూడు విభజనలను ఏకకాలంలో అందించదు; ఖచ్చితమైన పేర్లు డేటాసెట్ వివరణలో చూడాలి. శిక్షణ సెట్ పొందిన తర్వాత, ముందుగా ఒక నమూనా ప్రింట్ చేసి, ఫీల్డ్లు మరియు కంటెంట్ అంచనాలకు అనుగుణంగా ఉన్నాయో లేదో నిర్ధారించండి, తర్వాత తదుపరి ప్రాసెసింగ్ కోడ్ను జోడించండి.
అప్డేట్ల తర్వాత, అదే కోడ్ వేరే కంటెంట్ చదవగలదు. HC3-Chinese v1 ఉదాహరణగా, version ద్వారా నిర్దిష్టం చేయండి.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

వాస్తవ ఆపరేషన్లో, డేటాసెట్ పేజీలో అందుబాటులో ఉన్న వెర్షన్లను తనిఖీ చేయండి. వెర్షన్ నిరంతరంగా అప్డేట్ అవుతుంటే, ఉపయోగించిన ఫైల్స్ లేదా చెక్సమ్లను సేవ్ చేయండి.
మొదట కొన్ని నమూనాలను ఖాళీ విలువలు, టూటిన అక్షరాలు లేదా స్పష్టమైన తప్పుల కోసం తనిఖీ చేయండి, తర్వాత ఫీల్డ్లు కోడ్ అవసరాలను తీరుస్తాయని నిర్ధారించండి.
శిక్షణ మరియు పరీక్షా డేటాను వేరుగా ఉంచండి. పరీక్షా నమూనాలను శిక్షణ సెట్లో కలపవద్దు.