هل واجهت نموذجاً يبرمجة ويحل الرياضيات بشكل ممتاز، لكنه يجيب عشوائياً على الأسئلة اليومية؟
نعلم جميعاً لتحسين قدرة معينة أثناء التدريب، يجب العثور على نوع البيانات المناسب,
لكن العديد من مجموعات البيانات يصعب العثور عليها بالبحث المباشر. بوابة تنزيل موحدة توفر جهداً كبيراً.
على سبيل المثال، حصلت مجموعة بيانات الاستخلاص بالصينية من DeepSeek-R1 على جزء كبير من بياناتها الخام مباشرة من ModelScope,
يمكن بدء التحسين الدقيق للنموذج من مجموعة بيانات مفتوحة المصدر الموجودة، مما يسمح بسرعة تنفيذ العملية بأكملها.
يوفر ModelScope أكثر من 40,000 مجموعة بيانات مفتوحة المصدر مع البحث والمعاينة وأوصاف الحقول والإصدارات.
يدعم ModelScope البحث بالكلمات المفتاحية وفئات المهام، مثل بيانات التصنيف النصي الثنائي بالصينية,
بعد التصفية، حدد مجموعة البيانات واضغط 'معاينة البيانات' لعرض العينات وأوصاف الحقول عبر الإنترنت.
أي عمود يحتوي على السؤال، الجواب، التسميات، وما إذا كان كل سجل نصاً أو حواراً — يمكن التحقق من ذلك مسبقاً.
بالنسبة لبيانات الأسئلة والإجابة، قد تكون إجابات الإنسان والنموذج في حقول مختلفة. قرر أي حقول تقرأ وكيف تنظم قبل التدريب.
تحقق من الملفات والإصدارات. يتم تحديث مجموعات البيانات؛ سجّل الإصدار المستخدم لإمكانية التكرار.
الوصف والترخيص تستحق المراجعة. قد يكون للبيانات المنزّلة متطلبات مختلفة للأبحاث أو التدريب أو الاستخدام التجاري.
يوفر ModelScope واجهة MsDataset.load لتحميل مجموعات البيانات في Python. بعد التثبيت، اتبع تعليمات صفحة مجموعة البيانات.
باستخدام DAMO_NLP/jd كمثال، يمكنك قراءة الإعداد الافتراضي بهذا الشكل,
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)
بعض مجموعات البيانات تفصل البيانات حسب المصدر أو المجال أو الاستخدام. إذا كنت بحاجة لجزء فقط، استخدم subset_name.
تسجيل الدخول للانضمام إلى النقاش
على سبيل المثال، حمّل المجموعة الفرعية baike من HC3-Chinese.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

عند تغيير مجموعة البيانات، تحقق من المجموعات الفرعية المتاحة. baike محدد لهذه المجموعة.
المجموعة الفرعية تختار فئة البيانات، بينما split يختار تقسيم البيانات. الأكثر شيوعاً هو train و validation و test.
لتحميل مجموعة التدريب من baike فقط، أضف معاماً إضافياً.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

ليست جميع مجموعات البيانات تقدم التقسيمات الثلاثة. بعد الحصول على مجموعة التدريب، اطبع عيّنة للتحقق.
بعد التحديثات، قد يقرأ نفس الكود محتوىً مختلفاً. باستخدام HC3-Chinese v1 كمثال، حدد عبر version.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

تحقق من الإصدارات المتاحة على صفحة مجموعة البيانات. إذا كان الإصدار قيد التحديث المستمر، احفظ الملفات أو بيانات التحقق المستخدمة.
تحقق أولاً من بعض العينات بحثاً عن قيم فارغة أو أحرف مشوهة أو أخطاء واضحة، ثم تأكد من أن الحقول تلبي متطلبات الكود.
يجب فصل بيانات التدريب والاختبار. لا تخلط عينات الاختبار مع مجموعة التدريب.