Sind Sie schon einmal auf ein Modell gestoßen, das hervorragend programmiert und Mathe löst, aber auf Alltagsfragen zufällig antwortet?
Wir wissen alle, dass man zur Verbesserung einer bestimmten Fähigkeit während des Trainings die entsprechenden Daten finden muss,
Aber viele Datensätze sind schwer direkt im Internet zu finden. Ein einheitlicher Download-Portal spart Trainern enorm viel Aufwand.
Unser open-source chinesisches DeepSeek-R1-Distillations-Datensatz hat einen Großteil seiner Rohdaten direkt von ModelScope heruntergeladen,
Das Feintuning eines Modells kann mit einem vorhandenen Open-Source-Datensatz beginnen, sodass der gesamte Prozess schnell durchlaufen werden kann.
ModelScope bietet über 40.000 Open-Source-Datensätze mit Suche, Vorschau, Feldbeschreibungen und Versionen.
ModelScope unterstützt die Suche nach Stichwörtern und Aufgabenkategorien, z.B. chinesische binäre Textklassifikationsdaten,
Nach dem Filtern wählen Sie einen Datensatz und klicken auf 'Datenvorschau', um Proben und Feldbeschreibungen online anzusehen, wie simpleai/HC3-Chinese.
Welche Spalte die Frage, Antwort, Labels enthält und ob jeder Eintrag Text oder Dialog ist — all das kann vorab überprüft werden.
Bei QA-Daten können menschliche und Modellantworten in verschiedenen Feldern sein. Entscheiden Sie vor dem Training, welche Felder Sie lesen und wie Sie organisieren.
Überprüfen Sie Dateien und Versionen. Datensätze werden aktualisieren; notieren Sie die verwendete Version für Reproduzierbarkeit.
Beschreibungen und Lizenzen sind einen Blick wert. Heruntergeladene Daten können unterschiedliche Anforderungen für Forschung, Training oder kommerzielle Nutzung haben.
ModelScope bietet die MsDataset.load-Schnittstelle zum Laden von Datensätzen in Python. Nach der Installation folgen Sie den Anweisungen auf der Datensatzseite.
Mit DAMO_NLP/jd als Beispiel, so lesen Sie die Standardkonfiguration,
Anmelden an der Diskussion teilnehmen
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)

Einige Datensätze trennen Daten nach Quelle, Bereich oder Zweck. Wenn Sie nur einen Teil benötigen, verwenden Sie subset_name.
Laden Sie z.B. die Untermenge baike aus HC3-Chinese.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

Beim Wechsel des Datensatzes prüfen Sie die verfügbaren Untermengen. baike ist spezifisch für diesen Datensatz.
Die Untermenge wählt die Datenkategorie, während split die Datenpartition wählt. Häufige sind train, validation und test.
Um nur den Trainingsset von baike zu laden, fügen Sie einen Parameter hinzu.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

Nicht alle Datensätze bieten alle drei Partitionen. Nach Erhalt des Trainingssets drucken Sie eine Probe zur Verifizierung.
Nach Aktualisierungen kann derselbe Code unterschiedliche Inhalte lesen. Mit HC3-Chinese v1 als Beispiel, spezifizieren Sie über version.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

Prüfen Sie verfügbare Versionen auf der Datensatzseite. Wenn eine Version kontinuierlich aktualisiert wird, bewahren Sie die verwendeten Dateien oder Prüfsummen auf.
Prüfen Sie zuerst einige Proben auf Nullwerte, fehlerhafte Zeichen oder offensichtliche Fehler, dann bestätigen Sie, dass die Felder den Codeanforderungen entsprechen.
Trainings- und Testdaten müssen getrennt werden. Mischen Sie Testproben nicht in das Trainingsset.