Ben je al een model tegengekomen dat uitstekend codeert en wiskunde oplost, maar willekeurige antwoorden geeft op alledaagse vragen?
We weten allemaal dat je om een specifieke vaardigheid te verbeteren tijdens het trainen de juiste gegevens moet vinden,
Maar veel gegevens vind je niet zomaar via een internetzoekopdracht; er is één uniforme downloadpoort voor gegevens, wat modeltrainers veel moeite bespaart.
Ons open-source Chinese DeepSeek-R1-ge-distilleerde dataset heeft een groot deel van de ruwe gegevens direct van ModelScope gedownload,,
Het fijnafstemmen van een model kan beginnen met een bestaande open-source dataset, waardoor het hele proces snel kan worden doorlopen.
ModelScope heeft meer dan 40.000 open-source datasets met zoekfunctie, voorbeeldweergave, veldbeschrijvingen en versies.
ModelScope ondersteunt zoeken op trefwoorden en taakcategorieën, zoals Chinese binaire tekstclassificatiegegevens,
Na het filteren selecteer je een dataset en klik je op 'Voorbeeld' om monsters en veldbeschrijvingen online te bekijken, zoals simpleai/HC3-Chinese.
Welke kolom de vraag, het antwoord, labels bevat, en of elk record tekst of dialoog is — alles kan van tevoren worden gecontroleerd.
Bij QA-gegevens kunnen menselijke en modelantwoorden in verschillende velden staan. Beslis welke velden je leest en hoe je organiseert voordat je traint.
Controleer bestanden en versies. Datasets worden bijgewerkt; noteer de gebruikte versie voor reproduceerbaarheid.
Beschrijvingen en licenties zijn het bekijken waard. Gedownloade gegevens kunnen verschillende vereisten hebben voor onderzoek, training of commercieel gebruik.
ModelScope biedt de MsDataset.load-interface om datasets in Python te laden. Na installatie volg je de instructies op de datasetpagina.
Met DAMO_NLP/jd als voorbeeld, zo lees je de standaardconfiguratie,
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)
Inloggen deelnemen aan de discussie

Sommige datasets scheiden gegevens op bron, domein of gebruik. Als je maar een deel nodig hebt, gebruik subset_name.
Bijvoorbeeld, laad de baike subset uit HC3-Chinese.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

Bij het wisselen van dataset, controleer welke subsets beschikbaar zijn. baike is specifiek voor deze dataset.
De subset selecteert de gegevenscategorie, terwijl split de gegevenspartitie selecteert. Veelvoorkomend zijn train, validation en test.
Om alleen de trainingsset van baike te laden, voeg je een extra parameter toe.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

Niet alle datasets bieden alle drie de partities aan. Na het verkrijgen van de trainingsset, druk een monster af om te verifiëren.
Na updates kan dezelfde code verschillende inhoud lezen. Met HC3-Chinese v1 als voorbeeld, specificeer via version.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

Controleer beschikbare versies op de datasetpagina. Als een versie continu wordt bijgewerkt, bewaar de gebruikte bestanden of checksums.
Controleer eerst een paar monsters op nullen, beschadigde tekens of opvallende fouten, bevestig dan dat de velden aan de eisen van de code voldoen.
Trainings- en testgegevens moeten gescheiden worden. Meng testmonsters niet in de trainingsset.