Avez-vous déjà rencontré un modèle qui excelle en codage et mathématiques, mais donne des réponses aléatoires aux questions du quotidien ?
On sait tous que pour améliorer une capacité spécifique lors de l'entraînement, il faut trouver le type de données correspondant,
Mais de nombreux jeux de données sont difficiles à trouver par recherche directe. Un portail unifié fait gagner un temps précieux aux formateurs.
Par exemple, notre jeu de données distillé DeepSeek-R1 en chinois a été en grande partie téléchargé depuis ModelScope,
L'affinement d'un modèle peut commencer par un jeu de données open source existant, permettant de tester rapidement l'ensemble du processus.
ModelScope offre plus de 40 000 jeux de données open source, avec recherche, aperçu, descriptions de champs et versions.
ModelScope permet la recherche par mots-clés et catégories de tâches, comme les données de classification binaire en chinois,
Après avoir filtré, sélectionnez un jeu de données et cliquez sur 'Aperçu' pour voir les échantillons, comme simpleai/HC3-Chinese.
Quelle colonne contient la question, la réponse, les labels, et si chaque enregistrement est un texte ou un dialogue — tout cela peut être vérifié à l'avance.
Pour les données QA, les réponses humaines et modélisées peuvent être dans des champs différents. Décidez quels champs lire et comment organiser avant l'entraînement.
Vérifiez les fichiers et versions. Les jeux de données sont mis à jour ; notez la version utilisée pour la reproductibilité.
Les descriptions et licences valent la peine d'être consultées. Les données téléchargées peuvent avoir des exigences différentes pour la recherche, l'entraînement ou l'usage commercial.
ModelScope fournit l'interface MsDataset.load pour charger des jeux de données en Python. Après installation, suivez les instructions de la page du jeu de données.
Avec DAMO_NLP/jd comme exemple, voici comment lire la configuration par défaut,
Se connecter pour rejoindre la discussion
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)

Certains jeux de données séparent les données par source, domaine ou usage. Si vous n'avez besoin que d'une partie, utilisez subset_name.
Par exemple, chargez le sous-ensemble baike de HC3-Chinese.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

Lors du changement de jeu de données, vérifiez les sous-ensembles disponibles. baike est spécifique à ce jeu de données.
Le sous-ensemble sélectionne la catégorie, tandis que split sélectionne la partition. Les plus courants sont train, validation et test.
Pour charger uniquement l'ensemble d'entraînement de baike, ajoutez un paramètre.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

Tous les jeux de données ne fournissent pas les trois partitions. Après avoir obtenu l'ensemble d'entraînement, imprimez un échantillon pour vérifier.
Après une mise à jour, le même code peut lire un contenu différent. Avec HC3-Chinese v1 comme exemple, spécifiez via version.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

Vérifiez les versions disponibles sur la page. Si une version est mise à jour en continu, conservez les fichiers ou checksums utilisés.
Vérifiez d'abord quelques échantillons pour les valeurs nulles, caractères corrompus ou erreurs évidentes, puis confirmez que les champs répondent aux exigences du code d'entraînement.
Les données d'entraînement et de test doivent être séparées. Ne mélangez pas les échantillons de test dans l'ensemble d'entraînement.