AIUnlimited
🌳

Fondations IA

🌱
AI Seeds

Partez de zéro

🌿
AI Sprouts

Construisez les fondations

🌳
AI Branches

Mettez en pratique

🏕️
AI Canopy

Approfondissez

🌲
AI Forest

Maîtrisez l'IA

🔨

Maîtrise IA

✏️
AI Sketch

Partez de zéro

🪨
AI Chisel

Construisez les fondations

⚒️
AI Craft

Mettez en pratique

💎
AI Polish

Approfondissez

🏆
AI Masterpiece

Maîtrisez l'IA

📘

Pratique IA

📖
Comprendre les modèles open-source

Fondamentaux et ressources pour les modèles open-source

🎯
Du problème à la tâche modèles

Transformer les problèmes métier en tâches modèles

⚡
Exécuter votre premier modèle

Voyez vos premiers résultats en 30 minutes

🔧
Fine-tuning et évaluation

Affinez les modèles et évaluez les performances

🚀
Systèmes d'application

Construisez des applications IA réelles

🎨
IA générative

Explorez les modèles AIGC open-source

🤖
Agents

Apprenez les frameworks Agent et outils MCP

📐
Fondamentaux supplémentaires

Bases LLM et évaluation

🎓

Claude Académie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Labo

7 expériences chargées
🧬Bac à sable neuronal🤖IA ou Humain ?🥋Dojo d'ingénierie de prompts🏁Course d'algorithmes🧠Quiz IA🏗️Canevas de conception système
🎯Entretien simuléEntrer dans le labo→
🚀

Développement de carrière

🚀
Rampe de lancement entretien

Commencez votre parcours

🌟
Maîtrise comportementale

Maîtrisez les compétences relationnelles

💻
Entretiens techniques

Réussissez l'épreuve de code

🤖
Entretiens IA et ML

Maîtrisez l'entretien ML

🏆
Offre et au-delà

Décrochez la meilleure offre

Commencer
AIUnlimited

Licence MIT

沪ICP备18025655号-11

Apprendre

  • Bases de l'IA
  • Pratique IA
  • Claude Académie
  • Labo
  • Développement de carrière

Communauté

  • À propos
  • FAQ

Soutien

  • Conditions d'utilisation
  • Politique de confidentialité
  • Contact
Programmes d'IA et d'ingénierie›📖 Comprendre les modèles open-source›Leçons›Data: The Foundation of Fine-Tuning
📊
Comprendre les modèles open-source • Débutant⏱️ 12 min de lecture

Data: The Foundation of Fine-Tuning

Les Données sont la Base de l'Affinement des Modèles Open Source

Avez-vous déjà rencontré un modèle qui excelle en codage et mathématiques, mais donne des réponses aléatoires aux questions du quotidien ?

On sait tous que pour améliorer une capacité spécifique lors de l'entraînement, il faut trouver le type de données correspondant,

Mais de nombreux jeux de données sont difficiles à trouver par recherche directe. Un portail unifié fait gagner un temps précieux aux formateurs.

Par exemple, notre jeu de données distillé DeepSeek-R1 en chinois a été en grande partie téléchargé depuis ModelScope,

illustration

L'affinement d'un modèle peut commencer par un jeu de données open source existant, permettant de tester rapidement l'ensemble du processus.

Trouver des Données Commence par Savoir Ce que Vous Voulez Faire

ModelScope offre plus de 40 000 jeux de données open source, avec recherche, aperçu, descriptions de champs et versions.

ModelScope permet la recherche par mots-clés et catégories de tâches, comme les données de classification binaire en chinois,

illustration

Avant de Télécharger, Consultez Quelques Échantillons

Après avoir filtré, sélectionnez un jeu de données et cliquez sur 'Aperçu' pour voir les échantillons, comme simpleai/HC3-Chinese.

illustration

Quelle colonne contient la question, la réponse, les labels, et si chaque enregistrement est un texte ou un dialogue — tout cela peut être vérifié à l'avance.

Pour les données QA, les réponses humaines et modélisées peuvent être dans des champs différents. Décidez quels champs lire et comment organiser avant l'entraînement.

Vérifiez les fichiers et versions. Les jeux de données sont mis à jour ; notez la version utilisée pour la reproductibilité.

illustration

Les descriptions et licences valent la peine d'être consultées. Les données téléchargées peuvent avoir des exigences différentes pour la recherche, l'entraînement ou l'usage commercial.

Chargez les Données d'Abord, puis Décidez Quoi Utiliser

ModelScope fournit l'interface MsDataset.load pour charger des jeux de données en Python. Après installation, suivez les instructions de la page du jeu de données.

Chargez d'Abord un Jeu de Données Complet

Avec DAMO_NLP/jd comme exemple, voici comment lire la configuration par défaut,

Leçon 3 sur 40% terminé
←Model Discovery and Downloads

Discussion

Se connecter pour rejoindre la discussion

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'DAMO_NLP/jd',
    trust_remote_code=True,
)
print(ds)
illustration

Si Vous N'avez Besoin que d'un Sous-ensemble, Précisez le Nom

Certains jeux de données séparent les données par source, domaine ou usage. Si vous n'avez besoin que d'une partie, utilisez subset_name.

Par exemple, chargez le sous-ensemble baike de HC3-Chinese.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    trust_remote_code=True,
)
print(ds)
illustration

Lors du changement de jeu de données, vérifiez les sous-ensembles disponibles. baike est spécifique à ce jeu de données.

Les Ensembles d'Entraînement et de Test Peuvent Être Chargés Séparément

Le sous-ensemble sélectionne la catégorie, tandis que split sélectionne la partition. Les plus courants sont train, validation et test.

Pour charger uniquement l'ensemble d'entraînement de baike, ajoutez un paramètre.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    split='train',
    trust_remote_code=True,
)
print(ds[0])
illustration

Tous les jeux de données ne fournissent pas les trois partitions. Après avoir obtenu l'ensemble d'entraînement, imprimez un échantillon pour vérifier.

Pour Reproduire une Expérience, Notez la Version

Après une mise à jour, le même code peut lire un contenu différent. Avec HC3-Chinese v1 comme exemple, spécifiez via version.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    version='v1',
    trust_remote_code=True,
)
print(ds)
illustration

Vérifiez les versions disponibles sur la page. Si une version est mise à jour en continu, conservez les fichiers ou checksums utilisés.

Données Téléchargées ? Ne Précipitez Pas le Modèle

Vérifiez d'abord quelques échantillons pour les valeurs nulles, caractères corrompus ou erreurs évidentes, puis confirmez que les champs répondent aux exigences du code d'entraînement.

Les données d'entraînement et de test doivent être séparées. Ne mélangez pas les échantillons de test dans l'ensemble d'entraînement.