AIUnlimited
🌳

Fundamentos de IA

🌱
AI Seeds

Empieza desde cero

🌿
AI Sprouts

Construye bases

🌳
AI Branches

Aplica en la práctica

🏕️
AI Canopy

Profundiza

🌲
AI Forest

Domina la IA

🔨

Maestría en IA

✏️
AI Sketch

Empieza desde cero

🪨
AI Chisel

Construye bases

⚒️
AI Craft

Aplica en la práctica

💎
AI Polish

Profundiza

🏆
AI Masterpiece

Domina la IA

📘

Práctica de IA

📖
Entendiendo modelos open-source

Fundamentos y recursos para modelos open-source

🎯
Del problema a la tarea del modelo

Convertir problemas de negocio en tareas de modelos

⚡
Ejecutando tu primer modelo

Mira tus primeros resultados en 30 minutos

🔧
Fine-tuning y evaluación

Ajusta modelos y evalúa el rendimiento

🚀
Sistemas de aplicación

Construye aplicaciones IA del mundo real

🎨
IA generativa

Explora modelos AIGC open-source

🤖
Agentes

Aprende frameworks Agent y herramientas MCP

📐
Fundamentos complementarios

Fundamentos LLM y evaluación

🎓

Claude Academia

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Laboratorio

7 experimentos cargados
🧬Sandbox de Red Neuronal🤖¿IA o Humano?🥋Dojo de Prompt Engineering🏁Carrera de Algoritmos🧠Trivia de IA🏗️Lienzo de diseño de sistemas
🎯Entrevista simuladaEntrar al Laboratorio→
🚀

Desarrollo profesional

🚀
Plataforma de Entrevistas

Comienza tu camino

🌟
Dominio Conductual

Domina las habilidades blandas

💻
Entrevistas Técnicas

Supera la ronda de código

🤖
Entrevistas de IA y ML

Dominio en entrevistas de ML

🏆
Oferta y Más Allá

Consigue la mejor oferta

Empezar
AIUnlimited

Licencia MIT

沪ICP备18025655号-11

Aprender

  • Fundamentos de IA
  • Práctica de IA
  • Claude Academia
  • Laboratorio
  • Desarrollo profesional

Comunidad

  • Acerca de
  • Preguntas Frecuentes

Soporte

  • Términos de Servicio
  • Política de Privacidad
  • Contacto
Académicos de IA e Ingeniería›📖 Entendiendo modelos open-source›Lecciones›Data: The Foundation of Fine-Tuning
📊
Entendiendo modelos open-source • Principiante⏱️ 12 min de lectura

Data: The Foundation of Fine-Tuning

Datos: La Base del Fine-Tuning de Modelos Open Source

¿Has encontrado alguna vez un modelo que escribe código y resuelve matemáticas perfectamente, pero responde al azar a preguntas cotidianas?

Sabemos que para mejorar una capacidad específica durante el entrenamiento, hay que encontrar ese tipo de datos,

Pero muchos conjuntos de datos son difíciles de encontrar por búsqueda directa. Un portal unificado ahorra un esfuerzo enorme.

Por ejemplo, nuestro conjunto de datos destilado DeepSeek-R1 en chino obtuvo gran parte de sus datos directamente de ModelScope,

ilustración

El fine-tuning de un modelo puede comenzar con un conjunto de datos open source existente, permitiendo ejecutar rápidamente todo el proceso.

Encontrar Datos Requiere Saber Qué Planeas Hacer

ModelScope tiene más de 40,000 conjuntos de datos open source, con búsqueda, vista previa, descripciones de campos y versiones.

ModelScope permite buscar por etiquetas y categorías de tareas, como clasificación binaria de texto en chino,

ilustración

Antes de Descargar, Revisa Algunas Muestras

Después de filtrar, selecciona un conjunto de datos y haz clic en 'Vista Previa' para ver muestras y descripciones, como simpleai/HC3-Chinese.

ilustración

Qué columna contiene la pregunta, la respuesta, las etiquetas, y si cada registro es texto o diálogo — todo esto puede verificarse de antemano.

Para datos QA, las respuestas humanas y del modelo pueden estar en campos diferentes. Decide qué campos leer y cómo organizar antes de entrenar.

Revisa los archivos y versiones. Los conjuntos se actualizan; anota la versión usada para reproducibilidad.

ilustración

Las descripciones y licencias merecen ser revisadas. Los datos descargados pueden tener requisitos diferentes para investigación, entrenamiento o uso comercial.

Carga los Datos Primero, Luego Decide Qué Usar

ModelScope proporciona la interfaz MsDataset.load para cargar conjuntos de datos en Python. Después de instalar, sigue las instrucciones de la página.

Carga un Conjunto Completo Primero

Usando DAMO_NLP/jd como ejemplo, así se lee la configuración por defecto,

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'DAMO_NLP/jd',
    trust_remote_code=True,
)
print(ds)
Lección 3 de 40% completado
←Model Discovery and Downloads

Discusión

Iniciar sesión unirse a la discusión

ilustración

Si Solo Necesitas un Subconjunto, Especifica el Nombre

Algunos conjuntos separan datos por fuente, dominio o uso. Si solo necesitas una parte, usa subset_name.

Por ejemplo, carga el subconjunto baike de HC3-Chinese.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    trust_remote_code=True,
)
print(ds)
ilustración

Al cambiar de conjunto, verifica los subconjuntos disponibles. baike es específico de este conjunto.

Los Conjuntos de Entrenamiento y Prueba Se Pueden Cargar por Separado

El subconjunto selecciona la categoría, mientras que split selecciona la partición. Los comunes son train, validation y test.

Para cargar solo el entrenamiento de baike, agrega otro parámetro.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    split='train',
    trust_remote_code=True,
)
print(ds[0])
ilustración

No todos los conjuntos proporcionan las tres particiones. Después de obtener el entrenamiento, imprime una muestra para verificar.

Para Reproducir Experimentos, Registra la Versión

Después de actualizaciones, el mismo código puede leer contenido diferente. Usando HC3-Chinese v1, especifica via version.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    version='v1',
    trust_remote_code=True,
)
print(ds)
ilustración

Verifica las versiones disponibles en la página. Si una versión se actualiza continua, conserva los archivos o checksums usados.

¿Datos Descargados? No los Avientes al Modelo de Una

Primero revisa algunas muestras por valores nulos, caracteres corruptos o errores evidentes, luego confirma que los campos cumplen los requisitos del código.

Los datos de entrenamiento y prueba deben estar separados. No mezcles muestras de prueba en el conjunto de entrenamiento.