¿Has encontrado alguna vez un modelo que escribe código y resuelve matemáticas perfectamente, pero responde al azar a preguntas cotidianas?
Sabemos que para mejorar una capacidad específica durante el entrenamiento, hay que encontrar ese tipo de datos,
Pero muchos conjuntos de datos son difíciles de encontrar por búsqueda directa. Un portal unificado ahorra un esfuerzo enorme.
Por ejemplo, nuestro conjunto de datos destilado DeepSeek-R1 en chino obtuvo gran parte de sus datos directamente de ModelScope,
El fine-tuning de un modelo puede comenzar con un conjunto de datos open source existente, permitiendo ejecutar rápidamente todo el proceso.
ModelScope tiene más de 40,000 conjuntos de datos open source, con búsqueda, vista previa, descripciones de campos y versiones.
ModelScope permite buscar por etiquetas y categorías de tareas, como clasificación binaria de texto en chino,
Después de filtrar, selecciona un conjunto de datos y haz clic en 'Vista Previa' para ver muestras y descripciones, como simpleai/HC3-Chinese.
Qué columna contiene la pregunta, la respuesta, las etiquetas, y si cada registro es texto o diálogo — todo esto puede verificarse de antemano.
Para datos QA, las respuestas humanas y del modelo pueden estar en campos diferentes. Decide qué campos leer y cómo organizar antes de entrenar.
Revisa los archivos y versiones. Los conjuntos se actualizan; anota la versión usada para reproducibilidad.
Las descripciones y licencias merecen ser revisadas. Los datos descargados pueden tener requisitos diferentes para investigación, entrenamiento o uso comercial.
ModelScope proporciona la interfaz MsDataset.load para cargar conjuntos de datos en Python. Después de instalar, sigue las instrucciones de la página.
Usando DAMO_NLP/jd como ejemplo, así se lee la configuración por defecto,
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)
Iniciar sesión unirse a la discusión

Algunos conjuntos separan datos por fuente, dominio o uso. Si solo necesitas una parte, usa subset_name.
Por ejemplo, carga el subconjunto baike de HC3-Chinese.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

Al cambiar de conjunto, verifica los subconjuntos disponibles. baike es específico de este conjunto.
El subconjunto selecciona la categoría, mientras que split selecciona la partición. Los comunes son train, validation y test.
Para cargar solo el entrenamiento de baike, agrega otro parámetro.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

No todos los conjuntos proporcionan las tres particiones. Después de obtener el entrenamiento, imprime una muestra para verificar.
Después de actualizaciones, el mismo código puede leer contenido diferente. Usando HC3-Chinese v1, especifica via version.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

Verifica las versiones disponibles en la página. Si una versión se actualiza continua, conserva los archivos o checksums usados.
Primero revisa algunas muestras por valores nulos, caracteres corruptos o errores evidentes, luego confirma que los campos cumplen los requisitos del código.
Los datos de entrenamiento y prueba deben estar separados. No mezcles muestras de prueba en el conjunto de entrenamiento.