Você já encontrou um modelo que escreve código e resolve matemática perfeitamente, mas responde aleatoriamente a perguntas do dia a dia?
Sabemos que para melhorar uma capacidade específica durante o treinamento, é preciso encontrar esse tipo de dados,
Mas muitos conjuntos de dados são difíceis de encontrar por busca direta. Um portal unificado economiza muito esforço.
Por exemplo, nosso conjunto de dados destilado DeepSeek-R1 em chinês obteve grande parte dos dados brutos diretamente do ModelScope,
O fine-tuning do nosso modelo pode começar a partir de um conjunto de dados open source pronto, o que permite percorrer todo o fluxo rapidamente.
ModelScope tem mais de 40.000 conjuntos de dados open source, com pesquisa, visualização, descrições de campos e versões.
ModelScope permite pesquisa por palavras-chave e categorias de tarefas, como classificação binária de texto em chinês,
Após filtrar, selecione um conjunto de dados e clique em 'Visualização' para ver amostras e descrições, como simpleai/HC3-Chinese.
Qual coluna contém a pergunta, resposta, rótulos, e se cada registro é texto ou diálogo — tudo pode ser verificado antecipadamente.
Para dados QA, respostas humanas e do modelo podem estar em campos diferentes. Decida quais campos ler e como organizar antes de treinar.
Verifique arquivos e versões. Conjuntos são atualizados; anote a versão usada para reprodutibilidade.
Descrições e licenças valem a pena conferir. Dados baixados podem ter requisitos diferentes para pesquisa, treinamento ou uso comercial.
ModelScope fornece a interface MsDataset.load para carregar conjuntos de dados em Python. Após instalar, siga as instruções da página.
Usando DAMO_NLP/jd como exemplo, assim leia a configuração padrão,
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'DAMO_NLP/jd',
trust_remote_code=True,
)
print(ds)
Entrar participar da discussão

Alguns conjuntos separam dados por fonte, domínio ou uso. Se você só precisa de uma parte, use subset_name.
Por exemplo, carregue o subconjunto baike de HC3-Chinese.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
trust_remote_code=True,
)
print(ds)

Ao mudar de conjunto, verifique os subconjuntos disponíveis. baike é específico deste conjunto.
O subconjunto seleciona a categoria, enquanto split seleciona a partição. Comuns são train, validation e test.
Para carregar apenas o treino de baike, adicione outro parâmetro.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
split='train',
trust_remote_code=True,
)
print(ds[0])

Nem todos os conjuntos fornecem as três partições. Após obter o treino, imprima uma amostra para verificar.
Após atualizações, o mesmo código pode ler conteúdo diferente. Com HC3-Chinese v1, especifique via version.
from modelscope.msdatasets import MsDataset
ds = MsDataset.load(
'simpleai/HC3-Chinese',
subset_name='baike',
version='v1',
trust_remote_code=True,
)
print(ds)

Verifique as versões disponíveis na página. Se uma versão é atualizada continuamente, conserve os arquivos ou checksums usados.
Primeiro verifique algumas amostras por valores nulos, caracteres corrompidos ou erros óbvios, depois confirme que os campos atendem aos requisitos do código.
Dados de treino e teste devem ser separados. Não misture amostras de teste no conjunto de treino.