AIUnlimited
🌳

Fundamentos de IA

🌱
AI Seeds

Comece do zero

🌿
AI Sprouts

Construa bases

🌳
AI Branches

Aplique na prática

🏕️
AI Canopy

Aprofunde-se

🌲
AI Forest

Domine a IA

🔨

Mestria em IA

✏️
AI Sketch

Comece do zero

🪨
AI Chisel

Construa bases

⚒️
AI Craft

Aplique na prática

💎
AI Polish

Aprofunde-se

🏆
AI Masterpiece

Domine a IA

📘

Prática de IA

📖
Entendendo modelos open-source

Fundamentos e recursos para modelos open-source

🎯
Do problema à tarefa do modelo

Convertendo problemas de negócio em tarefas de modelo

⚡
Executando seu primeiro modelo

Veja seus primeiros resultados em 30 minutos

🔧
Fine-tuning e avaliação

Ajuste modelos e avalie o desempenho

🚀
Sistemas de aplicação

Construa aplicações IA do mundo real

🎨
IA generativa

Explore modelos AIGC open-source

🤖
Agentes

Aprenda frameworks Agent e ferramentas MCP

📐
Fundamentos complementares

Fundamentos LLM e avaliação

🎓

Claude Academia

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Laboratório

7 experimentos carregados
🧬Sandbox de Rede Neural🤖IA ou Humano?🥋Dojo de Prompt Engineering🏁Corrida de Algoritmos🧠Trivia de IA🏗️Tela de design de sistemas
🎯Entrevista simuladaEntrar no Laboratório→
🚀

Desenvolvimento de carreira

🚀
Plataforma de Lançamento de Entrevistas

Comece sua jornada

🌟
Domínio Comportamental

Domine habilidades interpessoais

💻
Entrevistas Técnicas

Passe na rodada de programação

🤖
Entrevistas de IA e ML

Domínio em entrevistas de ML

🏆
Oferta e Além

Conquiste a melhor oferta

Começar
AIUnlimited

Licença MIT

沪ICP备18025655号-11

Aprender

  • Fundamentos de IA
  • Prática de IA
  • Claude Academia
  • Laboratório
  • Desenvolvimento de carreira

Comunidade

  • Sobre
  • Perguntas Frequentes

Suporte

  • Termos de Serviço
  • Política de Privacidade
  • Contato
Acadêmicos de IA e Engenharia›📖 Entendendo modelos open-source›Aulas›Data: The Foundation of Fine-Tuning
📊
Entendendo modelos open-source • Iniciante⏱️ 12 min de leitura

Data: The Foundation of Fine-Tuning

Dados: A Base do Fine-Tuning de Modelos Open Source

Você já encontrou um modelo que escreve código e resolve matemática perfeitamente, mas responde aleatoriamente a perguntas do dia a dia?

Sabemos que para melhorar uma capacidade específica durante o treinamento, é preciso encontrar esse tipo de dados,

Mas muitos conjuntos de dados são difíceis de encontrar por busca direta. Um portal unificado economiza muito esforço.

Por exemplo, nosso conjunto de dados destilado DeepSeek-R1 em chinês obteve grande parte dos dados brutos diretamente do ModelScope,

ilustração

O fine-tuning do nosso modelo pode começar a partir de um conjunto de dados open source pronto, o que permite percorrer todo o fluxo rapidamente.

Encontrar Dados Requer Saber o Que Você Planeja Fazer

ModelScope tem mais de 40.000 conjuntos de dados open source, com pesquisa, visualização, descrições de campos e versões.

ModelScope permite pesquisa por palavras-chave e categorias de tarefas, como classificação binária de texto em chinês,

ilustração

Antes de Baixar, Confira Algumas Amostras

Após filtrar, selecione um conjunto de dados e clique em 'Visualização' para ver amostras e descrições, como simpleai/HC3-Chinese.

ilustração

Qual coluna contém a pergunta, resposta, rótulos, e se cada registro é texto ou diálogo — tudo pode ser verificado antecipadamente.

Para dados QA, respostas humanas e do modelo podem estar em campos diferentes. Decida quais campos ler e como organizar antes de treinar.

Verifique arquivos e versões. Conjuntos são atualizados; anote a versão usada para reprodutibilidade.

ilustração

Descrições e licenças valem a pena conferir. Dados baixados podem ter requisitos diferentes para pesquisa, treinamento ou uso comercial.

Carregue os Dados Primeiro, Depois Decida O Que Usar

ModelScope fornece a interface MsDataset.load para carregar conjuntos de dados em Python. Após instalar, siga as instruções da página.

Carregue um Conjunto Completo Primeiro

Usando DAMO_NLP/jd como exemplo, assim leia a configuração padrão,

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'DAMO_NLP/jd',
    trust_remote_code=True,
)
print(ds)
Aula 3 de 40% concluído
←Model Discovery and Downloads

Discussão

Entrar participar da discussão

ilustração

Se Você Só Precisa de um Subconjunto, Especifique o Nome

Alguns conjuntos separam dados por fonte, domínio ou uso. Se você só precisa de uma parte, use subset_name.

Por exemplo, carregue o subconjunto baike de HC3-Chinese.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    trust_remote_code=True,
)
print(ds)
ilustração

Ao mudar de conjunto, verifique os subconjuntos disponíveis. baike é específico deste conjunto.

Conjuntos de Treino e Teste Podem Ser Carregados Separadamente

O subconjunto seleciona a categoria, enquanto split seleciona a partição. Comuns são train, validation e test.

Para carregar apenas o treino de baike, adicione outro parâmetro.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    split='train',
    trust_remote_code=True,
)
print(ds[0])
ilustração

Nem todos os conjuntos fornecem as três partições. Após obter o treino, imprima uma amostra para verificar.

Para Reproduzir Experimentos, Registre a Versão

Após atualizações, o mesmo código pode ler conteúdo diferente. Com HC3-Chinese v1, especifique via version.

from modelscope.msdatasets import MsDataset

ds = MsDataset.load(
    'simpleai/HC3-Chinese',
    subset_name='baike',
    version='v1',
    trust_remote_code=True,
)
print(ds)
ilustração

Verifique as versões disponíveis na página. Se uma versão é atualizada continuamente, conserve os arquivos ou checksums usados.

Dados Baixados? Não Os Atire Imediatamente ao Modelo

Primeiro verifique algumas amostras por valores nulos, caracteres corrompidos ou erros óbvios, depois confirme que os campos atendem aos requisitos do código.

Dados de treino e teste devem ser separados. Não misture amostras de teste no conjunto de treino.