AIUnlimited
🌳

Fundamentos de IA

🌱
AI Seeds

Comece do zero

🌿
AI Sprouts

Construa bases

🌳
AI Branches

Aplique na prática

🏕️
AI Canopy

Aprofunde-se

🌲
AI Forest

Domine a IA

🔨

Mestria em IA

✏️
AI Sketch

Comece do zero

🪨
AI Chisel

Construa bases

⚒️
AI Craft

Aplique na prática

💎
AI Polish

Aprofunde-se

🏆
AI Masterpiece

Domine a IA

📘

Prática de IA

📖
Entendendo modelos open-source

Fundamentos e recursos para modelos open-source

🎯
Do problema à tarefa do modelo

Convertendo problemas de negócio em tarefas de modelo

⚡
Executando seu primeiro modelo

Veja seus primeiros resultados em 30 minutos

🔧
Fine-tuning e avaliação

Ajuste modelos e avalie o desempenho

🚀
Sistemas de aplicação

Construa aplicações IA do mundo real

🎨
IA generativa

Explore modelos AIGC open-source

🤖
Agentes

Aprenda frameworks Agent e ferramentas MCP

📐
Fundamentos complementares

Fundamentos LLM e avaliação

🎓

Claude Academia

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Laboratório

7 experimentos carregados
🧬Sandbox de Rede Neural🤖IA ou Humano?🥋Dojo de Prompt Engineering🏁Corrida de Algoritmos🧠Trivia de IA🏗️Tela de design de sistemas
🎯Entrevista simuladaEntrar no Laboratório→
🚀

Desenvolvimento de carreira

🚀
Plataforma de Lançamento de Entrevistas

Comece sua jornada

🌟
Domínio Comportamental

Domine habilidades interpessoais

💻
Entrevistas Técnicas

Passe na rodada de programação

🤖
Entrevistas de IA e ML

Domínio em entrevistas de ML

🏆
Oferta e Além

Conquiste a melhor oferta

Começar
AIUnlimited

Licença MIT

沪ICP备18025655号-11

Aprender

  • Fundamentos de IA
  • Prática de IA
  • Claude Academia
  • Laboratório
  • Desenvolvimento de carreira

Comunidade

  • Sobre
  • Perguntas Frequentes

Suporte

  • Termos de Serviço
  • Política de Privacidade
  • Contato
Acadêmicos de IA e Engenharia›⚡ Executando seu primeiro modelo›Aulas›Running Models Locally with Ollama
💻
Executando seu primeiro modelo • Iniciante⏱️ 20 min de leitura

Running Models Locally with Ollama

Execute modelos de código aberto em seu notebook, comece com Ollama

Os modelos podem ser implantados localmente ou na nuvem. Dispositivos locais incluem notebooks, computadores de mesa e outros dispositivos de borda.

Também existem diferentes opções de ferramentas para execução local: Ollama, bem como frameworks como vLLM e SGLang.

Neste capítulo, explicaremos primeiro o uso básico do Ollama claramente. A adaptação para outros dispositivos de borda e o uso de frameworks como vLLM e SGLang serão abordados posteriormente.

Por que você gostaria de executar modelos em seu próprio computador?

Chamar grandes modelos através de uma API é a abordagem mais tranquila: envie a solicitação, o modelo calcula e retorna o resultado. Os usuários não precisam comprar GPUs ou manter o ambiente subjacente.

Mas a abordagem de API também tem limitações inevitáveis, principalmente nos seguintes aspectos:

  • Segurança de dados: documentos principais, privacidade de clientes e dados de negócios internos não podem ser enviados diretamente para nuvens públicas de terceiros.
  • Disponibilidade offline: ambientes de produção como linhas dedicadas simplesmente não conseguem se conectar à rede externa.
  • Controle de custos: quando o volume de chamadas é grande e estável, construir seu próprio servidor geralmente é mais econômico do que pagar por token.

Portanto, se seu negócio envolve sensibilidade de dados, requer operação puramente offline ou tem grandes volumes de chamadas, a implantação local é a escolha mais apropriada.

Primeiro verifique o sistema e o hardware do seu notebook

Ollama é uma das ferramentas atualmente mais fáceis de usar, empacotando download de modelos, gerenciamento local e serviços de API todos juntos. Os usuários não precisam escrever código para carregar modelos; apenas alguns comandos podem iniciar o modelo diretamente.

Se um modelo pode ser executado localmente depende em grande parte dos recursos de hardware do computador. Ollama oferece bom suporte para plataformas de hardware comuns, suportando Windows, Linux e macOS. Seja uma CPU comum, GPU ou um Mac com Apple Silicon, todos podem ser usados para executar modelos.

Execução por CPU, mesmo sem placa de vídeo dedicada, você pode executar modelos através da CPU. Como a inferência de grandes modelos requer cálculo extenso, a velocidade de geração geralmente é mais lenta com CPU, tornando-a mais adequada para modelos com menos parámetros ou cenários onde os requisitos de velocidade de resposta não são altos.

Execução por GPU, esta é atualmente a forma mais comum de executar grandes modelos. GPU tem fortes capacidades de cálculo paralelo que podem melhorar significativamente a velocidade de geração do modelo. Quanto maior o modelo, mais memória de vídeo é geralmente necessária, portanto ao escolher um modelo, você precisa considerar se a placa de vídeo tem memória de vídeo suficiente.

Aula 3 de 50% concluído
←Server Configuration for Models

Discussão

Entrar participar da discussão

Execução por Apple Silicon, os chips M da Apple usam design de memória unificada, onde CPU e GPU podem usar a mesma memória. Para usuários de Mac, se o dispositivo tem 32GB, 64GB ou mais de memória unificada, você pode tentar executar alguns modelos quantificados com mais parâmetros.

Escolha seu sistema operacional, instale Ollama

Instalar Ollama no Windows

  1. Primeiro, no site oficial do Ollama, Baixar Ollama e baixe a versão correspondente do Windows
ilustração
  1. Após o download, clique diretamente em instalar, clique em continuar
ilustração
  1. Após a instalação, mostra que o serviço Ollama foi iniciado
ilustração
  1. No cmd, inicie o modelo que deseja carregar, por exemplo: qwen3.5:2b, digite o comando diretamente no terminal
ollama run qwen3.5:2b

A saída da página mostra que o modelo foi iniciado com sucesso. Neste ponto, você pode ter conversas diretamente no cliente ou chamar a API para testar o modelo.

ilustração

Código de teste da API:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "Você é um assistente útil.",
        },
        {
            "role": "user",
            "content": "Quem é você?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)

Resultado:

ilustração

Instalar Ollama no ModelScope Notebook

  1. Instale o Ollama no Notebook, primeiro baixe o pacote de instalação, execute o seguinte comando
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
ilustração
  1. Após o download do pacote de instalação, entre na pasta ollama-linux e execute o seguinte comando para instalar
%cd ollama-linux
ilustração
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

Após a instalação, mostrará informações do endpoint da API, padrão 127.0.0.1:11434. Se as seguintes informações forem mostradas, a instalação está completa.

ilustração

Instalar Ollama no Linux

Os passos de instalação no Linux são iguais aos de instalar o Ollama no ModelScope Notebook acima.

Instalar Ollama no Mac

  1. Primeiro, no site oficial do Ollama, Baixar Ollama e baixe a versão correspondente do macOS
ilustração
  1. Após o download, clique duas vezes no arquivo baixado e arraste o Ollama para Aplicativos
ilustração
  1. Após a instalação, mostra que o serviço Ollama foi iniciado
ilustração
  1. No cmd, inicie o modelo que deseja carregar, por exemplo: qwen3.5:2b, digite o comando diretamente no terminal
ollama run qwen3.5:2b

A saída da página mostra que o modelo foi iniciado com sucesso. Neste ponto, você pode ter conversas diretamente no cliente ou chamar a API para testar o modelo.

ilustração

Você também pode conversar no cliente.

ilustração

Você também pode baixar modelos do ModelScope e iniciá-los com Ollama

Ollama fornece muitos repositórios de modelos. Podemos encontrar os modelos que precisamos no ModelScope e iniciá-los com Ollama.

  1. Inicie o serviço Ollama

Para serviços residentes, o kernel único do Jupyter só pode executar uma célula por vez, dificultando a execução das células seguintes. Portanto, esta parte deve ser executada no terminal. Após abrir o Notebook, vá diretamente para o espaço de trabalho, onde verá "Terminal" na parte inferior. Clique nele.

ilustração

Digite no terminal:

ollama serve
ilustração
  1. Em seguida, execute o modelo que queremos iniciar, por exemplo: Qwen3-4B-GGUF. Na primeira vez que o modelo é executado, ele precisa baixar os arquivos correspondentes do repositório de modelos. Este comando também deve ser executado no terminal. Você pode abrir um novo terminal e executar o seguinte comando:
ilustração
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
ilustração

Neste ponto, o modelo foi iniciado. Você pode chamar a API para testar se o endpoint do modelo está conectado. O código é o seguinte:

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "Olá, por favor apresente-se"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("Código de status:", response.status_code)
print(response.text)

Se a chamada do modelo for bem-sucedida, ela mostrará o resultado correspondente do modelo.

ilustração

O processo experimental completo envolvido neste capítulo pode ser encontrado em: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c