Os modelos podem ser implantados localmente ou na nuvem. Dispositivos locais incluem notebooks, computadores de mesa e outros dispositivos de borda.
Também existem diferentes opções de ferramentas para execução local: Ollama, bem como frameworks como vLLM e SGLang.
Neste capítulo, explicaremos primeiro o uso básico do Ollama claramente. A adaptação para outros dispositivos de borda e o uso de frameworks como vLLM e SGLang serão abordados posteriormente.
Chamar grandes modelos através de uma API é a abordagem mais tranquila: envie a solicitação, o modelo calcula e retorna o resultado. Os usuários não precisam comprar GPUs ou manter o ambiente subjacente.
Mas a abordagem de API também tem limitações inevitáveis, principalmente nos seguintes aspectos:
Portanto, se seu negócio envolve sensibilidade de dados, requer operação puramente offline ou tem grandes volumes de chamadas, a implantação local é a escolha mais apropriada.
Ollama é uma das ferramentas atualmente mais fáceis de usar, empacotando download de modelos, gerenciamento local e serviços de API todos juntos. Os usuários não precisam escrever código para carregar modelos; apenas alguns comandos podem iniciar o modelo diretamente.
Se um modelo pode ser executado localmente depende em grande parte dos recursos de hardware do computador. Ollama oferece bom suporte para plataformas de hardware comuns, suportando Windows, Linux e macOS. Seja uma CPU comum, GPU ou um Mac com Apple Silicon, todos podem ser usados para executar modelos.
Execução por CPU, mesmo sem placa de vídeo dedicada, você pode executar modelos através da CPU. Como a inferência de grandes modelos requer cálculo extenso, a velocidade de geração geralmente é mais lenta com CPU, tornando-a mais adequada para modelos com menos parámetros ou cenários onde os requisitos de velocidade de resposta não são altos.
Execução por GPU, esta é atualmente a forma mais comum de executar grandes modelos. GPU tem fortes capacidades de cálculo paralelo que podem melhorar significativamente a velocidade de geração do modelo. Quanto maior o modelo, mais memória de vídeo é geralmente necessária, portanto ao escolher um modelo, você precisa considerar se a placa de vídeo tem memória de vídeo suficiente.
Entrar participar da discussão
Execução por Apple Silicon, os chips M da Apple usam design de memória unificada, onde CPU e GPU podem usar a mesma memória. Para usuários de Mac, se o dispositivo tem 32GB, 64GB ou mais de memória unificada, você pode tentar executar alguns modelos quantificados com mais parâmetros.



ollama run qwen3.5:2b
A saída da página mostra que o modelo foi iniciado com sucesso. Neste ponto, você pode ter conversas diretamente no cliente ou chamar a API para testar o modelo.

Código de teste da API:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "Você é um assistente útil.",
},
{
"role": "user",
"content": "Quem é você?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
Resultado:

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux e execute o seguinte comando para instalar%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
Após a instalação, mostrará informações do endpoint da API, padrão 127.0.0.1:11434. Se as seguintes informações forem mostradas, a instalação está completa.

Os passos de instalação no Linux são iguais aos de instalar o Ollama no ModelScope Notebook acima.



ollama run qwen3.5:2b
A saída da página mostra que o modelo foi iniciado com sucesso. Neste ponto, você pode ter conversas diretamente no cliente ou chamar a API para testar o modelo.

Você também pode conversar no cliente.

Ollama fornece muitos repositórios de modelos. Podemos encontrar os modelos que precisamos no ModelScope e iniciá-los com Ollama.
Para serviços residentes, o kernel único do Jupyter só pode executar uma célula por vez, dificultando a execução das células seguintes. Portanto, esta parte deve ser executada no terminal. Após abrir o Notebook, vá diretamente para o espaço de trabalho, onde verá "Terminal" na parte inferior. Clique nele.

Digite no terminal:
ollama serve

Qwen3-4B-GGUF. Na primeira vez que o modelo é executado, ele precisa baixar os arquivos correspondentes do repositório de modelos. Este comando também deve ser executado no terminal. Você pode abrir um novo terminal e executar o seguinte comando:
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

Neste ponto, o modelo foi iniciado. Você pode chamar a API para testar se o endpoint do modelo está conectado. O código é o seguinte:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "Olá, por favor apresente-se"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("Código de status:", response.status_code)
print(response.text)
Se a chamada do modelo for bem-sucedida, ela mostrará o resultado correspondente do modelo.

O processo experimental completo envolvido neste capítulo pode ser encontrado em: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c