Modelle können lokal oder in der Cloud bereitgestellt werden. Zu den lokalen Geräten gehören Laptops, Desktops und andere Edge-Geräte.
Es gibt auch verschiedene Tool-Auswahloptionen für die lokale Ausführung: Ollama sowie Frameworks wie vLLM und SGLang.
In diesem Kapitel erklären wir zunächst die grundlegende Verwendung von Ollama. Die Anpassung für andere Edge-Geräte und die Verwendung von Frameworks wie vLLM und SGLang werden später behandelt.
Das Aufrufen großer Modelle über eine API ist der unkomplizierteste Ansatz: Senden Sie die Anfrage, das Modell berechnet und gibt das Ergebnis zurück. Benutzer müssen keine GPUs kaufen oder die zugrunde liegende Umgebung warten.
Aber der API-Ansatz hat auch unvermeidbare Einschränkungen, hauptsächlich in folgenden Aspekten:
Wenn Ihr Unternehmen also Datenempfindlichkeit beinhaltet, reinen Offline-Betrieb erfordert oder hohe Anrufvolumina hat, ist die lokale Bereitstellung die geeignetere Wahl.
Ollama ist eines der derzeit benutzerfreundlichsten Tools, das Modell-Download, lokale Verwaltung und API-Dienste alles zusammenpackt. Benutzer müssen keinen Code schreiben, um Modelle zu laden; nur wenige Befehle können das Modell direkt starten.
Ob ein Modell lokal reibungslos laufen kann, hängt weitgehend von den Hardware-Ressourcen des Computers ab. Ollama bietet gute Unterstützung für gängige Hardware-Plattformen und unterstützt Windows, Linux und macOS. Egal ob eine normale CPU, GPU oder ein Mac mit Apple Silicon, sie können alle zum Ausführen von Modellen verwendet werden.
CPU-Ausführung, auch ohne dedizierte Grafikkarte können Sie Modelle über CPU ausführen. Da die Inferenz großer Modelle umfangreiche Berechnungen erfordert, ist die Generierungsgeschwindigkeit bei CPU normalerweise langsamer, was sie besser für kleinere Parametermodelle oder Szenarien mit niedrigen Reaktionsgeschwindigkeitsanforderungen macht.
GPU-Ausführung, dies ist derzeit der gängigere Weg, große Modelle auszuführen. GPU verfügt über starke parallele Berechnungsfähigkeiten, die die Generierungsgeschwindigkeit des Modells erheblich verbessern können. Je größer das Modell, desto mehr Videospeicher wird normalerweise benötigt, daher müssen Sie bei der Modellauswahl berücksichtigen, ob die Grafikkarte genügend Videospeicher hat.
Anmelden an der Diskussion teilnehmen
Apple Silicon-Ausführung, Apples M-Serie-Chips verwenden ein einheitliches Speicherdesign, bei dem CPU und GPU denselben Speicher verwenden können. Für Mac-Benutzer, wenn das Gerät 32GB, 64GB oder mehr einheitlichen Speicher hat, können Sie versuchen, einige größere Parameter-quantisierte Modelle auszuführen.



ollama run qwen3.5:2b
Die Seitenausgabe zeigt, dass das Modell erfolgreich gestartet ist. Jetzt können Sie direkt im Client chatten oder die API aufrufen, um das Modell zu testen.

API-Testcode:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:11434/v1",
api_key="ollama",
)
response = client.chat.completions.create(
model="qwen3.5:2b",
messages=[
{
"role": "system",
"content": "Sie sind ein hilfreicher Assistent.",
},
{
"role": "user",
"content": "Wer sind Sie?",
},
],
temperature=0,
max_tokens=512,
)
print(response.choices[0].message.content)
Ergebnis:

!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux

ollama-linux Ordner und führen Sie den folgenden Befehl zur Installation aus%cd ollama-linux

sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh
Nach der Installation werden API-Endpunkt-Informationen angezeigt, standardmäßig 127.0.0.1:11434. Wenn die folgenden Informationen angezeigt werden, ist die Installation abgeschlossen.

Die Installationsschritte auf Linux sind identisch mit der Installation von Ollama im ModelScope Notebook oben.



ollama run qwen3.5:2b
Die Seitenausgabe zeigt, dass das Modell erfolgreich gestartet ist. Jetzt können Sie direkt im Client chatten oder die API aufrufen, um das Modell zu testen.

Sie können auch im Client chatten.

Ollama bietet viele Modell-Repositories. Wir können die benötigten Modelle in ModelScope finden und mit Ollama starten.
Für dauerhafte Dienste kann der einzelne Kernel von Jupyter nur eine Zelle gleichzeitig ausführen, was die Ausführung nachfolgender Zellen erschwert. Dieser Teil sollte daher im Terminal ausgeführt werden. Öffnen Sie nach dem Öffnen des Notebooks den Arbeitsbereich, unten steht "Terminal". Klicken Sie darauf.

Geben Sie im Terminal ein:
ollama serve

Qwen3-4B-GGUF. Beim ersten Start muss das Modell die entsprechenden Dateien aus dem Modell-Repository herunterladen. Dieser Befehl muss ebenfalls im Terminal ausgeführt werden. Sie können ein neues Terminal öffnen und den folgenden Befehl ausführen:
ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF

Jetzt ist das Modell gestartet. Sie können die API aufrufen, um zu testen, ob der Modell-Endpunkt verbunden ist. Der Code lautet:
import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
"model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
"messages": [
{
"role": "user",
"content": "Hallo, bitte stellen Sie sich vor"
}
],
"max_tokens": 100
}
response = requests.post(url, json=data)
print("Statuscode:", response.status_code)
print(response.text)
Wenn der Modellaufruf erfolgreich ist, wird das entsprechende Modellergebnis ausgegeben.

Der vollständige experimentelle Prozess dieses Kapitels ist verfügbar unter: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c