AIUnlimited
🌳

KI-Grundlagen

🌱
AI Seeds

Starte bei null

🌿
AI Sprouts

Fundament aufbauen

🌳
AI Branches

In der Praxis anwenden

🏕️
AI Canopy

In die Tiefe gehen

🌲
AI Forest

KI meistern

🔨

KI-Meisterschaft

✏️
AI Sketch

Starte bei null

🪨
AI Chisel

Fundament aufbauen

⚒️
AI Craft

In der Praxis anwenden

💎
AI Polish

In die Tiefe gehen

🏆
AI Masterpiece

KI meistern

📘

KI-Praxis

📖
Open-Source-Modelle verstehen

Grundlagen und Ressourcen für Open-Source-Modelle

🎯
Vom Problem zur Modellaufgabe

Geschäftsprobleme in Modellaufgaben umwandeln

⚡
Ihr erstes Modell ausführen

Sehen Sie Ihre ersten Ergebnisse in 30 Minuten

🔧
Fine-Tuning und Evaluierung

Modelle feinjustieren und Leistung bewerten

🚀
Anwendungssysteme

Bauen Sie reale KI-Anwendungen

🎨
Generative KI

Erkunden Sie Open-Source-AIGC-Modelle

🤖
Agenten

Lernen Sie Agent-Frameworks und MCP-Werkzeuge

📐
Ergänzende Grundlagen

LLM-Grundlagen und Evaluierung

🎓

Claude Akademie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Labor

7 Experimente geladen
🧬Neuronales Netz Sandbox🤖KI oder Mensch?🥋Prompt Engineering Dojo🏁Algorithmus-Rennen🧠KI-Quizduell🏗️Systemdesign-Leinwand
🎯ProbeinterviewLabor betreten→
🚀

Karriereentwicklung

🚀
Interview-Startrampe

Starte deine Reise

🌟
Verhaltensinterview-Meisterschaft

Soft Skills meistern

💻
Technische Interviews

Die Coding-Runde bestehen

🤖
AI- & ML-Interviews

ML-Interview meistern

🏆
Angebot & Karriere

Das beste Angebot sichern

Loslegen
AIUnlimited

MIT-Lizenz

沪ICP备18025655号-11

Lernen

  • KI-Grundlagen
  • KI-Praxis
  • Claude Akademie
  • Labor
  • Karriereentwicklung

Community

  • Über uns
  • FAQ

Unterstützung

  • Nutzungsbedingungen
  • Datenschutzerklärung
  • Kontakt
KI & Engineering Programme›⚡ Ihr erstes Modell ausführen›Lektionen›Running Models Locally with Ollama
💻
Ihr erstes Modell ausführen • Anfänger⏱️ 20 Min. Lesezeit

Running Models Locally with Ollama

Open-Source-Modelle auf Ihrem Laptop ausführen, beginnen Sie mit Ollama

Modelle können lokal oder in der Cloud bereitgestellt werden. Zu den lokalen Geräten gehören Laptops, Desktops und andere Edge-Geräte.

Es gibt auch verschiedene Tool-Auswahloptionen für die lokale Ausführung: Ollama sowie Frameworks wie vLLM und SGLang.

In diesem Kapitel erklären wir zunächst die grundlegende Verwendung von Ollama. Die Anpassung für andere Edge-Geräte und die Verwendung von Frameworks wie vLLM und SGLang werden später behandelt.

Warum möchten Sie Modelle auf Ihrem eigenen Computer ausführen?

Das Aufrufen großer Modelle über eine API ist der unkomplizierteste Ansatz: Senden Sie die Anfrage, das Modell berechnet und gibt das Ergebnis zurück. Benutzer müssen keine GPUs kaufen oder die zugrunde liegende Umgebung warten.

Aber der API-Ansatz hat auch unvermeidbare Einschränkungen, hauptsächlich in folgenden Aspekten:

  • Datensicherheit: Kerndokumente, Kundendaten und interne Geschäftsdaten können nicht direkt an öffentliche Drittanbieter-Clouds gesendet werden.
  • Offline-Verfügbarkeit: Produktionsumgebungen wie Intranet-DEDIKATE können einfach keine Verbindung zum externen Netzwerk herstellen.
  • Kostenkontrolle: Bei großem und stabilem Anrufvolumen ist der eigene Server normalerweise kostengünstiger als die Bezahlung pro Token.

Wenn Ihr Unternehmen also Datenempfindlichkeit beinhaltet, reinen Offline-Betrieb erfordert oder hohe Anrufvolumina hat, ist die lokale Bereitstellung die geeignetere Wahl.

Überprüfen Sie zunächst das System und die Hardware Ihres Laptops

Ollama ist eines der derzeit benutzerfreundlichsten Tools, das Modell-Download, lokale Verwaltung und API-Dienste alles zusammenpackt. Benutzer müssen keinen Code schreiben, um Modelle zu laden; nur wenige Befehle können das Modell direkt starten.

Ob ein Modell lokal reibungslos laufen kann, hängt weitgehend von den Hardware-Ressourcen des Computers ab. Ollama bietet gute Unterstützung für gängige Hardware-Plattformen und unterstützt Windows, Linux und macOS. Egal ob eine normale CPU, GPU oder ein Mac mit Apple Silicon, sie können alle zum Ausführen von Modellen verwendet werden.

CPU-Ausführung, auch ohne dedizierte Grafikkarte können Sie Modelle über CPU ausführen. Da die Inferenz großer Modelle umfangreiche Berechnungen erfordert, ist die Generierungsgeschwindigkeit bei CPU normalerweise langsamer, was sie besser für kleinere Parametermodelle oder Szenarien mit niedrigen Reaktionsgeschwindigkeitsanforderungen macht.

GPU-Ausführung, dies ist derzeit der gängigere Weg, große Modelle auszuführen. GPU verfügt über starke parallele Berechnungsfähigkeiten, die die Generierungsgeschwindigkeit des Modells erheblich verbessern können. Je größer das Modell, desto mehr Videospeicher wird normalerweise benötigt, daher müssen Sie bei der Modellauswahl berücksichtigen, ob die Grafikkarte genügend Videospeicher hat.

Lektion 3 von 50% abgeschlossen
←Server Configuration for Models

Diskussion

Anmelden an der Diskussion teilnehmen

Apple Silicon-Ausführung, Apples M-Serie-Chips verwenden ein einheitliches Speicherdesign, bei dem CPU und GPU denselben Speicher verwenden können. Für Mac-Benutzer, wenn das Gerät 32GB, 64GB oder mehr einheitlichen Speicher hat, können Sie versuchen, einige größere Parameter-quantisierte Modelle auszuführen.

Wählen Sie Ihr Betriebssystem, installieren Sie Ollama

Ollama auf Windows installieren

  1. Besuchen Sie zunächst die offizielle Ollama-Website, Ollama herunterladen und laden Sie die entsprechende Windows-Version herunter
Illustration
  1. Klicken Sie nach dem Herunterladen direkt auf Installieren, klicken Sie auf Weiter
Illustration
  1. Nach der Installation wird angezeigt, dass der Ollama-Dienst gestartet ist
Illustration
  1. Starten Sie in cmd das Modell, das Sie laden möchten, zum Beispiel: qwen3.5:2b, geben Sie den Befehl direkt im Terminal ein
ollama run qwen3.5:2b

Die Seitenausgabe zeigt, dass das Modell erfolgreich gestartet ist. Jetzt können Sie direkt im Client chatten oder die API aufrufen, um das Modell zu testen.

Illustration

API-Testcode:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:11434/v1",
    api_key="ollama",  
)

response = client.chat.completions.create(
    model="qwen3.5:2b", 
    messages=[
        {
            "role": "system",
            "content": "Sie sind ein hilfreicher Assistent.",
        },
        {
            "role": "user",
            "content": "Wer sind Sie?",
        },
    ],
    temperature=0,
    max_tokens=512,
)

print(response.choices[0].message.content)

Ergebnis:

Illustration

Ollama auf ModelScope Notebook installieren

  1. Installieren Sie Ollama im Notebook, laden Sie zunächst das Installationspaket herunter, führen Sie den folgenden Befehl aus
!modelscope download --model=modelscope/ollama-linux --local_dir ./ollama-linux  
Illustration
  1. Nach dem Herunterladen des Installationspakets betreten Sie den ollama-linux Ordner und führen Sie den folgenden Befehl zur Installation aus
%cd ollama-linux
Illustration
sudo chmod 777 ./ollama-modelscope-install.sh
./ollama-modelscope-install.sh

Nach der Installation werden API-Endpunkt-Informationen angezeigt, standardmäßig 127.0.0.1:11434. Wenn die folgenden Informationen angezeigt werden, ist die Installation abgeschlossen.

Illustration

Ollama auf Linux installieren

Die Installationsschritte auf Linux sind identisch mit der Installation von Ollama im ModelScope Notebook oben.

Ollama auf Mac installieren

  1. Besuchen Sie zunächst die offizielle Ollama-Website, Ollama herunterladen und laden Sie die entsprechende macOS-Version herunter
Illustration
  1. Doppelklicken Sie nach dem Herunterladen auf die heruntergeladene Datei und ziehen Sie Ollama in Anwendungen
Illustration
  1. Nach der Installation wird angezeigt, dass der Ollama-Dienst gestartet ist
Illustration
  1. Starten Sie in cmd das Modell, das Sie laden möchten, zum Beispiel: qwen3.5:2b, geben Sie den Befehl direkt im Terminal ein
ollama run qwen3.5:2b

Die Seitenausgabe zeigt, dass das Modell erfolgreich gestartet ist. Jetzt können Sie direkt im Client chatten oder die API aufrufen, um das Modell zu testen.

Illustration

Sie können auch im Client chatten.

Illustration

Sie können auch Modelle von ModelScope herunterladen und mit Ollama starten

Ollama bietet viele Modell-Repositories. Wir können die benötigten Modelle in ModelScope finden und mit Ollama starten.

  1. Starten Sie den Ollama-Dienst

Für dauerhafte Dienste kann der einzelne Kernel von Jupyter nur eine Zelle gleichzeitig ausführen, was die Ausführung nachfolgender Zellen erschwert. Dieser Teil sollte daher im Terminal ausgeführt werden. Öffnen Sie nach dem Öffnen des Notebooks den Arbeitsbereich, unten steht "Terminal". Klicken Sie darauf.

Illustration

Geben Sie im Terminal ein:

ollama serve
Illustration
  1. Starten Sie dann das Modell, das wir starten möchten, zum Beispiel: Qwen3-4B-GGUF. Beim ersten Start muss das Modell die entsprechenden Dateien aus dem Modell-Repository herunterladen. Dieser Befehl muss ebenfalls im Terminal ausgeführt werden. Sie können ein neues Terminal öffnen und den folgenden Befehl ausführen:
Illustration
 ollama run modelscope.cn/unsloth/Qwen3-4B-GGUF
Illustration

Jetzt ist das Modell gestartet. Sie können die API aufrufen, um zu testen, ob der Modell-Endpunkt verbunden ist. Der Code lautet:

import requests
url = "http://127.0.0.1:11434/v1/chat/completions"
data = {
    "model": "modelscope.cn/unsloth/Qwen3-4B-GGUF",
    "messages": [
        {
            "role": "user",
            "content": "Hallo, bitte stellen Sie sich vor"
        }
    ],
    "max_tokens": 100
}

response = requests.post(url, json=data)

print("Statuscode:", response.status_code)
print(response.text)

Wenn der Modellaufruf erfolgreich ist, wird das entsprechende Modellergebnis ausgegeben.

Illustration

Der vollständige experimentelle Prozess dieses Kapitels ist verfügbar unter: https://modelscope.cn/gallery/liucong/b1ef397b-fe80-4fb9-812f-969fa25ea44c