Das Modell läuft auf Ihrem Laptop, Sie möchten ein größeres Modell ausprobieren oder ein Bild generieren — aber Sie haben vielleicht nicht die passende Hardware. Sie können die Berechnung in die Cloud verlagern und den Server die Arbeit machen lassen.
Cloud-Server können nach Bedarf konfiguriert werden. Wir verwenden hier weiterhin ModelScope Notebook — wählen Sie direkt im Browser eine CPU- oder GPU-Instanz, laden Sie das Modell herunter und führen Sie Code aus. Die Seite läuft auf Ihrem Computer; das Modell läuft auf der verbundenen Cloud-Instanz.
Dieses Kapitel hat zwei Experimente. Zuerst verwenden Sie CPU, um ein 0.5B-Modell auszuführen und die Stimmung einer Bewertung zu beurteilen. Dann verwenden Sie GPU, um ein Bildgenerierungsmodell auszuführen und Textbeschreibungen in Bilder umzuwandeln. Jedes zeigt die Verwendung unter verschiedenen Ressourcen mit verschiedenen Aufgaben und Modellen — man kann CPU vs. GPU nicht direkt anhand der Laufzeit vergleichen.
Weitere Cloud-Server-Ressourcen werden später ergänzt.Von der ModelScope-Modellseite gehen Sie zu „Notebook-Schnellentwicklung", dann klicken Sie auf „Runtime verbinden". Wählen Sie zuerst eine CPU-Instanz für die Stimmungsanalyse, dann wechseln Sie zu einer GPU-Instanz für die Bildgenerierung. Für Notebook-Seitenoperationen lesen Sie das Kapitel „Ergebnis in 30 Minuten sehen".
Nach dem Wechsel der Instanz werden der ursprüngliche Python-Prozess und die geladenen Modelle nicht automatisch auf die neue Instanz übertragen. Sie müssen die Abhängigkeiten in der aktuellen Umgebung neu prüfen und den Experimentcode von vorne ausführen.
Am Beispiel des Modells Qwen/Qwen2.5-0.5B-Instruct zeigen wir, wie man ein 0.5B-Modell auf CPU für Stimmungsanalyse verwendet.
Nach dem Starten der CPU-Instanz gelangen Sie in die Notebook-Entwicklungsumgebung. Modell-Lade- und Inferenzcode:
from modelscope import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-0.5B-Instruct"
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="cpu"
# device_map="cpu" # GPU-Inferenz
)
print(f"Modell-Device: {model.device}")
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Prompt
prompt = f"""Sie sind ein Experte für Textklassifikation nach Stimmung. Bitte klassifizieren Sie die folgende Benutzerbewertung als 【Positiv】, 【Negativ】 oder 【Neutral】. Geben Sie nur eines dieser drei Wörter aus, ohne Erklärung, Satzzeichen oder zusätzlichen Text.
Bewertung: Der Film von heute war wirklich schlecht, reine Zeitverschwendung.
Klassifikationsergebnis:"""
messages = [
{"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
{"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(
**model_inputs,
max_new_tokens=512
)
generated_ids = [
output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
]
response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print("response: ", response )
Anmelden an der Diskussion teilnehmen
Ergebnis:

Unter Verwendung des Modells Tongyi-MAI/Z-Image-Turbo zeigen wir, wie man ein Modell auf GPU lädt und eine Bildgenerierungsaufgabe abschließt.
Nach dem Starten der GPU-Instanz gelangen Sie in die Notebook-Entwicklungsumgebung.
Gemäß der Modellkarte installieren Sie die neueste Version von diffusers im Terminal:
!pip3 install git+https://github.com/huggingface/diffusers
Installation abgeschlossen:

Modell-Lade- und Inferenzcode:
import torch
from modelscope import ZImagePipeline
# 1. Modell laden
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16,
low_cpu_mem_usage=False,
)
pipe.to("cuda")
print(f"Modell-Device: {pipe.device}")
prompt = "Eine junge chinesische Frau in einem roten Hanfu, dessen Ärmel mit feinen, komplexen Mustern bestickt sind. Ihr Make-up ist makellos, ein roter Blütenzierrat auf der Stirn verleiht ihr noch mehr klassische Anmut. Der hohe, prächtige Frisur sitzt ein goldenes Phönixdiadem, verziert mit roten Blumen und Perlschnüren, das sanft wiegt. In der Hand hält sie einen runden Fächer, auf dessen Seite eine Hofdame, ein alter Baum und fliegende Vögel zu sehen sind, von friedlicher Stimmung. Über ihrer ausgestreckten linken Hand schwebt eine Lampe in Form eines Neon-Blitzes und strahlt warmes, hellgelbes Licht. Die Nacht ist sanft, das Licht verschwimmt; im Hintergrund ragen die gestaffelten Ebenen des Xi’aner Wildganspagodes auf und tauchen weich in den Lichtern, bunten Lichtflecken, fast traumhaft."
# 2. Bild generieren
image = pipe(
prompt=prompt,
height=1024,
width=1024,
num_inference_steps=9,
guidance_scale=0.0,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
print("Bild generiert")
image.save("image-vintage.png")
print("Bild erfolgreich gespeichert!")
Ergebnis:

Generiertes Bild:

Code und zugehörige Dateien dieses Kapitels: https://www.modelscope.cn/gallery/liucong/4a8eb492-54dc-4062-82c0-65b17fd94d5f