Le modèle tourne sur votre ordinateur portable, vous voulez essayer un modèle plus grand, ou générer une image — mais vous n'avez peut-être pas le matériel adapté. Vous pouvez déporter le calcul dans le cloud et laisser le serveur gérer.
Les serveurs cloud peuvent être configurés selon les besoins. Nous utilisons ici Notebook ModelScope — sélectionnez directement dans le navigateur une instance CPU ou GPU, téléchargez le modèle et exécutez du code. La page s'affiche sur votre ordinateur ; le modèle tourne sur l'instance cloud connectée.
Ce chapitre comporte deux expériences. D'abord, utiliser le CPU pour faire tourner un modèle de niveau 0.5B et juger le sentiment d'un avis. Ensuite, utiliser le GPU pour faire tourner un modèle de génération d'images et transformer du texte en images. Chaque expérience montre l'usage sous des ressources différentes avec des tâches et modèles différents — on ne peut pas comparer directement CPU vs GPU par le temps d'exécution.
Les autres ressources serveur cloud seront ajoutées ultérieurement.Depuis la page du modèle ModelScope, allez dans « Notebook Développement Rapide », puis cliquez sur « Connecter l'exécution ». Sélectionnez d'abord une instance CPU pour l'analyse de sentiment, puis passez à une instance GPU pour la génération d'images. Pour les opérations Notebook, consultez le chapitre « Voir votre premier résultat en 30 minutes ».
Après le changement d'instance, le processus Python d'origine et les modèles chargés ne se transfèrent pas automatiquement vers la nouvelle instance. Vous devez revérifier les dépendances dans l'environnement actuel et réexécuter le code de l'expérience depuis le début.
En prenant l'exemple du modèle Qwen/Qwen2.5-0.5B-Instruct, nous montrons comment utiliser un modèle de niveau 0.5B sur CPU pour l'analyse de sentiment.
Après avoir démarré l'instance CPU, entrez dans l'environnement de développement Notebook. Code de chargement du modèle et d'inférence :
from modelscope import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-0.5B-Instruct"
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="cpu"
# device_map="cpu" # Inférence GPU
)
print(f"Appareil du modèle : {model.device}")
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Prompt
prompt = f"""Vous êtes un expert en classification de sentiments textuels. Veuillez classer l'avis utilisateur suivant comme 【Positif】, 【Négatif】 ou 【Neutre】. Ne n'affichez qu'un seul de ces trois mots, sans explication, ponctuation ou texte supplémentaire.
Avis :Esse filme de hoje foi péssimo, uma perda de tempo.
Résultat de classification :"""
messages = [
{"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
{"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(
**model_inputs,
max_new_tokens=512
)
generated_ids = [
output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
]
response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print("response : ", response )
Se connecter pour rejoindre la discussion
Résultat :

En utilisant le modèle Tongyi-MAI/Z-Image-Turbo, nous montrons comment charger un modèle sur GPU et réaliser une tâche de génération d'images.
Après avoir démarré l'instance GPU, entrez dans l'environnement de développement Notebook.
Selon la fiche du modèle, installez la dernière version de diffusers dans le terminal :
!pip3 install git+https://github.com/huggingface/diffusers
Installation terminée :

Code de chargement du modèle et d'inférence :
import torch
from modelscope import ZImagePipeline
# 1. Chargement du modèle
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16,
low_cpu_mem_usage=False,
)
pipe.to("cuda")
print(f"Appareil du modèle : {pipe.device}")
prompt = "Une jeune Chinoise vêture d'un hanfu rouge, ses manches brodées de motifs délicats et complexes. Son maquillage est impeccable, avec un ornement floral rouge sur le front qui rehaussait encore son élégance classique. Son chignon haut est majestueux, coiffé d'une couronne de fênix dorée, ornée de fleurs rouges et de perles qui balançaient gracieusement. Elle tient à la main un éventail circulaire peint de dames, d'arbres anciens et d'oiseaux, d'une atmosphère paisible. Une lampe en forme d'éclair néon flotte au-dessus de sa paume gauche tendue, diffusant une lumière chaude et ambrée. La nuit est douce, les lumières voilées ; au loin, les étages de la Grande Oie Sauvage de Xi'an surgissent dans un halo doux, avec des taches de lumière colorées en arrière-plan, oniriques et irréelles."
# 2. Générer l'image
image = pipe(
prompt=prompt,
height=1024,
width=1024,
num_inference_steps=9,
guidance_scale=0.0,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
print("Image générée")
image.save("image-vintage.png")
print("Image enregistrée avec succès !")
Résultat :

Image générée :

Code et fichiers associés de ce chapitre : https://www.modelscope.cn/gallery/liucong/4a8eb492-54dc-4062-82c0-65b17fd94d5f