O modelo está rodando no seu notebook, você quer testar um modelo maior, ou gerar uma imagem — mas talvez não tenha o hardware adequado. Você pode offload o computação para a nuvem e deixar o servidor cuidar.
Os servidores cloud podem ser configurados conforme necessário. Continuamos usando o ModelScope Notebook aqui — selecione diretamente no navegador uma instância CPU ou GPU, baixe o modelo e execute o código. A página roda no seu computador; o modelo roda na instância cloud conectada.
Este capítulo tem dois experimentos. Primeiro, usar CPU para rodar um modelo de nível 0.5B e julgar o sentimento de uma avaliação. Depois usar GPU para rodar um modelo de geração de imagens e converter descrições de texto em imagens. Cada um demonstra o uso sob diferentes recursos com diferentes tarefas e modelos, então não se pode comparar diretamente CPU vs GPU por tempo de execução.
Outros recursos de servidores cloud serão adicionados depois.Na página do modelo ModelScope, vá para "Notebook Desenvolvimento Rápido", depois clique em "Conectar Runtime". Primeiro selecione uma instância CPU para análise de sentimento, depois mude para uma instância GPU para geração de imagens. Para operações de página do Notebook, consulte o capítulo "Veja seu primeiro resultado em 30 minutos".
Após mudar de instância, o processo Python original e os modelos carregados não são transferidos automaticamente para a nova instância. Você precisa verificar novamente as dependências no ambiente atual e re-executar o código do experimento do zero.
Usando o modelo Qwen/Qwen2.5-0.5B-Instruct como exemplo, mostramos como usar um modelo de nível 0.5B no CPU para tarefas de análise de sentimento.
Após iniciar a instância CPU, entre no ambiente de desenvolvimento do Notebook. Código de carregamento do modelo e inferência:
from modelscope import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-0.5B-Instruct"
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="cpu"
# device_map="cpu" # Inferência GPU
)
print(f"Dispositivo do modelo: {model.device}")
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Prompt
prompt = f"""Você é um especialista em classificação de sentimento de texto. Por favor classifique a seguinte avaliação do usuário como 【Positiva】, 【Negativa】 ou 【Neutra】. Apenas outpute uma dessas três palavras, sem explicação, pontuação ou texto adicional.
Avaliação:Esse filme de hoje foi péssimo, uma perda de tempo.
Resultado da classificação:"""
messages = [
{"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
{"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(
**model_inputs,
max_new_tokens=512
)
generated_ids = [
output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
]
response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print("response: ", response )
Entrar participar da discussão
Resultado:

Usando o modelo Tongyi-MAI/Z-Image-Turbo, mostramos como carregar um modelo na GPU e completar uma tarefa de geração de imagens.
Após iniciar a instância GPU, entre no ambiente de desenvolvimento do Notebook.
De acordo com o cartão do modelo, instale a versão mais recente do diffusers no terminal:
!pip3 install git+https://github.com/huggingface/diffusers
Instalação concluída:

Código de carregamento do modelo e inferência:
import torch
from modelscope import ZImagePipeline
# 1. Carregamento do modelo
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16,
low_cpu_mem_usage=False,
)
pipe.to("cuda")
print(f"Dispositivo do modelo: {pipe.device}")
prompt = "Uma jovem chinesa veste um vermelho hanfu, com mangas bordadas de padrões delicados e intrincados. Seu maquiagem é impecável, com um floral vermelho na testa que acrescenta um toque de elegância clássica. Seu alto coque é majestoso, adornado com uma coroa dourada de fênix, enfeitada com flores vermelhas e contas de pérolas que balançam graciosamente. Em uma mão ela segura um leque circular pintado com damas, árvores antigas e pássaros, em atmosfera serena. Uma luminária em forma de raio neon paira sobre sua palma esquerda estendida, irradiando uma luz amarelo-quente brilhante. A noite é suave, as luzes difusas; ao longe, as camadas da Pagoda do Grande Ganso de Xi'an surgem em um halo suave, com manchas de luz coloridas ao fundo, oníricas e iridescentes."
# 2. Gerar imagem
image = pipe(
prompt=prompt,
height=1024,
width=1024,
num_inference_steps=9,
guidance_scale=0.0,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
print("Imagem gerada")
image.save("image-vintage.png")
print("Imagem salva com sucesso!")
Resultado:

Imagem gerada:

Código e arquivos relacionados deste capítulo: https://www.modelscope.cn/gallery/liucong/4a8eb492-54dc-4062-82c0-65b17fd94d5f