El modelo está corriendo en tu portátil, quieres probar un modelo más grande, o generar una imagen — pero quizás no tienes el hardware adecuado. Puedes offload la computación a la nube y dejar que el servidor se encargue.
Los servidores cloud se pueden configurar según las necesidades. Aquí continuamos usando ModelScope Notebook — selecciona directamente en el navegador una instancia CPU o GPU, descarga el modelo y ejecuta el código. La página se ejecuta en tu computadora; el modelo corre en la instancia cloud conectada.
Este capítulo tiene dos experimentos. Primero, usar CPU para ejecutar un modelo de nivel 0.5B y juzgar el sentimiento de una reseña. Luego usar GPU para ejecutar un modelo de generación de imágenes y convertir descripciones de texto en imágenes. Cada uno demuestra el uso bajo diferentes recursos con diferentes tareas y modelos, por lo que no se puede comparar directamente CPU vs GPU por tiempo de ejecución.
Otras recursos de servidores cloud se agregarán más adelante.Desde la página del modelo ModelScope, ve a "Notebook Desarrollo Rápido", luego haz clic en "Conectar Runtime". Primero selecciona una instancia CPU para análisis de sentimiento, luego cambia a una instancia GPU para generación de imágenes. Para las operaciones de página de Notebook, consulta el capítulo "Ve tu primer resultado en 30 minutos".
Después de cambiar de instancia, el proceso Python original y los modelos cargados no se transfieren automáticamente a la nueva instancia. Necesitas volver a verificar las dependencias en el entorno actual y ejecutar el código del experimento desde el principio.
Usando el modelo Qwen/Qwen2.5-0.5B-Instruct como ejemplo, mostramos cómo usar un modelo de nivel 0.5B en CPU para tareas de análisis de sentimiento.
Después de iniciar la instancia CPU, entra al entorno de desarrollo de Notebook. Código de carga del modelo e inferencia:
from modelscope import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen2.5-0.5B-Instruct"
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="cpu"
# device_map="cpu" # Inferencia GPU
)
print(f"Dispositivo del modelo: {model.device}")
tokenizer = AutoTokenizer.from_pretrained(model_name)
# Prompt
prompt = f"""Eres un experto en clasificación de sentimientos de texto. Por favor clasifica la siguiente reseña de usuario como 【Positiva】, 【Negativa】 o 【Neutral】. Solo outputa una de estas tres palabras, sin explicación, puntuación o texto adicional.
Reseña:La película de hoy es muy mala, una pérdida de tiempo.
Resultado de clasificación:"""
messages = [
{"role": "system", "content": "You are Qwen, created by Alibaba Cloud. You are a helpful assistant."},
{"role": "user", "content": prompt}
]
text = tokenizer.apply_chat_template(
messages,
tokenize=False,
add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(
**model_inputs,
max_new_tokens=512
)
generated_ids = [
output_ids[len(input_ids):] for input_ids, output_ids in zip(model_inputs.input_ids, generated_ids)
]
response = tokenizer.batch_decode(generated_ids, skip_special_tokens=True)[0]
print("response: ", response )
Iniciar sesión unirse a la discusión
Resultado:

Usando el modelo Tongyi-MAI/Z-Image-Turbo, mostramos cómo cargar un modelo en GPU y completar una tarea de generación de imágenes.
Después de iniciar la instancia GPU, entra al entorno de desarrollo de Notebook.
Según la tarjeta del modelo, instala la última versión de diffusers en la terminal:
!pip3 install git+https://github.com/huggingface/diffusers
Instalación completada:

Código de carga del modelo e inferencia:
import torch
from modelscope import ZImagePipeline
# 1. Carga del modelo
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16,
low_cpu_mem_usage=False,
)
pipe.to("cuda")
print(f"Dispositivo del modelo: {pipe.device}")
prompt = "Una joven mujer china viste un elegante hanfu rojo bordado con intrincados patrones. Su maquillaje es impecable, con un floral rojo en la frente que añade un toque clásico. Su alto peinado lleva una corona dorada de fénix adornada con flores rojas y cuentas de perlas. Sostiene un abanico plegable redondo pintado con una dama, un árbol antiguo y pájaros. Una lámpara con forma de rayo neón brilla sobre su palma izquierda extendida en luz cálida amarilla. La noche es suave, las luces difusas; a lo lejos, la Pagoda del Ganso Salvaje de Xi'an se eleva en capas, enmarcada por destellos de luz oníricos."
# 2. Generar imagen
image = pipe(
prompt=prompt,
height=1024,
width=1024,
num_inference_steps=9,
guidance_scale=0.0,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
print("Imagen generada")
image.save("image-vintage.png")
print("¡Imagen guardada exitosamente!")
Resultado:

Imagen generada:

Código y archivos relacionados de este capítulo: https://www.modelscope.cn/gallery/liucong/4a8eb492-54dc-4062-82c0-65b17fd94d5f