Após baixar um modelo de código aberto, você pode executá-lo em seu próprio notebook ou alugar um servidor na nuvem, configurando CPU, GPU e o ambiente de execução conforme necessário. Hardware diferente requer preparações diferentes.
Se você só quer experimentar o que um modelo pode fazer primeiro, o ModelScope Notebook oferece um ponto de entrada gratuito. Abra um navegador, selecione uma instância em execução, e você pode escrever código, baixar modelos e visualizar resultados diretamente na página da web.
Esta lição guia você através da criação de um Notebook, verificação do ambiente e carregamento de um modelo. Siga os passos para ver seu primeiro resultado.
Vá até o hub de modelos, encontre o modelo Qwen/Qwen3-ASR-1.7B e clique em "Notebook Quick Development" à direita para criar um notebook do ModelScope.
Link do modelo: https://www.modelscope.cn/models/Qwen/Qwen3-ASR-1.7B
Clique em "Connect Runtime" no canto superior direito para selecionar uma instância. Aqui escolhemos GPU para a demonstração. Você pode selecionar uma imagem pré-instalada adequada com base nas dependências do modelo.
Após carregar a instância, o primeiro passo é verificar o ambiente atual. Você pode executar os seguintes comandos no notebook:
!python3 --version
Resultado:
Cada modelo tem dependências diferentes. Você precisa consultar o cartão do modelo para obter informações. De acordo com o cartão do modelo Qwen3-ASR-1.7B, a dependência de inferência é qwen3-asr. Se qwen3-asr estiver faltando no ambiente, você precisa instalá-lo.
# Verificar dependência
!pip3 show qwen-asr
# Instalar qwen-asr (se estiver faltando)
!pip3 install -U qwen-asr
Resultado:
Resultado da consulta de instalação bem-sucedida:
!lscpu
Entrar participar da discussão
Resultado:

!nvidia-smi
Resultado:

!free -h
Resultado:

!df -h
Resultado:

Consulte o código de exemplo no cartão do modelo para carregamento. Os arquivos do modelo necessários serão baixados automaticamente.
import torch
from qwen_asr import Qwen3ASRModel
model = Qwen3ASRModel.from_pretrained(
"Qwen/Qwen3-ASR-1.7B",
dtype=torch.bfloat16,
device_map="cuda:0",
# attn_implementation="flash_attention_2",
max_inference_batch_size=32, # Batch size limit for inference. -1 means unlimited. Smaller values can help avoid OOM.
max_new_tokens=256, # Maximum number of tokens to generate. Set a larger value for long audio input.
)
print("Modelo carregado com sucesso!")
Resultado:

Se você deseja baixar o modelo separadamente, consulte o método de download de modelos na seção 2.5 deste livro. Por exemplo, para baixar o modelo para o diretório /mnt/workspace/Qwen3-ASR-1.7B, usando o download por linha de comando como exemplo, execute o seguinte comando no terminal:
# Instalar ModelScope (se não estiver instalado)
!pip3 install modelscope
# Baixar o repositório completo do modelo
!modelscope download --model Qwen/Qwen3-ASR-1.7B --local_dir /mnt/workspace/Qwen3-ASR-1.7B
Resultado:

Se você tem os arquivos do modelo baixados, pode substituir Qwen/Qwen3-ASR-1.7B pelo caminho do seu modelo.
import torch
from qwen_asr import Qwen3ASRModel
model = Qwen3ASRModel.from_pretrained(
"/mnt/workspace/Qwen3-ASR-1.7B",
dtype=torch.bfloat16,
device_map="cuda:0",
# attn_implementation="flash_attention_2",
max_inference_batch_size=32, # Batch size limit for inference. -1 means unlimited. Smaller values can help avoid OOM.
max_new_tokens=256, # Maximum number of tokens to generate. Set a larger value for long audio input.
)
print("Modelo carregado com sucesso!")
Resultado:

Após o modelo ser carregado, você pode passar arquivos de áudio para inferência do modelo. Você pode substituir o valor do audio pelo caminho do seu arquivo de áudio.
results = model.transcribe(
audio="https://qianwen-res.oss-cn-beijing.aliyuncs.com/Qwen3-ASR-Repo/asr_en.wav",
language=None, # set "English" to force the language
)
print(results[0].language)
print(results[0].text)
print("Inferência do modelo concluída!")
Resultado:

Você pode substituir o valor do audio pelo caminho do seu arquivo de áudio para inferência do modelo. Clique com o botão direito na pasta "DSW-GPU" no espaço de trabalho à esquerda, clique em "Upload", selecione seu arquivo de áudio local e ele será carregado para a pasta "DSW-GPU" do ambiente Notebook.

Em seguida, modifique o código da seguinte forma:
results = model.transcribe(
audio="/mnt/workspace/asr_en.wav",
language=None, # set "English" to force the language
)
print(results[0].language)
print(results[0].text)
print("Inferência do modelo concluída!")
Resultado:

O código e os arquivos relacionados deste capítulo podem ser encontrados em: https://www.modelscope.cn/gallery/liucong/54c2ca38-b797-43d1-97ab-4b9f569aaa95