AIUnlimited
🌳

Fundamentos de IA

🌱
AI Seeds

Comece do zero

🌿
AI Sprouts

Construa bases

🌳
AI Branches

Aplique na prática

🏕️
AI Canopy

Aprofunde-se

🌲
AI Forest

Domine a IA

🔨

Mestria em IA

✏️
AI Sketch

Comece do zero

🪨
AI Chisel

Construa bases

⚒️
AI Craft

Aplique na prática

💎
AI Polish

Aprofunde-se

🏆
AI Masterpiece

Domine a IA

📘

Prática de IA

📖
Entendendo modelos open-source

Fundamentos e recursos para modelos open-source

🎯
Do problema à tarefa do modelo

Convertendo problemas de negócio em tarefas de modelo

⚡
Executando seu primeiro modelo

Veja seus primeiros resultados em 30 minutos

🔧
Fine-tuning e avaliação

Ajuste modelos e avalie o desempenho

🚀
Sistemas de aplicação

Construa aplicações IA do mundo real

🎨
IA generativa

Explore modelos AIGC open-source

🤖
Agentes

Aprenda frameworks Agent e ferramentas MCP

📐
Fundamentos complementares

Fundamentos LLM e avaliação

🎓

Claude Academia

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Laboratório

7 experimentos carregados
🧬Sandbox de Rede Neural🤖IA ou Humano?🥋Dojo de Prompt Engineering🏁Corrida de Algoritmos🧠Trivia de IA🏗️Tela de design de sistemas
🎯Entrevista simuladaEntrar no Laboratório→
🚀

Desenvolvimento de carreira

🚀
Plataforma de Lançamento de Entrevistas

Comece sua jornada

🌟
Domínio Comportamental

Domine habilidades interpessoais

💻
Entrevistas Técnicas

Passe na rodada de programação

🤖
Entrevistas de IA e ML

Domínio em entrevistas de ML

🏆
Oferta e Além

Conquiste a melhor oferta

Começar
AIUnlimited

Licença MIT

沪ICP备18025655号-11

Aprender

  • Fundamentos de IA
  • Prática de IA
  • Claude Academia
  • Laboratório
  • Desenvolvimento de carreira

Comunidade

  • Sobre
  • Perguntas Frequentes

Suporte

  • Termos de Serviço
  • Política de Privacidade
  • Contato
Acadêmicos de IA e Engenharia›🔧 Fine-tuning e avaliação›Aulas›Evaluating Fine-Tuned Models
📏
Fine-tuning e avaliação • Iniciante⏱️ 25 min de leitura

Evaluating Fine-Tuned Models

Como saber se o fine-tuning funciona? Teste!

Após concluir o fine-tuning do modelo, uma avaliação é necessária para determinar se o modelo alcançou verdadeiramente os resultados esperados. Como diferentes tarefas têm objetivos diferentes, os métodos de avaliação utilizados também variarão.

Por exemplo, tarefas de classificação concentram-se principalmente em se o modelo pode determinar a categoria correta; tarefas de extração de informação concentram-se em se a informação necessária é extraída de forma completa e precisa; tarefas de geração, além de julgar se as respostas estão corretas, também precisam concentrar-se na completude e relevância do conteúdo; o reconhecimento de voz geralmente avalia resultados através de taxas de erro; a geração de imagens requer uma combinação de métricas automáticas e avaliação humana.

Para métodos de teste específicos, veja 【Pré-avaliar antes de selecionar: Usar EvalScope para formar o primeiro relatório para modelos open-source】. Este capítulo dirá quais métricas de avaliação estão disponíveis para diferentes tarefas~

Métricas de avaliação de tarefas de classificação

A classificação de texto é um tipo de tarefa relativamente comum no fine-tuning de modelos, como reconhecimento de intenção, classificação de sentimento, classificação de falhas e classificação de risco.

Tipicamente, os resultados de previsão podem ser divididos em quatro casos:

  • TP (True Positive): Realmente uma amostra positiva, e o modelo prevê como positiva;
  • TN (True Negative): Realmente uma amostra negativa, e o modelo prevê como negativa;
  • FP (False Positive): Realmente uma amostra negativa, mas o modelo prevê como positiva;
  • FN (False Negative): Realmente uma amostra positiva, mas o modelo prevê como negativa.

Acurácia (Accuracy)

A acurácia representa a proporção de amostras previstas corretamente entre todas as amostras:

\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}  

Por exemplo, se 1000 pontos de dados são testados e o modelo prevê corretamente 900, então a Acurácia é de 90%. A Acurácia pode refletir intuitivamente o desempenho geral de classificação do modelo. No entanto, quando as quantidades de dados de diferentes categorias diferem significativamente, confiar apenas na Acurácia pode levar a julgamentos errados. Se entre 1000 dados de classificação de sentimento apenas 20 são negativos, e o modelo simplesmente prevê todos os dados como "positivos", a Acurácia ainda pode atingir 98%, mas na realidade, nenhum dos 20 dados negativos foi identificado. Portanto, quando a distribuição de classes está desequilibrada, geralmente é necessário avaliar o modelo usando Precisão, Recall e F1 juntos.

Precisão, Recall e F1

A Precisão representa quantos dos dados previstos como amostras positivas realmente pertencem a amostras positivas:

Aula 4 de 40% concluído
←Preference Alignment

Discussão

Entrar participar da discussão

$\mathrm{Precision}=\frac{TP}{TP+FP} $

O Recall representa quantos dos dados rotulados como amostras positivas foram identificados com sucesso pelo modelo:

$\mathrm{Recall}=\frac{TP}{TP+FN} $

O F1 Score considera integralmente a Precisão e o Recall. Um F1 mais alto geralmente indica que o modelo alcançou um bom equilíbrio entre Precisão e Recall.

F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}

Matriz de Confusão

A Precisão, o Recall e o F1 podem representar o desempenho geral do modelo com um único valor. No entanto, se você deseja saber quais categorias o modelo tende a classificar incorretamente, precisa usar uma matriz de confusão para uma análise mais aprofundada. A matriz de confusão compara as categorias reais de cada ponto de dados de teste com as categorias previstas pelo modelo, depois conta os resultados de previsão entre diferentes categorias e os organiza em uma matriz.

Por exemplo, se o conjunto de teste contém três categorias: falha de rede, falha de hardware e falha de software, os resultados de previsão do modelo são os seguintes:

Categoria real \ Categoria previstaFalha de redeFalha de hardwareFalha de software
Falha de rede4523
Falha de hardware1472
Falha de software6242

Cada linha representa a categoria real dos dados, e cada coluna representa a categoria prevista pelo modelo. Os números na diagonal da matriz representam a quantidade de previsões corretas; por exemplo, de 50 dados de falha de rede, 45 foram identificados corretamente. Fora da diagonal representam erros de previsão; por exemplo, 6 falhas de software foram previstas incorretamente como falhas de rede. A partir da matriz de confusão, você pode não apenas ver quantos pontos de dados o modelo prevê corretamente, mas também descobrir mais detalhadamente quais categorias são facilmente confundidas. Nos resultados acima, as falhas de software foram relativamente mais frequentemente previstas incorretamente como falhas de rede, indicando que a capacidade do modelo de distinguir entre essas duas categorias ainda tem espaço de melhoria. Ao analisar essas categorias facilmente confundidas, você pode descobrir mais detalhadamente os problemas do modelo e fornecer referências para complementar os dados de treinamento e otimizar o modelo.

Métricas de avaliação de extração de informação

Para tarefas como reconhecimento de entidade nomeada, extração de campo e extração de informação estruturada, as métricas de avaliação comumente usadas incluem acurácia de campo, Precisão, Recall e F1 a nível de entidade. Diferentes métricas concentram-se em diferentes granularidades de avaliação e podem ser selecionadas com base em tarefas específicas.

Acurácia de campo

A acurácia de campo é usada principalmente para medir se o modelo extrai corretamente os campos especificados. Seu método de cálculo é:

\text{Acurácia de campo} =
\frac{\text{Quantidade de campos extraídos corretamente}}
{\text{Quantidade total de campos a extrair}}

Para tarefas contendo múltiplos campos, a acurácia de diferentes campos pode ser calculada separadamente. Por exemplo, calcular separadamente a acurácia de nomes de empresas e nomes de pessoas pode analisar mais detalhadamente em quais campos o modelo tem capacidades de extração mais fracas. No entanto, esse método tem limitações: não pode determinar quais entidades o modelo perdeu. Portanto, para tarefas de extração de informação contendo múltiplas entidades, são necessárias a Precisão, o Recall e o F1 a nível de entidade para uma avaliação mais detalhada.

Precisão, Recall e F1 a nível de entidade

Para tarefas de reconhecimento de entidade nomeada (NER), a Precisão, o Recall e o F1 a nível de entidade são usados para avaliação. Esta seção é semelhante às métricas de avaliação de classificação da seção anterior.

Onde:

  • TP (True Positive): Entidades identificadas corretamente pelo modelo;
  • FP (False Positive): O modelo identificou uma entidade, mas o resultado da identificação está incorreto;
  • FN (False Negative): Uma entidade existe na verdade de referência, mas o modelo não a identificou.

A Precisão é usada para medir quantas das entidades identificadas pelo modelo estão corretas:

Precision = \frac{TP}{TP + FP}

O Recall é usado para medir quantas das entidades na verdade de referência foram identificadas com sucesso pelo modelo:

Recall = \frac{TP}{TP + FN}

O F1 considera integralmente a Precisão e o Recall:

F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}

Precisão mais alta indica que as entidades identificadas pelo modelo são geralmente mais precisas; Recall mais alto indica que o modelo perdeu menos entidades; o F1 é usado para medir integralmente o desempenho em ambos os aspectos.

Métricas de avaliação de tarefas de geração

Diferente das tarefas de classificação e extração de informação, o conteúdo gerado por grandes modelos de linguagem geralmente tem forte abertura, e as saídas dos modelos geralmente não têm uma resposta padrão única. Este tipo de tarefa geralmente precisa ser avaliada a partir de múltiplas dimensões, incluindo correção, completude, relevância, conformidade de formato e alucinações.

Correção

A correção julga principalmente se o conteúdo gerado pelo modelo está correto, incluindo se há erros em fatos, conclusões e resultados de raciocínio. Para modelos fine-tunados, mesmo que a linguagem da resposta seja fluida e o formato esteja completo, se contiver fatos ou conclusões incorretas, o modelo não pode ser considerado tendo alcançado bom desempenho de geração. A correção é geralmente o requisito mais básico ao avaliar resultados de geração.

Completude

A completude julga principalmente se o modelo respondeu suficientemente à pergunta e se informações importantes que deveriam ter sido incluídas foram omitidas. Algumas respostas, embora não tenham erros óbvios no conteúdo, respondem apenas a uma parte da pergunta e omitem informações-chave. Nesses casos, a resposta do modelo tem um certo grau de correção, mas a completude ainda é insuficiente. A completude não se concentra apenas em se a resposta está correta, mas também em se todo o conteúdo que deveria ter sido respondido foi abordado.

Relevância

A relevância julga principalmente se o conteúdo gerado pelo modelo gira em torno da pergunta do usuário. Grandes modelos de linguagem às vezes geram grande quantidade de conteúdo que parece razoável, mas não está intimamente relacionado à pergunta. Embora esse conteúdo possa não estar incorreto em si, reduz a eficácia da resposta. Uma resposta com boa relevância deveria abordar diretamente a pergunta do usuário e minimizar conteúdo irrelevante, repetitivo ou excessivamente expandido.

Conformidade de Formato

Em aplicações práticas, além do conteúdo da resposta em si, os modelos geralmente precisam produzir resultados em um formato especificado. Por exemplo, exigir que o modelo retorne resultados no formato JSON, ou organize conteúdo de acordo com campos, ordem e estrutura especificados. A conformidade de formato avalia principalmente se o modelo gera conteúdo de acordo com os requisitos de saída dados. Mesmo que o conteúdo da resposta esteja correto, se não for produzido no formato especificado, pode causar que programas subsequentes não consigam analisá-lo e usá-lo corretamente. Para modelos que passaram por fine-tuning de instruções ou têm requisitos de saída fixos, a conformidade de formato também é uma dimensão de avaliação importante.

Alucinação

A alucinação refere-se ao modelo gerar conteúdo que carece de base, que é inconsistente com os fatos ou que é fabricado do nada. Quando o modelo não conhece certas informações, em vez de indicar informações insuficientes, gera um fato que parece razoável, mas que realmente não existe. Este é um problema típico de alucinação.

A alucinação está relacionada à correção, mas concentra-se em aspectos diferentes. A correção concentra-se em se o conteúdo da resposta está correto, enquanto a alucinação concentra-se mais em se o modelo gerou informações sem base confiável. Para cenários como perguntas e respostas sobre conhecimentos que exigem alta confiabilidade fática, é necessário prestar muita atenção à situação de alucinação do modelo.

Métricas de reconhecimento de voz

Tarefas de reconhecimento de voz (ASR) geralmente precisam ser avaliadas a partir de dois aspectos: precisão de reconhecimento e eficiência de processamento. Entre eles, o CER e o WER são usados para medir taxas de erro nos resultados de reconhecimento, enquanto o RTF é usado para medir a velocidade de processamento do modelo.

Antes de introduzir o CER e o WER, expliquemos primeiro vários símbolos comumente usados nos cálculos de taxa de erro de reconhecimento de voz:

  • S (Substitution): Erro de substituição, onde caracteres ou palavras corretamente reconhecidos são reconhecidos como outros conteúdos;
  • D (Deletion): Erro de exclusão, onde caracteres ou palavras que deveriam ter sido reconhecidos são omitidos;
  • I (Insertion): Erro de inserção, onde caracteres ou palavras ausentes no texto são reconhecidos adicionalmente;
  • N: Número total de caracteres ou palavras no texto padrão.

Tanto o CER quanto o WER são calculados com base nesses tipos de erros, sendo a principal diferença as unidades estatísticas utilizadas.

CER: Taxa de erro de caractere

O CER (Character Error Rate) mede a diferença entre resultados de reconhecimento de voz e texto padrão usando caracteres como unidades. Sua fórmula de cálculo é:

CER = \frac{S + D + I}{N}

Um CER mais baixo geralmente indica resultados de reconhecimento de voz mais precisos. Para tarefas de reconhecimento de voz em chinês, o CER é uma métrica de avaliação comumente usada.

WER: Taxa de erro de palavra

O WER (Word Error Rate) tem essencialmente o mesmo método de cálculo que o CER:

WER = \frac{S + D + I}{N}

O CER usa caracteres como unidade básica, enquanto o WER usa palavras como unidade básica. É mais comumente usado em tarefas de reconhecimento de voz para idiomas como inglês que usam palavras como unidades linguísticas básicas.

RTF: Fator de tempo real

Além de se os resultados de reconhecimento são precisos, modelos de reconhecimento de voz em implantação real também precisam considerar a velocidade de processamento. O RTF (Real-Time Factor) é uma métrica comumente usada para medir a eficiência de processamento do reconhecimento de voz. Sua fórmula de cálculo é:

RTF =
\frac{\text{Tempo de processamento do modelo}}
{\text{Duração do áudio}}

Por exemplo, se um clipe de áudio de 10 segundos leva 5 segundos para ser reconhecido, então:

RTF = \frac{5}{10} = 0.5

Um RTF mais baixo indica velocidade de processamento mais rápida do modelo. Quando o RTF é menor que 1, significa que a velocidade de processamento do modelo é mais rápida que a velocidade de reprodução real do áudio, atendendo às condições básicas para processamento em tempo real.

Além de métricas como CER, WER e RTF, os modelos também podem ser avaliados em diferentes ambientes de teste. Por exemplo, calcular o CER ou WER separadamente sob condições como ruído de fundo, diferentes sotaques, gravação distante e múltiplos falantes. Comparando as taxas de erro em diferentes cenários, a capacidade de reconhecimento e estabilidade do modelo em ambientes complexos podem ser avaliadas mais detalhadamente.

Métricas de avaliação de texto para fala

Texto para fala (Text-to-Speech, TTS) tem como objetivo converter texto de entrada em fala natural e clara. Diferente de modelos de geração de texto, modelos TTS não precisam apenas garantir que o conteúdo gerado corresponda ao texto de entrada, mas também concentrar-se na naturalidade da fala, timbre e velocidade de geração. Modelos TTS geralmente são avaliados a partir de aspectos como acurácia de conteúdo, naturalidade da fala, semelhança do falante e desempenho de inferência.

Acurácia do conteúdo

O TTS primeiro precisa garantir que o texto de entrada possa ser lido em voz alta corretamente, evitando problemas de leitura incorreta, leitura omitida ou repetição. Durante a avaliação, modelos ASR podem ser usados para reconhecer novamente a fala gerada pelo TTS como texto, e então comparar os resultados de reconhecimento com o texto de entrada original. As métricas de acurácia do conteúdo são consistentes com as do capítulo ASR anterior, calculando a taxa de erro de caractere (CER) e a taxa de erro de palavra (WER).

Naturalidade da fala

Além de ler corretamente o texto, a fala gerada pelo TTS também precisa ter boa naturalidade, como ritmo de fala razoável, pausas naturais, entonação fluida e ausência de uma sensação mecânica perceptível. O Mean Opinion Score (MOS) é geralmente usado. Durante a avaliação, vários testadores ouvem a fala gerada e a pontuam de acordo com certos padrões de pontuação, usando geralmente uma escala de 1 a 5, onde 1 indica qualidade de fala deficiente e 5 indica fala natural e fluida próxima à fala humana.

O MOS final pode ser expresso como:

MOS = \frac{1}{M}\sum_{i=1}^{M}s_i

Onde $M$ representa o número de pessoas participando da pontuação, e $s_i$ representa a pontuação dada pelo $i$-ésimo avaliador.

O MOS pode refletir de forma relativamente intuitiva a experiência auditiva real dos usuários com a fala gerada, mas como depende de escuta manual, seus custos de avaliação são relativamente altos e também apresenta um certo grau de subjetividade.

Semelhança do falante

Para modelos de clonagem de voz, TTS multi-falante ou TTS zero-shot, simplesmente garantir a naturalidade da fala não é suficiente. Também é necessário avaliar se a fala gerada mantém as características de timbre do falante alvo. Um método comum é usar modelos de reconhecimento de falante para extrair embeddings de falante da fala de referência e da fala gerada separadamente, e então calcular a similaridade cosseno entre os dois vetores:

SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}

Onde $\mathbf{e}{ref}$ representa o vetor de falante da fala de referência, e $\mathbf{e}{gen}$ representa o vetor de falante da fala gerada.

Um SIM mais alto indica que a fala gerada está mais próxima do falante de referência em termos de características de timbre. Esta métrica é particularmente adequada para avaliar a eficácia de modelos de clonagem de voz.

Fator de tempo real

Em termos de desempenho de inferência, o TTS é semelhante a modelos de reconhecimento de voz e também pode usar o RTF para medir a eficiência de processamento do modelo. A diferença é que o RTF no reconhecimento de voz geralmente representa a razão entre o tempo de reconhecimento e a duração do áudio de entrada, enquanto no TTS representa a razão entre o tempo de geração de fala e a duração do áudio gerado. Um RTF mais baixo indica maior eficiência de geração de fala do modelo.

A fórmula de cálculo do RTF é:

RTF =
\frac{T_{infer}}{T_{audio}}

Onde $T_{infer}$ representa o tempo de inferência necessário para gerar a fala, e $T_{audio}$ representa a duração do áudio gerado final.

Para modelos TTS em streaming, também é possível focar mais no Time to First Audio, que é o tempo decorrido desde que o modelo recebe uma solicitação de texto até produzir o primeiro segmento de áudio reproduzível. Um Time to First Audio mais baixo significa que os usuários podem ouvir a fala gerada mais rapidamente, portanto esta métrica é particularmente importante para cenários de interação de voz em tempo real.

Avaliação objetiva de geração de imagens

Para tarefas como texto para imagem, imagem para imagem e edição de imagens, é difícil avaliar completamente os resultados de geração usando apenas uma métrica. Por exemplo, texto para imagem precisa julgar se as imagens geradas correspondem às descrições de texto, edição de imagens também precisa julgar se os resultados gerados preservam os sujeitos principais e a estrutura da imagem original, e ao avaliar o desempenho geral de um modelo de geração de imagens, também é necessário considerar a qualidade e autenticidade das imagens geradas.

Consistência texto-imagem

Para tarefas de texto para imagem, primeiro é necessário julgar se as imagens geradas correspondem à descrição de texto de entrada. Por exemplo, se o prompt exige gerar sujeitos, cenas ou estilos específicos, as imagens geradas pelo modelo deveriam conter esses elementos tanto quanto possível.

Uma abordagem comum de avaliação é usar modelos de visão-linguagem como CLIP para mapear texto e imagens no mesmo espaço de características, e então calcular o grau de similaridade entre ambos. CLIP foi proposto por Radford et al. em 2021, treinando com dados massivos de "imagem-texto" para permitir que o modelo aprenda a correspondência entre conteúdo de imagem e linguagem natural. A similaridade cosseno entre imagem e texto pode ser expressa como:

Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}

Onde

\mathbf{v}{image} 

representa o vetor de características da imagem,

\mathbf{v}{text} 

representa o vetor de características do texto. Geralmente, similaridade mais alta indica que a imagem e o texto estão mais próximos em semântica global. Este tipo de método avalia principalmente se a semântica global corresponde e não pode garantir que todos os detalhes no texto sejam gerados com precisão, como julgar se quantidades, posições e detalhes na imagem são precisos.

Similaridade de imagem

Para tarefas de imagem para imagem e edição de imagens, geralmente também é fornecida uma imagem original ou imagem de referência. Este tipo de tarefa não precisa apenas julgar se os resultados gerados atendem aos requisitos de texto, mas também focar em se o conteúdo importante da imagem original foi corretamente preservado.

Por exemplo, na edição de imagens de produtos, o fundo, iluminação ou estilo geral podem ser modificados, mas geralmente deseja-se que informações importantes como o sujeito do produto, estrutura de aparência e logo permaneçam consistentes. Nesse caso, a eficácia da edição pode ser avaliando comparando as diferenças entre imagens geradas e imagens de referência.

O SSIM (Structural Similarity Index) é um método clássico de avaliação de qualidade de imagem com referência completa, proposto por Wang et al. em 2004. Ele compara principalmente duas imagens a partir de aspectos como brilho, contraste e estrutura, com foco particular em se as informações estruturais da imagem mudaram.

Além do SSIM, o LPIPS (Learned Perceptual Image Patch Similarity) também pode ser usado para medir diferenças perceptuais entre duas imagens. O LPIPS usa redes neurais profundas para extrair características de imagem, e então julga diferenças perceptuais visuais entre duas imagens com base nas distâncias entre as características. Pesquisas relacionadas mostram que características profundas podem melhor refletir a percepção humana de similaridade de imagens. Embora tanto o SSIM quanto o LPIPS requerem imagens de referência, concentram-se em aspectos diferentes: o SSIM foca mais nas mudanças de estrutura de imagem, enquanto o LPIPS foca mais nas diferenças de percepção visual. Em tarefas práticas, métricas apropriadas podem ser selecionadas com base nos objetivos de edição de imagem.

Para tarefas com imagens de referência como edição de imagens e imagem para imagem, a similaridade entre imagens geradas e imagens de referência pode ser calculada.

FID

As métricas anteriores são usadas principalmente para comparar a relação entre uma imagem gerada e texto ou uma imagem de referência. Se você deseja avaliar o desempenho geral de geração de um modelo de geração de imagens, geralmente é necessária uma análise estatística de um lote de imagens geradas.

O FID (Fréchet Inception Distance) foi proposto por Heusel et al. em 2017, usado principalmente para medir diferenças em distribuições de características entre imagens geradas e imagens reais. FID. O FID primeiro usa modelos de imagem para extrair características de imagens reais e geradas, depois calcula separadamente as distribuições dos dois conjuntos de características e calcula a distância entre as duas distribuições. Sua forma básica é:

FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)

Onde $\mu_r$ e $\Sigma_r$ representam a média e a matriz de covariância das características de imagens reais, e $\mu_g$ e $\Sigma_g$ representam a média e a matriz de covariância das características de imagens geradas. O FID não compara duas imagens específicas, mas as diferenças nas distribuições de características entre dois lotes de imagens. Um FID mais baixo indica que a distribuição de características das imagens geradas está mais próxima daquela das imagens reais, tornando-o adequado para comparar o desempenho geral entre modelos.

Pontuação estética

Além de avaliar se as imagens correspondem às descrições de texto, também pode ser realizada uma avaliação automática das imagens geradas a partir da perspectiva dos efeitos visuais. A pontuação estética geralmente usa dados contendo avaliações estéticas humanas ou informações de preferência para treinar modelos de avaliação, permitindo que o modelo aprenda as preferências humanas pela qualidade visual das imagens, e então pontue automaticamente as imagens geradas.

Este tipo de método geralmente reflete integralmente características como composição, cor, iluminação, clareza e atração visual geral. Pontuações mais altas geralmente indicam melhor desempenho visual da imagem sob o modelo de avaliação utilizado. A avaliação estética apresenta um certo grau de subjetividade, pois diferentes modelos de pontuação podem ter dados de treinamento e preferências estéticas diferentes. Portanto, a pontuação estética é mais adequada como métrica auxiliar e não pode representar independentemente a qualidade de geração de imagens.

Avaliação subjetiva de geração de imagens

Métricas objetivas podem avaliar resultados de geração a partir de aspectos como consistência texto-imagem, similaridade de imagem e distribuição de características, mas essas métricas não podem refletir completamente os efeitos visuais reais das imagens. Portanto, em tarefas de geração de imagens, geralmente também é necessário combinar avaliação humana para julgar a qualidade das imagens geradas a partir da perspectiva da percepção visual humana e das necessidades reais de uso.

A avaliação humana pode se concentrar nos seguintes aspectos:

  • Consistência do conteúdo: Se as imagens geradas correspondem às descrições de texto de entrada ou requisitos de edição;
  • Qualidade visual: Se as imagens são claras e naturais, e se há distorções, desfoque ou erros estruturais óbvios;
  • Consistência do sujeito: Para tarefas de imagem para imagem e edição de imagens, se sujeitos principais como pessoas e produtos permanecem consistentes com imagens de referência;
  • Qualidade dos detalhes: Se posições propensas a erros como mãos de pessoas, texto, logotipos e bordas são normais;
  • Usabilidade prática: Se os resultados gerados podem ser diretamente usados em cenários de negócios reais como cartazes e exibição de produtos.

Para reduzir diferenças causadas por julgamentos subjetivos individuais, padrões de pontuação unificados podem ser estabelecidos antecipadamente, e múltiplos avaliadores podem realizar avaliações separadamente. A avaliação subjetiva pode descobrir problemas visuais que métricas automatizadas têm dificuldade em refletir. Portanto, na avaliação real de geração de imagens, métricas objetivas e avaliação humana geralmente são usadas juntas para julgar mais integralmente o desempenho de geração do modelo.

Avaliação de modelos de geração de vídeo

Modelos de geração de vídeo precisam gerar conteúdo de vídeo contínuo com base em entradas como texto e imagens. Diferente da geração de imagens, o vídeo não apenas precisa garantir a qualidade de quadros individuais, mas também focar na continuidade entre diferentes quadros, na razoabilidade do movimento e na consistência entre o conteúdo gerado e as condições de entrada. Portanto, modelos de geração de vídeo geralmente precisam ser avaliados integralmente a partir de múltiplos aspectos, incluindo consistência vídeo-texto, qualidade geral do vídeo, consistência temporal, qualidade do movimento e experiência visual subjetiva.

Consistência vídeo-texto

Semelhante a tarefas de texto para imagem, tarefas de texto para vídeo também precisam avaliar a consistência semântica entre o conteúdo gerado e o texto de entrada. A diferença é que o vídeo é composto por quadros de vídeo contínuos, exigindo consideração adicional do grau de correspondência entre o conteúdo total do vídeo e a descrição de texto. O método principal é extrair vários quadros de vídeo de vídeos gerados, usar modelos de visão-linguagem como CLIP para calcular separadamente a similaridade semântica entre cada quadro de vídeo e o texto de entrada, e então calcular a média dos resultados de múltiplos quadros de vídeo (comumente chamado de Frame-average CLIP Score):

$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$

Onde $N$ representa o número de quadros de vídeo participando da avaliação, $\mathbf{v}_{\text{frame}_i}$ representa o vetor de características do $i$-ésimo quadro de vídeo, $\mathbf{v}_{\text{text}}$ representa o vetor de características do texto de entrada, e $\operatorname{Similarity}(\cdot, \cdot)$ usa similaridade cosseno. Pontuações mais altas indicam maior correspondência semântica entre o conteúdo do vídeo e o texto de entrada. Esta métrica foca principalmente na correspondência entre conteúdo estático espacial e texto e não pode refletir completamente a coerência de ações e a lógica temporal física no vídeo, portanto ainda precisa ser combinada com métricas como consistência temporal e qualidade do movimento para medição integral.

Distância de Fréchet de vídeo

A Distância de Fréchet de vídeo (Fréchet Video Distance, FVD) é uma métrica central para medir a qualidade da distribuição de geração em tarefas de geração de vídeo, usada para medir diferenças nas distribuições de características profundas entre conjuntos de vídeos gerados e conjuntos de vídeos reais. Ao calcular a FVD, primeiro são extraídas as características profundas de vídeos reais e gerados, os parâmetros de distribuição gaussiana (vetor médio e matriz de covariância) dos dois conjuntos de características são calculados, e sua distância de Fréchet é calculada: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$

Onde $\mu_r$ e $\Sigma_r$ representam respectivamente o vetor médio e a matriz de covariância das características de vídeos reais, $\mu_g$ e $\Sigma_g$ representam respectivamente o vetor médio e a matriz de covariância das características de vídeos gerados, e $\operatorname{Tr}(\cdot)$ representa o traço de uma matriz. Valores de FVD mais baixos indicam que a distribuição de características dos vídeos gerados está mais próxima daquela dos vídeos reais, indicando melhor desempenho geral do modelo em fidelidade visual, consistência temporal e diversidade de amostras.

Consistência temporal

A consistência temporal é usada principalmente para avaliar a estabilidade dos vídeos gerados na dimensão temporal. O vídeo é composto por quadros contínuos, exigindo não apenas boa qualidade de imagem para cada quadro, mas também transições suaves de aparência do sujeito, textura do fundo, cor e estilo entre quadros consecutivos. Em cenários de geração de personagens, por exemplo, se características faciais ou texturas de roupas piscam ou deformam frequentemente entre quadros, mesmo que a qualidade individual do quadro seja alta, a experiência de visualização será grandemente prejudicada. Na avaliação real, um método comum é usar redes de extração de características de imagem para obter representações de quadros consecutivos e calcular a similaridade cosseno média entre características de quadros adjacentes. Para um vídeo contendo $N$ quadros de vídeo, sua consistência temporal $TC$ pode ser expressa como:

$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$

Onde $\mathbf{f}_i$ e $\mathbf{f}_{i+1}$ representam respectivamente os vetores de características visuais do $i$-ésimo e $(i+1)$-ésimo quadro, e $N$ é o número total de quadros amostrados. Geralmente, pontuações $TC$ mais altas indicam saltos visuais menores entre quadros adjacentes e quadros mais estáveis. A consistência temporal não é absolutamente melhor quando mais alta: quando o modelo degrada e gera quadros quase completamente estáticos, $TC$ também será anormalmente alta. A consistência temporal deve ser combinada com métricas como Dynamic Degree e amplitude de movimento para julgamento conjunto.

Suavidade do movimento

Modelos de geração de vídeo não precisam apenas evitar cintilação de imagem, mas também garantir que as trajetórias de movimento dos sujeitos sejam coerentes e naturais, evitando fenômenos que não são compatíveis com o senso comum como mutações de membros locais e deslocamentos instantâneos. A suavidade do movimento é usada principalmente para medir a regularidade das mudanças na velocidade e aceleração do movimento ao longo do tempo. Nos cálculos específicos, geralmente são usados modelos pré-treinados de estimativa de fluxo óptico (como RAFT) para extrair campos de fluxo óptico densos ou vetores de movimento entre quadros adjacentes. Seja o vetor de movimento (ou fluxo óptico médio) do quadro $t$ ao quadro $t+1$ $\mathbf{v}_t$, o erro de mudança de movimento $E_{\text{motion}}$ pode ser definido através de diferenças em vetores de movimento entre períodos de tempo adjacentes:

$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$

Onde $\mathbf{v}_t$ reflete o estado de movimento na fase $t$. Um $E_{\text{motion}}$ menor indica menos mudanças bruscas na aceleração de movimento e transições de ação mais suaves.

VBench

Como é difícil para uma única métrica refletir integralmente as capacidades de modelos de geração de vídeo, agora podem ser usados quadros de avaliação integrais como VBench para avaliação multidimensional de modelos de geração de vídeo. O VBench divide a qualidade de geração de vídeo em múltiplas dimensões de avaliação, como consistência do sujeito, consistência do fundo, suavidade do movimento, Dynamic Degree, qualidade estética e qualidade de imagem. Comparado a métricas únicas como CLIP Score e FVD, a vantagem do VBench reside em sua capacidade de analisar o desempenho de geração de vídeo a partir de múltiplas perspectivas, incluindo qualidade de imagem, estabilidade temporal, desempenho de movimento e consistência de condições, tornando-o mais adequado para comparação de capacidades integrais entre diferentes modelos de geração de vídeo.

Avaliação humana

As saídas de grandes modelos de linguagem têm forte abertura, e a mesma pergunta frequentemente pode ter múltiplas abordagens de resposta razoáveis. É difícil julgar integralmente se as respostas estão corretas e atendem às necessidades dos usuários confiando apenas em métricas automatizadas. Portanto, ao avaliar grandes modelos de linguagem fine-tunados, a avaliação humana continua sendo um método de avaliação importante. Para conteúdo aberto que é difícil de avaliar com precisão usando métricas automatizadas, podem ser usados métodos de teste cego ou pontuação por múltiplas pessoas. Os avaliadores podem julgar integralmente as saídas do modelo a partir de aspectos como correção, completude, relevância, seguimento de instruções, qualidade de expressão e segurança.

Na avaliação real, padrões de pontuação unificados podem ser estabelecidos antecipadamente, como pontuar diferentes dimensões de avaliação em uma escala de 1 a 5. Para reduzir preconceitos dos avaliadores em relação aos modelos, nomes e versões de modelos podem ser ocultados, permitindo que os avaliadores realizem testes cegos apenas com base no conteúdo das respostas. Se comparando modelos antes e depois do fine-tuning, as respostas de ambos os modelos para a mesma pergunta podem ser exibidas anonimamente, e os avaliadores podem escolher a resposta com melhor desempenho.

Como a avaliação humana apresenta um certo grau de subjetividade, para avaliações importantes também pode ser adotada pontuação por múltiplas pessoas. O mesmo lote de conteúdo é avaliado independentemente por múltiplos avaliadores, e então os resultados de pontuação são resumidos. Quando há grandes diferenças nas pontuações entre diferentes avaliadores, é necessário verificar mais detalhadamente se os critérios de avaliação são claros para melhorar a consistência e confiabilidade dos resultados de avaliação. Embora a avaliação humana requer mais tempo e mão de obra, pode descobrir problemas que métricas automatizadas têm dificuldade em refletir. Ao avaliar a eficácia do fine-tuning de grandes modelos de linguagem, avaliação automatizada e avaliação humana podem ser combinadas para julgar mais integralmente se o modelo foi verdadeiramente melhorado.