Após concluir o fine-tuning do modelo, uma avaliação é necessária para determinar se o modelo alcançou verdadeiramente os resultados esperados. Como diferentes tarefas têm objetivos diferentes, os métodos de avaliação utilizados também variarão.
Por exemplo, tarefas de classificação concentram-se principalmente em se o modelo pode determinar a categoria correta; tarefas de extração de informação concentram-se em se a informação necessária é extraída de forma completa e precisa; tarefas de geração, além de julgar se as respostas estão corretas, também precisam concentrar-se na completude e relevância do conteúdo; o reconhecimento de voz geralmente avalia resultados através de taxas de erro; a geração de imagens requer uma combinação de métricas automáticas e avaliação humana.
Para métodos de teste específicos, veja 【Pré-avaliar antes de selecionar: Usar EvalScope para formar o primeiro relatório para modelos open-source】. Este capítulo dirá quais métricas de avaliação estão disponíveis para diferentes tarefas~
A classificação de texto é um tipo de tarefa relativamente comum no fine-tuning de modelos, como reconhecimento de intenção, classificação de sentimento, classificação de falhas e classificação de risco.
Tipicamente, os resultados de previsão podem ser divididos em quatro casos:
A acurácia representa a proporção de amostras previstas corretamente entre todas as amostras:
\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}
Por exemplo, se 1000 pontos de dados são testados e o modelo prevê corretamente 900, então a Acurácia é de 90%. A Acurácia pode refletir intuitivamente o desempenho geral de classificação do modelo. No entanto, quando as quantidades de dados de diferentes categorias diferem significativamente, confiar apenas na Acurácia pode levar a julgamentos errados. Se entre 1000 dados de classificação de sentimento apenas 20 são negativos, e o modelo simplesmente prevê todos os dados como "positivos", a Acurácia ainda pode atingir 98%, mas na realidade, nenhum dos 20 dados negativos foi identificado. Portanto, quando a distribuição de classes está desequilibrada, geralmente é necessário avaliar o modelo usando Precisão, Recall e F1 juntos.
A Precisão representa quantos dos dados previstos como amostras positivas realmente pertencem a amostras positivas:
Entrar participar da discussão
$\mathrm{Precision}=\frac{TP}{TP+FP} $
O Recall representa quantos dos dados rotulados como amostras positivas foram identificados com sucesso pelo modelo:
$\mathrm{Recall}=\frac{TP}{TP+FN} $
O F1 Score considera integralmente a Precisão e o Recall. Um F1 mais alto geralmente indica que o modelo alcançou um bom equilíbrio entre Precisão e Recall.
F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}
A Precisão, o Recall e o F1 podem representar o desempenho geral do modelo com um único valor. No entanto, se você deseja saber quais categorias o modelo tende a classificar incorretamente, precisa usar uma matriz de confusão para uma análise mais aprofundada. A matriz de confusão compara as categorias reais de cada ponto de dados de teste com as categorias previstas pelo modelo, depois conta os resultados de previsão entre diferentes categorias e os organiza em uma matriz.
Por exemplo, se o conjunto de teste contém três categorias: falha de rede, falha de hardware e falha de software, os resultados de previsão do modelo são os seguintes:
| Categoria real \ Categoria prevista | Falha de rede | Falha de hardware | Falha de software |
| Falha de rede | 45 | 2 | 3 |
| Falha de hardware | 1 | 47 | 2 |
| Falha de software | 6 | 2 | 42 |
Cada linha representa a categoria real dos dados, e cada coluna representa a categoria prevista pelo modelo. Os números na diagonal da matriz representam a quantidade de previsões corretas; por exemplo, de 50 dados de falha de rede, 45 foram identificados corretamente. Fora da diagonal representam erros de previsão; por exemplo, 6 falhas de software foram previstas incorretamente como falhas de rede. A partir da matriz de confusão, você pode não apenas ver quantos pontos de dados o modelo prevê corretamente, mas também descobrir mais detalhadamente quais categorias são facilmente confundidas. Nos resultados acima, as falhas de software foram relativamente mais frequentemente previstas incorretamente como falhas de rede, indicando que a capacidade do modelo de distinguir entre essas duas categorias ainda tem espaço de melhoria. Ao analisar essas categorias facilmente confundidas, você pode descobrir mais detalhadamente os problemas do modelo e fornecer referências para complementar os dados de treinamento e otimizar o modelo.
Para tarefas como reconhecimento de entidade nomeada, extração de campo e extração de informação estruturada, as métricas de avaliação comumente usadas incluem acurácia de campo, Precisão, Recall e F1 a nível de entidade. Diferentes métricas concentram-se em diferentes granularidades de avaliação e podem ser selecionadas com base em tarefas específicas.
A acurácia de campo é usada principalmente para medir se o modelo extrai corretamente os campos especificados. Seu método de cálculo é:
\text{Acurácia de campo} =
\frac{\text{Quantidade de campos extraídos corretamente}}
{\text{Quantidade total de campos a extrair}}
Para tarefas contendo múltiplos campos, a acurácia de diferentes campos pode ser calculada separadamente. Por exemplo, calcular separadamente a acurácia de nomes de empresas e nomes de pessoas pode analisar mais detalhadamente em quais campos o modelo tem capacidades de extração mais fracas. No entanto, esse método tem limitações: não pode determinar quais entidades o modelo perdeu. Portanto, para tarefas de extração de informação contendo múltiplas entidades, são necessárias a Precisão, o Recall e o F1 a nível de entidade para uma avaliação mais detalhada.
Para tarefas de reconhecimento de entidade nomeada (NER), a Precisão, o Recall e o F1 a nível de entidade são usados para avaliação. Esta seção é semelhante às métricas de avaliação de classificação da seção anterior.
Onde:
A Precisão é usada para medir quantas das entidades identificadas pelo modelo estão corretas:
Precision = \frac{TP}{TP + FP}
O Recall é usado para medir quantas das entidades na verdade de referência foram identificadas com sucesso pelo modelo:
Recall = \frac{TP}{TP + FN}
O F1 considera integralmente a Precisão e o Recall:
F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}
Precisão mais alta indica que as entidades identificadas pelo modelo são geralmente mais precisas; Recall mais alto indica que o modelo perdeu menos entidades; o F1 é usado para medir integralmente o desempenho em ambos os aspectos.
Diferente das tarefas de classificação e extração de informação, o conteúdo gerado por grandes modelos de linguagem geralmente tem forte abertura, e as saídas dos modelos geralmente não têm uma resposta padrão única. Este tipo de tarefa geralmente precisa ser avaliada a partir de múltiplas dimensões, incluindo correção, completude, relevância, conformidade de formato e alucinações.
A correção julga principalmente se o conteúdo gerado pelo modelo está correto, incluindo se há erros em fatos, conclusões e resultados de raciocínio. Para modelos fine-tunados, mesmo que a linguagem da resposta seja fluida e o formato esteja completo, se contiver fatos ou conclusões incorretas, o modelo não pode ser considerado tendo alcançado bom desempenho de geração. A correção é geralmente o requisito mais básico ao avaliar resultados de geração.
A completude julga principalmente se o modelo respondeu suficientemente à pergunta e se informações importantes que deveriam ter sido incluídas foram omitidas. Algumas respostas, embora não tenham erros óbvios no conteúdo, respondem apenas a uma parte da pergunta e omitem informações-chave. Nesses casos, a resposta do modelo tem um certo grau de correção, mas a completude ainda é insuficiente. A completude não se concentra apenas em se a resposta está correta, mas também em se todo o conteúdo que deveria ter sido respondido foi abordado.
A relevância julga principalmente se o conteúdo gerado pelo modelo gira em torno da pergunta do usuário. Grandes modelos de linguagem às vezes geram grande quantidade de conteúdo que parece razoável, mas não está intimamente relacionado à pergunta. Embora esse conteúdo possa não estar incorreto em si, reduz a eficácia da resposta. Uma resposta com boa relevância deveria abordar diretamente a pergunta do usuário e minimizar conteúdo irrelevante, repetitivo ou excessivamente expandido.
Em aplicações práticas, além do conteúdo da resposta em si, os modelos geralmente precisam produzir resultados em um formato especificado. Por exemplo, exigir que o modelo retorne resultados no formato JSON, ou organize conteúdo de acordo com campos, ordem e estrutura especificados. A conformidade de formato avalia principalmente se o modelo gera conteúdo de acordo com os requisitos de saída dados. Mesmo que o conteúdo da resposta esteja correto, se não for produzido no formato especificado, pode causar que programas subsequentes não consigam analisá-lo e usá-lo corretamente. Para modelos que passaram por fine-tuning de instruções ou têm requisitos de saída fixos, a conformidade de formato também é uma dimensão de avaliação importante.
A alucinação refere-se ao modelo gerar conteúdo que carece de base, que é inconsistente com os fatos ou que é fabricado do nada. Quando o modelo não conhece certas informações, em vez de indicar informações insuficientes, gera um fato que parece razoável, mas que realmente não existe. Este é um problema típico de alucinação.
A alucinação está relacionada à correção, mas concentra-se em aspectos diferentes. A correção concentra-se em se o conteúdo da resposta está correto, enquanto a alucinação concentra-se mais em se o modelo gerou informações sem base confiável. Para cenários como perguntas e respostas sobre conhecimentos que exigem alta confiabilidade fática, é necessário prestar muita atenção à situação de alucinação do modelo.
Tarefas de reconhecimento de voz (ASR) geralmente precisam ser avaliadas a partir de dois aspectos: precisão de reconhecimento e eficiência de processamento. Entre eles, o CER e o WER são usados para medir taxas de erro nos resultados de reconhecimento, enquanto o RTF é usado para medir a velocidade de processamento do modelo.
Antes de introduzir o CER e o WER, expliquemos primeiro vários símbolos comumente usados nos cálculos de taxa de erro de reconhecimento de voz:
Tanto o CER quanto o WER são calculados com base nesses tipos de erros, sendo a principal diferença as unidades estatísticas utilizadas.
O CER (Character Error Rate) mede a diferença entre resultados de reconhecimento de voz e texto padrão usando caracteres como unidades. Sua fórmula de cálculo é:
CER = \frac{S + D + I}{N}
Um CER mais baixo geralmente indica resultados de reconhecimento de voz mais precisos. Para tarefas de reconhecimento de voz em chinês, o CER é uma métrica de avaliação comumente usada.
O WER (Word Error Rate) tem essencialmente o mesmo método de cálculo que o CER:
WER = \frac{S + D + I}{N}
O CER usa caracteres como unidade básica, enquanto o WER usa palavras como unidade básica. É mais comumente usado em tarefas de reconhecimento de voz para idiomas como inglês que usam palavras como unidades linguísticas básicas.
Além de se os resultados de reconhecimento são precisos, modelos de reconhecimento de voz em implantação real também precisam considerar a velocidade de processamento. O RTF (Real-Time Factor) é uma métrica comumente usada para medir a eficiência de processamento do reconhecimento de voz. Sua fórmula de cálculo é:
RTF =
\frac{\text{Tempo de processamento do modelo}}
{\text{Duração do áudio}}
Por exemplo, se um clipe de áudio de 10 segundos leva 5 segundos para ser reconhecido, então:
RTF = \frac{5}{10} = 0.5
Um RTF mais baixo indica velocidade de processamento mais rápida do modelo. Quando o RTF é menor que 1, significa que a velocidade de processamento do modelo é mais rápida que a velocidade de reprodução real do áudio, atendendo às condições básicas para processamento em tempo real.
Além de métricas como CER, WER e RTF, os modelos também podem ser avaliados em diferentes ambientes de teste. Por exemplo, calcular o CER ou WER separadamente sob condições como ruído de fundo, diferentes sotaques, gravação distante e múltiplos falantes. Comparando as taxas de erro em diferentes cenários, a capacidade de reconhecimento e estabilidade do modelo em ambientes complexos podem ser avaliadas mais detalhadamente.
Texto para fala (Text-to-Speech, TTS) tem como objetivo converter texto de entrada em fala natural e clara. Diferente de modelos de geração de texto, modelos TTS não precisam apenas garantir que o conteúdo gerado corresponda ao texto de entrada, mas também concentrar-se na naturalidade da fala, timbre e velocidade de geração. Modelos TTS geralmente são avaliados a partir de aspectos como acurácia de conteúdo, naturalidade da fala, semelhança do falante e desempenho de inferência.
O TTS primeiro precisa garantir que o texto de entrada possa ser lido em voz alta corretamente, evitando problemas de leitura incorreta, leitura omitida ou repetição. Durante a avaliação, modelos ASR podem ser usados para reconhecer novamente a fala gerada pelo TTS como texto, e então comparar os resultados de reconhecimento com o texto de entrada original. As métricas de acurácia do conteúdo são consistentes com as do capítulo ASR anterior, calculando a taxa de erro de caractere (CER) e a taxa de erro de palavra (WER).
Além de ler corretamente o texto, a fala gerada pelo TTS também precisa ter boa naturalidade, como ritmo de fala razoável, pausas naturais, entonação fluida e ausência de uma sensação mecânica perceptível. O Mean Opinion Score (MOS) é geralmente usado. Durante a avaliação, vários testadores ouvem a fala gerada e a pontuam de acordo com certos padrões de pontuação, usando geralmente uma escala de 1 a 5, onde 1 indica qualidade de fala deficiente e 5 indica fala natural e fluida próxima à fala humana.
O MOS final pode ser expresso como:
MOS = \frac{1}{M}\sum_{i=1}^{M}s_i
Onde $M$ representa o número de pessoas participando da pontuação, e $s_i$ representa a pontuação dada pelo $i$-ésimo avaliador.
O MOS pode refletir de forma relativamente intuitiva a experiência auditiva real dos usuários com a fala gerada, mas como depende de escuta manual, seus custos de avaliação são relativamente altos e também apresenta um certo grau de subjetividade.
Para modelos de clonagem de voz, TTS multi-falante ou TTS zero-shot, simplesmente garantir a naturalidade da fala não é suficiente. Também é necessário avaliar se a fala gerada mantém as características de timbre do falante alvo. Um método comum é usar modelos de reconhecimento de falante para extrair embeddings de falante da fala de referência e da fala gerada separadamente, e então calcular a similaridade cosseno entre os dois vetores:
SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}
Onde $\mathbf{e}{ref}$ representa o vetor de falante da fala de referência, e $\mathbf{e}{gen}$ representa o vetor de falante da fala gerada.
Um SIM mais alto indica que a fala gerada está mais próxima do falante de referência em termos de características de timbre. Esta métrica é particularmente adequada para avaliar a eficácia de modelos de clonagem de voz.
Em termos de desempenho de inferência, o TTS é semelhante a modelos de reconhecimento de voz e também pode usar o RTF para medir a eficiência de processamento do modelo. A diferença é que o RTF no reconhecimento de voz geralmente representa a razão entre o tempo de reconhecimento e a duração do áudio de entrada, enquanto no TTS representa a razão entre o tempo de geração de fala e a duração do áudio gerado. Um RTF mais baixo indica maior eficiência de geração de fala do modelo.
A fórmula de cálculo do RTF é:
RTF =
\frac{T_{infer}}{T_{audio}}
Onde $T_{infer}$ representa o tempo de inferência necessário para gerar a fala, e $T_{audio}$ representa a duração do áudio gerado final.
Para modelos TTS em streaming, também é possível focar mais no Time to First Audio, que é o tempo decorrido desde que o modelo recebe uma solicitação de texto até produzir o primeiro segmento de áudio reproduzível. Um Time to First Audio mais baixo significa que os usuários podem ouvir a fala gerada mais rapidamente, portanto esta métrica é particularmente importante para cenários de interação de voz em tempo real.
Para tarefas como texto para imagem, imagem para imagem e edição de imagens, é difícil avaliar completamente os resultados de geração usando apenas uma métrica. Por exemplo, texto para imagem precisa julgar se as imagens geradas correspondem às descrições de texto, edição de imagens também precisa julgar se os resultados gerados preservam os sujeitos principais e a estrutura da imagem original, e ao avaliar o desempenho geral de um modelo de geração de imagens, também é necessário considerar a qualidade e autenticidade das imagens geradas.
Para tarefas de texto para imagem, primeiro é necessário julgar se as imagens geradas correspondem à descrição de texto de entrada. Por exemplo, se o prompt exige gerar sujeitos, cenas ou estilos específicos, as imagens geradas pelo modelo deveriam conter esses elementos tanto quanto possível.
Uma abordagem comum de avaliação é usar modelos de visão-linguagem como CLIP para mapear texto e imagens no mesmo espaço de características, e então calcular o grau de similaridade entre ambos. CLIP foi proposto por Radford et al. em 2021, treinando com dados massivos de "imagem-texto" para permitir que o modelo aprenda a correspondência entre conteúdo de imagem e linguagem natural. A similaridade cosseno entre imagem e texto pode ser expressa como:
Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}
Onde
\mathbf{v}{image}
representa o vetor de características da imagem,
\mathbf{v}{text}
representa o vetor de características do texto. Geralmente, similaridade mais alta indica que a imagem e o texto estão mais próximos em semântica global. Este tipo de método avalia principalmente se a semântica global corresponde e não pode garantir que todos os detalhes no texto sejam gerados com precisão, como julgar se quantidades, posições e detalhes na imagem são precisos.
Para tarefas de imagem para imagem e edição de imagens, geralmente também é fornecida uma imagem original ou imagem de referência. Este tipo de tarefa não precisa apenas julgar se os resultados gerados atendem aos requisitos de texto, mas também focar em se o conteúdo importante da imagem original foi corretamente preservado.
Por exemplo, na edição de imagens de produtos, o fundo, iluminação ou estilo geral podem ser modificados, mas geralmente deseja-se que informações importantes como o sujeito do produto, estrutura de aparência e logo permaneçam consistentes. Nesse caso, a eficácia da edição pode ser avaliando comparando as diferenças entre imagens geradas e imagens de referência.
O SSIM (Structural Similarity Index) é um método clássico de avaliação de qualidade de imagem com referência completa, proposto por Wang et al. em 2004. Ele compara principalmente duas imagens a partir de aspectos como brilho, contraste e estrutura, com foco particular em se as informações estruturais da imagem mudaram.
Além do SSIM, o LPIPS (Learned Perceptual Image Patch Similarity) também pode ser usado para medir diferenças perceptuais entre duas imagens. O LPIPS usa redes neurais profundas para extrair características de imagem, e então julga diferenças perceptuais visuais entre duas imagens com base nas distâncias entre as características. Pesquisas relacionadas mostram que características profundas podem melhor refletir a percepção humana de similaridade de imagens. Embora tanto o SSIM quanto o LPIPS requerem imagens de referência, concentram-se em aspectos diferentes: o SSIM foca mais nas mudanças de estrutura de imagem, enquanto o LPIPS foca mais nas diferenças de percepção visual. Em tarefas práticas, métricas apropriadas podem ser selecionadas com base nos objetivos de edição de imagem.
Para tarefas com imagens de referência como edição de imagens e imagem para imagem, a similaridade entre imagens geradas e imagens de referência pode ser calculada.
As métricas anteriores são usadas principalmente para comparar a relação entre uma imagem gerada e texto ou uma imagem de referência. Se você deseja avaliar o desempenho geral de geração de um modelo de geração de imagens, geralmente é necessária uma análise estatística de um lote de imagens geradas.
O FID (Fréchet Inception Distance) foi proposto por Heusel et al. em 2017, usado principalmente para medir diferenças em distribuições de características entre imagens geradas e imagens reais. FID. O FID primeiro usa modelos de imagem para extrair características de imagens reais e geradas, depois calcula separadamente as distribuições dos dois conjuntos de características e calcula a distância entre as duas distribuições. Sua forma básica é:
FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)
Onde $\mu_r$ e $\Sigma_r$ representam a média e a matriz de covariância das características de imagens reais, e $\mu_g$ e $\Sigma_g$ representam a média e a matriz de covariância das características de imagens geradas. O FID não compara duas imagens específicas, mas as diferenças nas distribuições de características entre dois lotes de imagens. Um FID mais baixo indica que a distribuição de características das imagens geradas está mais próxima daquela das imagens reais, tornando-o adequado para comparar o desempenho geral entre modelos.
Além de avaliar se as imagens correspondem às descrições de texto, também pode ser realizada uma avaliação automática das imagens geradas a partir da perspectiva dos efeitos visuais. A pontuação estética geralmente usa dados contendo avaliações estéticas humanas ou informações de preferência para treinar modelos de avaliação, permitindo que o modelo aprenda as preferências humanas pela qualidade visual das imagens, e então pontue automaticamente as imagens geradas.
Este tipo de método geralmente reflete integralmente características como composição, cor, iluminação, clareza e atração visual geral. Pontuações mais altas geralmente indicam melhor desempenho visual da imagem sob o modelo de avaliação utilizado. A avaliação estética apresenta um certo grau de subjetividade, pois diferentes modelos de pontuação podem ter dados de treinamento e preferências estéticas diferentes. Portanto, a pontuação estética é mais adequada como métrica auxiliar e não pode representar independentemente a qualidade de geração de imagens.
Métricas objetivas podem avaliar resultados de geração a partir de aspectos como consistência texto-imagem, similaridade de imagem e distribuição de características, mas essas métricas não podem refletir completamente os efeitos visuais reais das imagens. Portanto, em tarefas de geração de imagens, geralmente também é necessário combinar avaliação humana para julgar a qualidade das imagens geradas a partir da perspectiva da percepção visual humana e das necessidades reais de uso.
A avaliação humana pode se concentrar nos seguintes aspectos:
Para reduzir diferenças causadas por julgamentos subjetivos individuais, padrões de pontuação unificados podem ser estabelecidos antecipadamente, e múltiplos avaliadores podem realizar avaliações separadamente. A avaliação subjetiva pode descobrir problemas visuais que métricas automatizadas têm dificuldade em refletir. Portanto, na avaliação real de geração de imagens, métricas objetivas e avaliação humana geralmente são usadas juntas para julgar mais integralmente o desempenho de geração do modelo.
Modelos de geração de vídeo precisam gerar conteúdo de vídeo contínuo com base em entradas como texto e imagens. Diferente da geração de imagens, o vídeo não apenas precisa garantir a qualidade de quadros individuais, mas também focar na continuidade entre diferentes quadros, na razoabilidade do movimento e na consistência entre o conteúdo gerado e as condições de entrada. Portanto, modelos de geração de vídeo geralmente precisam ser avaliados integralmente a partir de múltiplos aspectos, incluindo consistência vídeo-texto, qualidade geral do vídeo, consistência temporal, qualidade do movimento e experiência visual subjetiva.
Semelhante a tarefas de texto para imagem, tarefas de texto para vídeo também precisam avaliar a consistência semântica entre o conteúdo gerado e o texto de entrada. A diferença é que o vídeo é composto por quadros de vídeo contínuos, exigindo consideração adicional do grau de correspondência entre o conteúdo total do vídeo e a descrição de texto. O método principal é extrair vários quadros de vídeo de vídeos gerados, usar modelos de visão-linguagem como CLIP para calcular separadamente a similaridade semântica entre cada quadro de vídeo e o texto de entrada, e então calcular a média dos resultados de múltiplos quadros de vídeo (comumente chamado de Frame-average CLIP Score):
$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$
Onde $N$ representa o número de quadros de vídeo participando da avaliação, $\mathbf{v}_{\text{frame}_i}$ representa o vetor de características do $i$-ésimo quadro de vídeo, $\mathbf{v}_{\text{text}}$ representa o vetor de características do texto de entrada, e $\operatorname{Similarity}(\cdot, \cdot)$ usa similaridade cosseno. Pontuações mais altas indicam maior correspondência semântica entre o conteúdo do vídeo e o texto de entrada. Esta métrica foca principalmente na correspondência entre conteúdo estático espacial e texto e não pode refletir completamente a coerência de ações e a lógica temporal física no vídeo, portanto ainda precisa ser combinada com métricas como consistência temporal e qualidade do movimento para medição integral.
A Distância de Fréchet de vídeo (Fréchet Video Distance, FVD) é uma métrica central para medir a qualidade da distribuição de geração em tarefas de geração de vídeo, usada para medir diferenças nas distribuições de características profundas entre conjuntos de vídeos gerados e conjuntos de vídeos reais. Ao calcular a FVD, primeiro são extraídas as características profundas de vídeos reais e gerados, os parâmetros de distribuição gaussiana (vetor médio e matriz de covariância) dos dois conjuntos de características são calculados, e sua distância de Fréchet é calculada: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$
Onde $\mu_r$ e $\Sigma_r$ representam respectivamente o vetor médio e a matriz de covariância das características de vídeos reais, $\mu_g$ e $\Sigma_g$ representam respectivamente o vetor médio e a matriz de covariância das características de vídeos gerados, e $\operatorname{Tr}(\cdot)$ representa o traço de uma matriz. Valores de FVD mais baixos indicam que a distribuição de características dos vídeos gerados está mais próxima daquela dos vídeos reais, indicando melhor desempenho geral do modelo em fidelidade visual, consistência temporal e diversidade de amostras.
A consistência temporal é usada principalmente para avaliar a estabilidade dos vídeos gerados na dimensão temporal. O vídeo é composto por quadros contínuos, exigindo não apenas boa qualidade de imagem para cada quadro, mas também transições suaves de aparência do sujeito, textura do fundo, cor e estilo entre quadros consecutivos. Em cenários de geração de personagens, por exemplo, se características faciais ou texturas de roupas piscam ou deformam frequentemente entre quadros, mesmo que a qualidade individual do quadro seja alta, a experiência de visualização será grandemente prejudicada. Na avaliação real, um método comum é usar redes de extração de características de imagem para obter representações de quadros consecutivos e calcular a similaridade cosseno média entre características de quadros adjacentes. Para um vídeo contendo $N$ quadros de vídeo, sua consistência temporal $TC$ pode ser expressa como:
$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$
Onde $\mathbf{f}_i$ e $\mathbf{f}_{i+1}$ representam respectivamente os vetores de características visuais do $i$-ésimo e $(i+1)$-ésimo quadro, e $N$ é o número total de quadros amostrados. Geralmente, pontuações $TC$ mais altas indicam saltos visuais menores entre quadros adjacentes e quadros mais estáveis. A consistência temporal não é absolutamente melhor quando mais alta: quando o modelo degrada e gera quadros quase completamente estáticos, $TC$ também será anormalmente alta. A consistência temporal deve ser combinada com métricas como Dynamic Degree e amplitude de movimento para julgamento conjunto.
Modelos de geração de vídeo não precisam apenas evitar cintilação de imagem, mas também garantir que as trajetórias de movimento dos sujeitos sejam coerentes e naturais, evitando fenômenos que não são compatíveis com o senso comum como mutações de membros locais e deslocamentos instantâneos. A suavidade do movimento é usada principalmente para medir a regularidade das mudanças na velocidade e aceleração do movimento ao longo do tempo. Nos cálculos específicos, geralmente são usados modelos pré-treinados de estimativa de fluxo óptico (como RAFT) para extrair campos de fluxo óptico densos ou vetores de movimento entre quadros adjacentes. Seja o vetor de movimento (ou fluxo óptico médio) do quadro $t$ ao quadro $t+1$ $\mathbf{v}_t$, o erro de mudança de movimento $E_{\text{motion}}$ pode ser definido através de diferenças em vetores de movimento entre períodos de tempo adjacentes:
$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$
Onde $\mathbf{v}_t$ reflete o estado de movimento na fase $t$. Um $E_{\text{motion}}$ menor indica menos mudanças bruscas na aceleração de movimento e transições de ação mais suaves.
Como é difícil para uma única métrica refletir integralmente as capacidades de modelos de geração de vídeo, agora podem ser usados quadros de avaliação integrais como VBench para avaliação multidimensional de modelos de geração de vídeo. O VBench divide a qualidade de geração de vídeo em múltiplas dimensões de avaliação, como consistência do sujeito, consistência do fundo, suavidade do movimento, Dynamic Degree, qualidade estética e qualidade de imagem. Comparado a métricas únicas como CLIP Score e FVD, a vantagem do VBench reside em sua capacidade de analisar o desempenho de geração de vídeo a partir de múltiplas perspectivas, incluindo qualidade de imagem, estabilidade temporal, desempenho de movimento e consistência de condições, tornando-o mais adequado para comparação de capacidades integrais entre diferentes modelos de geração de vídeo.
As saídas de grandes modelos de linguagem têm forte abertura, e a mesma pergunta frequentemente pode ter múltiplas abordagens de resposta razoáveis. É difícil julgar integralmente se as respostas estão corretas e atendem às necessidades dos usuários confiando apenas em métricas automatizadas. Portanto, ao avaliar grandes modelos de linguagem fine-tunados, a avaliação humana continua sendo um método de avaliação importante. Para conteúdo aberto que é difícil de avaliar com precisão usando métricas automatizadas, podem ser usados métodos de teste cego ou pontuação por múltiplas pessoas. Os avaliadores podem julgar integralmente as saídas do modelo a partir de aspectos como correção, completude, relevância, seguimento de instruções, qualidade de expressão e segurança.
Na avaliação real, padrões de pontuação unificados podem ser estabelecidos antecipadamente, como pontuar diferentes dimensões de avaliação em uma escala de 1 a 5. Para reduzir preconceitos dos avaliadores em relação aos modelos, nomes e versões de modelos podem ser ocultados, permitindo que os avaliadores realizem testes cegos apenas com base no conteúdo das respostas. Se comparando modelos antes e depois do fine-tuning, as respostas de ambos os modelos para a mesma pergunta podem ser exibidas anonimamente, e os avaliadores podem escolher a resposta com melhor desempenho.
Como a avaliação humana apresenta um certo grau de subjetividade, para avaliações importantes também pode ser adotada pontuação por múltiplas pessoas. O mesmo lote de conteúdo é avaliado independentemente por múltiplos avaliadores, e então os resultados de pontuação são resumidos. Quando há grandes diferenças nas pontuações entre diferentes avaliadores, é necessário verificar mais detalhadamente se os critérios de avaliação são claros para melhorar a consistência e confiabilidade dos resultados de avaliação. Embora a avaliação humana requer mais tempo e mão de obra, pode descobrir problemas que métricas automatizadas têm dificuldade em refletir. Ao avaliar a eficácia do fine-tuning de grandes modelos de linguagem, avaliação automatizada e avaliação humana podem ser combinadas para julgar mais integralmente se o modelo foi verdadeiramente melhorado.