Después de completar el fine-tuning del modelo, se necesita una evaluación para determinar si el modelo ha alcanzado verdaderamente los resultados esperados. Dado que diferentes tareas tienen diferentes objetivos, los métodos de evaluación utilizados también variarán.
Por ejemplo, las tareas de clasificación se centran principalmente en si el modelo puede determinar la categoría correcta; las tareas de extracción de información se centran en si la información requerida se extrae de manera completa y precisa; las tareas de generación, además de juzgar si las respuestas son correctas, también deben centrarse en la completitud y relevancia del contenido; el reconocimiento de voz generalmente evalúa los resultados a través de tasas de error; la generación de imágenes requiere una combinación de métricas automáticas y evaluación humana.
Para métodos de prueba específicos, ver 【Pre-evaluar antes de seleccionar: Usar EvalScope para formar el primer reporte para modelos de código abierto】. Este capítulo te dirá qué métricas de evaluación están disponibles para diferentes tareas~
La clasificación de texto es un tipo de tarea relativamente común en el fine-tuning de modelos, como el reconocimiento de intención, la clasificación de sentimiento, la clasificación de fallas y la clasificación de riesgos.
Típicamente, los resultados de predicción se pueden dividir en cuatro casos:
La precisión representa la proporción de muestras predichas correctamente entre todas las muestras:
\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}
Por ejemplo, si se prueban 1000 puntos de datos y el modelo predice correctamente 900, entonces la precisión es del 90%. La precisión puede reflejar de manera intuitiva el rendimiento general de clasificación del modelo. Sin embargo, cuando las cantidades de datos de diferentes categorías difieren significativamente, confiar únicamente en la precisión puede llevar a juicios erróneos. Si entre 1000 datos de clasificación de sentimiento solo 20 son negativos, y el modelo simplemente predice todos los datos como "positivos", la precisión puede alcanzar el 98%, pero en realidad, ninguno de los 20 datos negativos fue identificado. Por lo tanto, cuando la distribución de clases está desequilibrada, generalmente es necesario evaluar el modelo usando Precisión, Recall y F1 juntos.
Iniciar sesión unirse a la discusión
La Precisión representa cuántos de los datos predichos como muestras positivas realmente pertenecen a muestras positivas:
$\mathrm{Precision}=\frac{TP}{TP+FP} $
El Recall representa cuántos de los datos etiquetados como muestras positivas fueron identificados exitosamente por el modelo:
$\mathrm{Recall}=\frac{TP}{TP+FN} $
El puntaje F1 considera integralmente la Precisión y el Recall. Un F1 más alto generalmente indica que el modelo ha alcanzado un buen equilibrio entre Precisión y Recall.
F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}
La Precisión, el Recall y el F1 pueden representar el rendimiento general del modelo con un solo valor. Sin embargo, si deseas saber qué categorías tiende a clasificar mal el modelo, necesitas usar una matriz de confusión para un análisis más profundo. La matriz de confusión compara las categorías reales de cada punto de datos de prueba con las categorías predichas por el modelo, luego cuenta los resultados de predicción entre diferentes categorías y los organiza en una matriz.
Por ejemplo, si el conjunto de prueba contiene tres categorías: falla de red, falla de hardware y falla de software, los resultados de predicción del modelo son los siguientes:
| Categoría real \ Categoría predicha | Falla de red | Falla de hardware | Falla de software |
| Falla de red | 45 | 2 | 3 |
| Falla de hardware | 1 | 47 | 2 |
| Falla de software | 6 | 2 | 42 |
Cada fila representa la categoría real de los datos, y cada columna representa la categoría predicha por el modelo. Los números en la diagonal de la matriz representan la cantidad de predicciones correctas; por ejemplo, de 50 datos de falla de red, 45 fueron identificados correctamente. Los números fuera de la diagonal representan errores de predicción; por ejemplo, 6 fallas de software fueron predichas incorrectamente como fallas de red. A partir de la matriz de confusión, no solo puedes ver cuántos puntos de datos predijo correctamente el modelo, sino también descubrir más a fondo qué categorías se confunden fácilmente. En los resultados anteriores, las fallas de software fueron relativamente más frecuentemente predichas incorrectamente como fallas de red, lo que indica que la capacidad del modelo para distinguir entre estas dos categorías aún tiene espacio de mejora. Al analizar estas categorías que se confunden fácilmente, puedes descubrir más a fondo los problemas del modelo y proporcionar referencias para complementar los datos de entrenamiento y optimizar el modelo.
Para tareas como el reconocimiento de entidades nombradas, la extracción de campos y la extracción de información estructurada, las métricas de evaluación comúnmente utilizadas incluyen la precisión a nivel de campo, la Precisión, el Recall y el F1 a nivel de entidad. Diferentes métricas se centran en diferentes granularidades de evaluación y pueden seleccionarse según tareas específicas.
La precisión a nivel de campo se utiliza principalmente para medir si el modelo extrae correctamente los campos especificados. Su método de cálculo es:
\text{Precisión a nivel de campo} =
\frac{\text{Cantidad de campos extraídos correctamente}}
{\text{Cantidad total de campos a extraer}}
Para tareas que contienen múltiples campos, la precisión de diferentes campos puede calcularse por separado. Por ejemplo, calcular por separado la precisión de nombres de empresas y nombres de personas puede analizar más a fondo en qué campos el modelo tiene capacidades de extracción más débiles. Sin embargo, este método tiene limitaciones: no puede determinar qué entidades perdió el modelo. Por lo tanto, para tareas de extracción de información que contienen múltiples entidades, se necesitan la Precisión, el Recall y el F1 a nivel de entidad para una evaluación más detallada.
Para tareas de reconocimiento de entidades nombradas (NER), se utilizan la Precisión, el Recall y el F1 a nivel de entidad para la evaluación. Esta sección es similar a las métricas de evaluación de clasificación de la sección anterior.
Donde:
La Precisión se utiliza para medir cuántas de las entidades identificadas por el modelo son correctas:
Precision = \frac{TP}{TP + FP}
El Recall se utiliza para medir cuántas de las entidades en la verdad de referencia fueron identificadas exitosamente por el modelo:
Recall = \frac{TP}{TP + FN}
El F1 considera integralmente la Precisión y el Recall:
F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}
Una Precisión más alta indica que las entidades identificadas por el modelo son generalmente más precisas; un Recall más alto indica que el modelo perdió menos entidades; el F1 se utiliza para medir integralmente el rendimiento en ambos aspectos.
A diferencia de las tareas de clasificación y extracción de información, el contenido generado por los grandes modelos de lenguaje generalmente tiene una fuerte apertura, y las salidas de los modelos generalmente no tienen una respuesta estándar única. Este tipo de tarea generalmente debe evaluarse desde múltiples dimensiones, incluyendo exactitud, completitud, relevancia, cumplimiento de formato y alucinaciones.
La exactitud juzga principalmente si el contenido generado por el modelo es correcto, incluyendo si hay errores en hechos, conclusiones y resultados de razonamiento. Para modelos fine-tunados, incluso si el lenguaje de la respuesta es fluido y el formato está completo, si contiene hechos o conclusiones incorrectos, el modelo no puede considerarse haber alcanzado un buen rendimiento de generación. La exactitud es generalmente el requisito más básico al evaluar resultados de generación.
La completitud juzga principalmente si el modelo ha respondido suficientemente la pregunta y si se omitió información importante que debería haberse incluido. Algunas respuestas, aunque no tienen errores obvios en el contenido, solo responden una parte de la pregunta y omiten información clave. En tales casos, la respuesta del modelo tiene un cierto grado de exactitud, pero la completitud aún es insuficiente. La completitud no se centra solo en si la respuesta es correcta, sino también en si todo el contenido que debería haberse respondido ha sido abordado.
La relevancia juzga principalmente si el contenido generado por el modelo gira en torno a la pregunta del usuario. Los grandes modelos de lenguaje a veces generan una gran cantidad de contenido que parece razonable pero que no está estrechamente relacionado con la pregunta. Aunque este contenido puede no ser incorrecto en sí mismo, reduce la efectividad de la respuesta. Una respuesta con buena relevancia debería abordar directamente la pregunta del usuario y minimizar el contenido irrelevante, repetitivo o excesivamente expandido.
En aplicaciones prácticas, además del contenido de la respuesta en sí, los modelos generalmente necesitan producir resultados en un formato especificado. Por ejemplo, exigir que el modelo devuelva resultados en formato JSON, o organizar contenido según campos, orden y estructura especificados. El cumplimiento de formato evalúa principalmente si el modelo genera contenido según los requisitos de salida dados. Incluso si el contenido de la respuesta es correcto, si no se produce según el formato especificado, puede causar que los programas posteriores no puedan analizarlo y usarlo correctamente. Para modelos que han pasado por fine-tuning de instrucciones o tienen requisitos de salida fijos, el cumplimiento de formato también es una dimensión de evaluación importante.
La alucinación se refiere a que el modelo genere contenido que carece de base, que es inconsistente con los hechos o que está fabricado de la nada. Cuando el modelo no conoce cierta información, en lugar de indicar información insuficiente, genera un hecho que parece razonable pero que realmente no existe. Este es un problema típico de alucinación.
La alucinación está relacionada con la exactitud pero se centra en aspectos diferentes. La exactitud se centra en si el contenido de la respuesta es correcto, mientras que la alucinación se centra más en si el modelo ha generado información sin base confiable. Para escenarios como preguntas y respuestas sobre conocimientos que requieren alta fiabilidad fáctica, es necesario prestar mucha atención a la situación de alucinación del modelo.
Las tareas de reconocimiento de voz (ASR) generalmente deben evaluarse desde dos aspectos: precisión de reconocimiento y eficiencia de procesamiento. Entre ellos, el CER y el WER se utilizan para medir las tasas de error en los resultados de reconocimiento, mientras que el RTF se utiliza para medir la velocidad de procesamiento del modelo.
Antes de presentar el CER y el WER, expliquemos primero varios símbolos comúnmente utilizados en los cálculos de tasas de error de reconocimiento de voz:
Tanto el CER como el WER se calculan basándose en estos tipos de errores, siendo la principal diferencia las unidades estadísticas utilizadas.
El CER (Character Error Rate) mide la diferencia entre los resultados de reconocimiento de voz y el texto estándar usando caracteres como unidades. Su fórmula de cálculo es:
CER = \frac{S + D + I}{N}
Un CER más bajo generalmente indica resultados de reconocimiento de voz más precisos. Para tareas de reconocimiento de voz en chino, el CER es una métrica de evaluación comúnmente utilizada.
El WER (Word Error Rate) tiene esencialmente el mismo método de cálculo que el CER:
WER = \frac{S + D + I}{N}
El CER usa caracteres como unidad básica, mientras que el WER usa palabras como unidad básica. Se utiliza más comúnmente en tareas de reconocimiento de voz para idiomas como el inglés que usan palabras como unidades lingüísticas básicas.
Además de si los resultados de reconocimiento son precisos, los modelos de reconocimiento de voz en implementación real también necesitan considerar la velocidad de procesamiento. El RTF (Real-Time Factor) es una métrica comúnmente utilizada para medir la eficiencia de procesamiento del reconocimiento de voz. Su fórmula de cálculo es:
RTF =
\frac{\text{Tiempo de procesamiento del modelo}}
{\text{Duración del audio}}
Por ejemplo, si un clip de audio de 10 segundos toma 5 segundos en reconocerse, entonces:
RTF = \frac{5}{10} = 0.5
Un RTF más bajo indica una velocidad de procesamiento más rápida del modelo. Cuando el RTF es menor que 1, significa que la velocidad de procesamiento del modelo es más rápida que la velocidad de reproducción real del audio, cumpliendo con las condiciones básicas para el procesamiento en tiempo real.
Además de métricas como CER, WER y RTF, los modelos también pueden evaluarse en diferentes entornos de prueba. Por ejemplo, calcular el CER o el WER por separado bajo condiciones como ruido de fondo, diferentes acentos, grabación a distancia y múltiples hablantes. Al comparar las tasas de error en diferentes escenarios, se puede evaluar más a fondo la capacidad de reconocimiento y estabilidad del modelo en entornos complejos.
El texto a voz (Text-to-Speech, TTS) tiene como objetivo convertir el texto de entrada en voz natural y clara. A diferencia de los modelos de generación de texto, los modelos TTS no solo necesitan asegurarse de que el contenido generado coincida con el texto de entrada, sino también centrarse en la naturalidad de la voz, el timbre y la velocidad de generación. Los modelos TTS generalmente se evalúan desde aspectos como la exactitud del contenido, la naturalidad de la voz, la similitud del hablante y el rendimiento de inferencia.
El TTS primero necesita asegurar que el texto de entrada pueda leerse correctamente en voz alta, evitando problemas de lectura incorrecta, lectura omitida o repetición. Durante la evaluación, se pueden usar modelos ASR para volver a reconocer la voz generada por TTS como texto, y luego comparar los resultados de reconocimiento con el texto de entrada original. Las métricas de exactitud del contenido son consistentes con las del capítulo ASR anterior, calculando la tasa de error de caracteres (CER) y la tasa de error de palabras (WER).
Además de leer correctamente el texto, la voz generada por TTS también necesita tener buena naturalidad, como un ritmo de habla razonable, pausas naturales, entonación fluida y ausencia de una sensación mecánica notable. El puntaje de opinión promedio (Mean Opinion Score, MOS) generalmente se utiliza. Durante la evaluación, varios probadores escuchan la voz generada y la califican según ciertos estándares de calificación, usando generalmente una escala de 1 a 5, donde 1 indica calidad de voz deficiente y 5 indica voz natural y fluida cercana a la voz humana.
El MOS final puede expresarse como:
MOS = \frac{1}{M}\sum_{i=1}^{M}s_i
Donde $M$ representa el número de personas que participan en la calificación, y $s_i$ representa la puntuación dada por el $i$-ésimo evaluador.
El MOS puede reflejar de manera relativamente intuitiva la experiencia auditiva real de los usuarios de la voz generada, pero dado que depende de la escucha manual, su costo de evaluación es relativamente alto y también presenta un cierto grado de subjetividad.
Para modelos de clonación de voz, TTS multi-hablante o TTS zero-shot, simplemente garantizar la naturalidad de la voz no es suficiente. También es necesario evaluar si la voz generada mantiene las características de timbre del hablante objetivo. Un método común es usar modelos de reconocimiento de hablante para extraer los embeddings de hablante del audio de referencia y del audio generado por separado, y luego calcular la similitud coseno entre los dos vectores:
SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}
Donde $\mathbf{e}{ref}$ representa el vector de hablante del audio de referencia, y $\mathbf{e}{gen}$ representa el vector de hablante del audio generado.
Un SIM más alto indica que la voz generada está más cercana al hablante de referencia en términos de características de timbre. Esta métrica es particularmente adecuada para evaluar la efectividad de los modelos de clonación de voz.
En términos de rendimiento de inferencia, el TTS es similar a los modelos de reconocimiento de voz y también puede usar el RTF para medir la eficiencia de procesamiento del modelo. La diferencia es que el RTF en el reconocimiento de voz generalmente representa la relación entre el tiempo de reconocimiento y la duración del audio de entrada, mientras que en el TTS representa la relación entre el tiempo de generación de voz y la duración del audio generado. Un RTF más bajo indica una mayor eficiencia de generación de voz del modelo.
La fórmula de cálculo del RTF es:
RTF =
\frac{T_{infer}}{T_{audio}}
Donde $T_{infer}$ representa el tiempo de inferencia necesario para generar la voz, y $T_{audio}$ representa la duración del audio generado final.
Para modelos TTS en streaming, también es posible centrarse más en el Time to First Audio, que es el tiempo transcurrido desde que el modelo recibe una solicitud de texto hasta que produce el primer segmento de audio reproducible. Un Time to First Audio más bajo significa que los usuarios pueden escuchar la voz generada más rápido, por lo que esta métrica es particularmente importante para escenarios de interacción de voz en tiempo real.
Para tareas como texto a imagen, imagen a imagen y edición de imágenes, es difícil evaluar completamente los resultados de generación usando solo una métrica. Por ejemplo, texto a imagen necesita juzgar si las imágenes generadas coinciden con las descripciones de texto, edición de imágenes también necesita juzgar si los resultados generados preservan los sujetos principales y la estructura de la imagen original, y al evaluar el rendimiento general de un modelo de generación de imágenes, también es necesario considerar la calidad y autenticidad de las imágenes generadas.
Para tareas de texto a imagen, primero se necesita juzgar si las imágenes generadas coinciden con la descripción de texto de entrada. Por ejemplo, si el prompt requiere generar sujetos, escenas o estilos específicos, las imágenes generadas por el modelo deberían contener estos elementos tanto como sea posible.
Un enfoque de evaluación común es usar modelos de visión-lenguaje como CLIP para mapear texto e imágenes al mismo espacio de características, y luego calcular el grado de similitud entre ambos. CLIP fue propuesto por Radford et al. en 2021, entrenándose con datos masivos de "imagen-texto" para permitir que el modelo aprenda la correspondencia entre el contenido de la imagen y el lenguaje natural. La similitud coseno entre imagen y texto puede expresarse como:
Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}
Donde
\mathbf{v}{image}
representa el vector de características de la imagen,
\mathbf{v}{text}
representa el vector de características del texto. Generalmente, una mayor similitud indica que la imagen y el texto están más cercanos en semántica global. Este tipo de método evalúa principalmente si la semántica global coincide y no puede garantizar que todos los detalles del texto se generen con precisión, como juzgar si las cantidades, posiciones y detalles en la imagen son precisos.
Para tareas de imagen a imagen y edición de imágenes, generalmente también se proporciona una imagen original o imagen de referencia. Este tipo de tarea no solo necesita juzgar si los resultados generados cumplen con los requisitos de texto, sino también centrarse en si el contenido importante de la imagen original ha sido correctamente preservado.
Por ejemplo, en la edición de imágenes de productos, se puede modificar el fondo, iluminación o estilo general, pero generalmente se desea que la información importante como el sujeto del producto, la estructura de apariencia y el logo permanezcan consistentes. En este caso, la efectividad de la edición puede evaluarse comparando las diferencias entre las imágenes generadas y las imágenes de referencia.
El SSIM (Structural Similarity Index) es un método clásico de evaluación de calidad de imagen de referencia completa, propuesto por Wang et al. en 2004. Compara principalmente dos imágenes desde aspectos como brillo, contraste y estructura, con un enfoque particular en si la información estructural de la imagen ha cambiado.
Además del SSIM, el LPIPS (Learned Perceptual Image Patch Similarity) también puede usarse para medir las diferencias perceptuales entre dos imágenes. El LPIPS usa redes neuronales profundas para extraer características de imagen, y luego juzga las diferencias perceptuales visuales entre dos imágenes basándose en las distancias entre las características. La investigación relacionada muestra que las características profundas pueden mejor reflejar la percepción humana de la similitud de imágenes. Aunque tanto el SSIM como el LPIPS requieren imágenes de referencia, se centran en aspectos diferentes: el SSIM se centra más en los cambios de estructura de imagen, mientras que el LPIPS se centra más en las diferencias de percepción visual. En tareas prácticas, se pueden seleccionar métricas apropiadas basándose en los objetivos de edición de imagen.
Para tareas con imágenes de referencia como edición de imágenes e imagen a imagen, se puede calcular la similitud entre las imágenes generadas y las imágenes de referencia.
Las métricas anteriores se utilizan principalmente para comparar la relación entre una imagen generada y texto o una imagen de referencia. Si deseas evaluar el rendimiento general de generación de un modelo de generación de imágenes, generalmente se necesita un análisis estadístico de un lote de imágenes generadas.
El FID (Fréchet Inception Distance) fue propuesto por Heusel et al. en 2017, utilizado principalmente para medir las diferencias en las distribuciones de características entre imágenes generadas e imágenes reales. FID. El FID primero usa modelos de imagen para extraer características de imágenes reales y generadas, luego calcula por separado las distribuciones de los dos conjuntos de características y calcula la distancia entre las dos distribuciones. Su forma básica es:
FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)
Donde $\mu_r$ y $\Sigma_r$ representan la media y la matriz de covarianza de las características de las imágenes reales, y $\mu_g$ y $\Sigma_g$ representan la media y la matriz de covarianza de las características de las imágenes generadas. El FID no compara dos imágenes específicas sino las diferencias en las distribuciones de características entre dos lotes de imágenes. Un FID más bajo indica que la distribución de características de las imágenes generadas está más cercana a la de las imágenes reales, haciéndolo adecuado para comparar el rendimiento general entre modelos.
Además de evaluar si las imágenes coinciden con las descripciones de texto, también se puede realizar una evaluación automática de las imágenes generadas desde la perspectiva de los efectos visuales. La puntuación estética típicamente usa datos que contienen calificaciones estéticas humanas o información de preferencia para entrenar modelos de evaluación, permitiendo que el modelo aprenda las preferencias humanas por la calidad visual de las imágenes, y luego califique automáticamente las imágenes generadas.
Este tipo de método generalmente refleja integralmente características como composición de imagen, color, iluminación, claridad y atractivo visual general. Puntuaciones más altas generalmente indican un mejor rendimiento visual de la imagen bajo el modelo de evaluación utilizado. La evaluación estética presenta un cierto grado de subjetividad, ya que diferentes modelos de calificación pueden tener datos de entrenamiento y preferencias estéticas diferentes. Por lo tanto, la puntuación estética es más adecuada como métrica auxiliar y no puede representar independientemente la calidad de generación de imágenes.
Las métricas objetivas pueden evaluar los resultados de generación desde aspectos como la consistencia texto-imagen, la similitud de imagen y la distribución de características, pero estas métricas no pueden reflejar completamente los efectos visuales reales de las imágenes. Por lo tanto, en tareas de generación de imágenes, generalmente también es necesario combinar la evaluación humana para juzgar la calidad de las imágenes generadas desde la perspectiva de la percepción visual humana y las necesidades de uso reales.
La evaluación humana puede centrarse en los siguientes aspectos:
Para reducir las diferencias causadas por juicios subjetivos individuales, se pueden establecer estándares de calificación unificados por adelantado, y múltiples evaluadores pueden realizar evaluaciones por separado. La evaluación subjetiva puede descubrir problemas visuales que las métricas automatizadas tienen dificultad para reflejar. Por lo tanto, en la evaluación real de generación de imágenes, las métricas objetivas y la evaluación subjetiva generalmente se usan juntas para juzgar de manera más integral el rendimiento de generación del modelo.
Los modelos de generación de video necesitan generar contenido de video continuo basado en entradas como texto e imágenes. A diferencia de la generación de imágenes, el video no solo necesita garantizar la calidad de fotogramas individuales, sino también centrarse en la continuidad entre diferentes fotogramas, la razonabilidad del movimiento y la consistencia entre el contenido generado y las condiciones de entrada. Por lo tanto, los modelos de generación de video generalmente necesitan evaluarse de manera integral desde múltiples aspectos, incluyendo la consistencia texto-video, calidad general del video, consistencia temporal, calidad del movimiento y experiencia visual subjetiva.
Similar a las tareas de texto a imagen, las tareas de texto a video también necesitan evaluar la consistencia semántica entre el contenido generado y el texto de entrada. La diferencia es que el video está compuesto por fotogramas de video continuos, requiriendo una consideración adicional del grado de coincidencia entre el contenido del video completo y la descripción de texto. El método principal es extraer varios fotogramas de video de los videos generados, usar modelos de visión-lenguaje como CLIP para calcular por separado la similitud semántica entre cada fotograma de video y el texto de entrada, y luego promediar los resultados de múltiples fotogramas de video (comúnmente llamado Frame-average CLIP Score):
$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$
Donde $N$ representa la cantidad de fotogramas de video que participan en la evaluación, $\mathbf{v}_{\text{frame}_i}$ representa el vector de características del $i$-ésimo fotograma de video, $\mathbf{v}_{\text{text}}$ representa el vector de características del texto de entrada, y $\operatorname{Similarity}(\cdot, \cdot)$ usa similitud coseno. Puntuaciones más altas indican una mayor coincidencia semántica entre el contenido del video y el texto de entrada. Esta métrica se centra principalmente en la coincidencia entre el contenido estático espacial y el texto y no puede reflejar completamente la coherencia de acciones y la lógica temporal física en el video, por lo que aún necesita combinarse con métricas como la consistencia temporal y la calidad del movimiento para una medición integral.
La Distancia de Fréchet de video (Fréchet Video Distance, FVD) es una métrica clave para medir la calidad de la distribución de generación en tareas de generación de video, utilizada para medir las diferencias en las distribuciones de características profundas entre conjuntos de videos generados y conjuntos de videos reales. Al calcular la FVD, primero se extraen las características profundas de los videos reales y generados, se calculan los parámetros de distribución gaussiana (vector de media y matriz de covarianza) de los dos conjuntos de características, y se calcula su distancia de Fréchet: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$
Donde $\mu_r$ y $\Sigma_r$ representan respectivamente el vector de media y la matriz de covarianza de las características de videos reales, $\mu_g$ y $\Sigma_g$ representan respectivamente el vector de media y la matriz de covarianza de las características de videos generados, y $\operatorname{Tr}(\cdot)$ representa la traza de una matriz. Valores de FVD más bajos indican que la distribución de características de los videos generados está más cercana a la de los videos reales, indicando un mejor rendimiento general del modelo en fidelidad visual, consistencia temporal y diversidad de muestras.
La consistencia temporal se utiliza principalmente para evaluar la estabilidad de los videos generados en la dimensión temporal. El video está compuesto por fotogramas continuos, requiriendo no solo buena calidad de imagen para cada fotograma, sino también transiciones fluidas de apariencia del sujeto, textura del fondo, color y estilo entre fotogramas consecutivos. Por ejemplo, en escenarios de generación de personajes, si las características faciales o texturas de ropa parpadean o se deforman frecuentemente entre fotogramas, incluso si la calidad de fotogramas individuales es alta, la experiencia de visualización se verá grandemente disminuida. En la evaluación real, un método común es usar redes de extracción de características de imagen para obtener las representaciones de fotogramas consecutivos y calcular la similitud coseno promedio entre las características de fotogramas adyacentes. Para un video que contiene $N$ fotogramas de video, su consistencia temporal $TC$ puede expresarse como:
$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$
Donde $\mathbf{f}_i$ y $\mathbf{f}_{i+1}$ representan respectivamente los vectores de características visuales del $i$-ésimo y $(i+1)-ésimo fotograma, y $N$ es el número total de fotogramas muestreados. Generalmente, puntuaciones $TC$ más altas indican saltos visuales más pequeños entre fotogramas adyacentes y fotogramas más estables. La consistencia temporal no es absolutamente mejor cuando es más alta: cuando el modelo se degrada y genera fotogramas casi completamente estáticos, $TC$ también será anormalmente alta. La consistencia temporal debe combinarse con métricas como el Dynamic Degree y la amplitud del movimiento para un juicio conjunto.
Los modelos de generación de video no solo necesitan evitar el parpadeo de imágenes, sino también garantizar que las trayectorias de movimiento de los sujetos sean coherentes y naturales, evitando fenómenos que no son compatibles con el sentido común como mutaciones de miembros locales y desplazamientos instantáneos. La suavidad del movimiento se utiliza principalmente para medir la regularidad de los cambios en la velocidad y aceleración del movimiento a lo largo del tiempo. En cálculos específicos, generalmente se usan modelos de estimación de flujo óptico preentrenados (como RAFT) para extraer campos de flujo óptico densos o vectores de movimiento entre fotogramas adyacentes. Sea el vector de movimiento (o flujo óptico promedio) del fotograma $t$ al fotograma $t+1$ $\mathbf{v}_t$, el error de cambio de movimiento $E_{\text{motion}}$ puede definirse a través de diferencias en vectores de movimiento entre períodos de tiempo adyacentes:
$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$
Donde $\mathbf{v}_t$ refleja el estado de movimiento en la etapa $t$. Un $E_{\text{motion}}$ más pequeño indica menos cambios bruscos en la aceleración del movimiento y transiciones de acción más fluidas.
Dado que es difícil para una métrica única reflejar de manera integral las capacidades de los modelos de generación de video, ahora se pueden usar marcos de evaluación integrales como VBench para una evaluación multidimensional de los modelos de generación de video. VBench divide la calidad de generación de video en múltiples dimensiones de evaluación, como la consistencia del sujeto, la consistencia del fondo, la suavidad del movimiento, el Dynamic Degree, la calidad estética y la calidad de imagen. Comparado con métricas únicas como el CLIP Score y la FVD, la ventaja de VBench radica en su capacidad para analizar el rendimiento de generación de video desde múltiples perspectivas, incluyendo calidad de imagen, estabilidad temporal, rendimiento de movimiento y consistencia de condiciones, haciéndolo más adecuado para la comparación de capacidades integrales entre diferentes modelos de generación de video.
Las salidas de los grandes modelos de lenguaje tienen una fuerte apertura, y la misma pregunta a menudo puede tener múltiples enfoques de respuesta razonables. Es difícil juzgar completamente si las respuestas son correctas y cumplen con las necesidades de los usuarios confiando únicamente en métricas automatizadas. Por lo tanto, al evaluar grandes modelos de lenguaje fine-tunados, la evaluación humana sigue siendo un método de evaluación importante. Para contenido abierto que es difícil de evaluar con precisión usando métricas automatizadas, se pueden usar métodos de prueba ciega o calificación por múltiples personas. Los evaluadores pueden juzgar integralmente las salidas del modelo desde aspectos como exactitud, completitud, relevancia, seguimiento de instrucciones, calidad de expresión y seguridad.
En la evaluación real, se pueden establecer estándares de calificación unificados por adelantado, como calificar diferentes dimensiones de evaluación en una escala de 1 a 5. Para reducir los prejuicios de los evaluadores hacia los modelos, se pueden ocultar los nombres y versiones de los modelos, permitiendo a los evaluadores realizar pruebas ciegas únicamente basándose en el contenido de las respuestas. Si se comparan modelos antes y después del fine-tuning, las respuestas de ambos modelos a la misma pregunta se pueden mostrar de manera anónima, y los evaluadores pueden elegir la respuesta con mejor rendimiento.
Dado que la evaluación humana presenta un cierto grado de subjetividad, la calificación por múltiples personas también puede adoptarse para evaluaciones importantes. El mismo lote de contenido es evaluado independientemente por múltiples evaluadores, y luego se resumen los resultados de calificación. Cuando hay grandes diferencias en las puntuaciones entre diferentes evaluadores, es necesario verificar más a fondo si los criterios de evaluación son claros para mejorar la consistencia y fiabilidad de los resultados de evaluación. Aunque la evaluación humana requiere más tiempo y mano de obra, puede descubrir problemas que las métricas automatizadas tienen dificultad para reflejar. Al evaluar la efectividad del fine-tuning de grandes modelos de lenguaje, la evaluación automatizada y la evaluación humana pueden combinarse para juzgar de manera más integral si el modelo ha sido verdaderamente mejorado.