AIUnlimited
🌳

Fondations IA

🌱
AI Seeds

Partez de zéro

🌿
AI Sprouts

Construisez les fondations

🌳
AI Branches

Mettez en pratique

🏕️
AI Canopy

Approfondissez

🌲
AI Forest

Maîtrisez l'IA

🔨

Maîtrise IA

✏️
AI Sketch

Partez de zéro

🪨
AI Chisel

Construisez les fondations

⚒️
AI Craft

Mettez en pratique

💎
AI Polish

Approfondissez

🏆
AI Masterpiece

Maîtrisez l'IA

📘

Pratique IA

📖
Comprendre les modèles open-source

Fondamentaux et ressources pour les modèles open-source

🎯
Du problème à la tâche modèles

Transformer les problèmes métier en tâches modèles

⚡
Exécuter votre premier modèle

Voyez vos premiers résultats en 30 minutes

🔧
Fine-tuning et évaluation

Affinez les modèles et évaluez les performances

🚀
Systèmes d'application

Construisez des applications IA réelles

🎨
IA générative

Explorez les modèles AIGC open-source

🤖
Agents

Apprenez les frameworks Agent et outils MCP

📐
Fondamentaux supplémentaires

Bases LLM et évaluation

🎓

Claude Académie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Labo

7 expériences chargées
🧬Bac à sable neuronal🤖IA ou Humain ?🥋Dojo d'ingénierie de prompts🏁Course d'algorithmes🧠Quiz IA🏗️Canevas de conception système
🎯Entretien simuléEntrer dans le labo→
🚀

Développement de carrière

🚀
Rampe de lancement entretien

Commencez votre parcours

🌟
Maîtrise comportementale

Maîtrisez les compétences relationnelles

💻
Entretiens techniques

Réussissez l'épreuve de code

🤖
Entretiens IA et ML

Maîtrisez l'entretien ML

🏆
Offre et au-delà

Décrochez la meilleure offre

Commencer
AIUnlimited

Licence MIT

沪ICP备18025655号-11

Apprendre

  • Bases de l'IA
  • Pratique IA
  • Claude Académie
  • Labo
  • Développement de carrière

Communauté

  • À propos
  • FAQ

Soutien

  • Conditions d'utilisation
  • Politique de confidentialité
  • Contact
Programmes d'IA et d'ingénierie›🔧 Fine-tuning et évaluation›Leçons›Evaluating Fine-Tuned Models
📏
Fine-tuning et évaluation • Débutant⏱️ 25 min de lecture

Evaluating Fine-Tuned Models

Comment savoir si le fine-tuning est efficace ? Testez-le !

Après l'achèvement du fine-tuning du modèle, une évaluation est nécessaire pour déterminer si le modèle a véritablement atteint les résultats attendus. Étant donné que différentes tâches ont des objectifs différents, les méthodes d'évaluation utilisées varieront également.

Par exemple, les tâches de classification se concentrent principalement sur la capacité du modèle à déterminer la catégorie correcte ; les tâches d'extraction d'informations se concentrent sur l'extraction complète et précise des informations requises ; les tâches de génération, en plus de juger si les réponses sont correctes, doivent également se concentrer sur l'intégralité et la pertinence du contenu ; la reconnaissance vocale évalue généralement les résultats par des taux d'erreur ; la génération d'images nécessite une combinaison de métriques automatiques et d'évaluation humaine.

Pour des méthodes de test spécifiques, voir 【Pré-évaluer avant de sélectionner : Utiliser EvalScope pour former le premier rapport pour les modèles open-source】. Ce chapitre vous indiquera quelles métriques d'évaluation sont disponibles pour différentes tâches~

Métriques d'évaluation des tâches de classification

La classification de texte est un type de tâche relativement courant dans le fine-tuning des modèles, comme la reconnaissance d'intention, la classification de sentiment, la classification de pannes et la classification de risques.

Typiquement, les résultats de prédiction peuvent être divisés en quatre cas :

  • TP (True Positive) : Réellement un échantillon positif, et le modèle le prédit comme positif ;
  • TN (True Negative) : Réellement un échantillon négatif, et le modèle le prédit comme négatif ;
  • FP (False Positive) : Réellement un échantillon négatif, mais le modèle le prédit comme positif ;
  • FN (False Negative) : Réellement un échantillon positif, mais le modèle le prédit comme négatif.

Précision (Accuracy)

La précision représente la proportion d'échantillons correctement prédits parmi tous les échantillons :

\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}  

Par exemple, si 1000 points de données sont testés et que le modèle prédit correctement 900, alors la précision est de 90%. La précision peut refléter de manière intuitive les performances globales de classification du modèle. Cependant, lorsque les quantités de données des différentes catégories diffèrent considérablement, se fier uniquement à la précision peut conduire à des jugements erronés. Si parmi 1000 données de classification de sentiment seulement 20 sont négatives, et que le modèle prédit simplement toutes les données comme « positives », la précision peut toujours atteindre 98%, mais en réalité, aucune des 20 données négatives n'a été identifiée. Par conséquent, lorsque la distribution des classes est déséquilibrée, il est généralement nécessaire d'évaluer le modèle en utilisant la Précision, le Rappel et le F1 ensemble.

Précision, Rappel et F1

La Précision représente combien des données prédites comme échantillons positifs appartiennent réellement aux échantillons positifs :

$\mathrm{Precision}=\frac{TP}{TP+FP} $

Le Rappel représente combien des données étiquetées comme échantillons positifs ont été identifiées avec succès par le modèle :

$\mathrm{Recall}=\frac{TP}{TP+FN} $

Le score F1 considère globalement la Précision et le Rappel. Un F1 plus élevé indique généralement que le modèle a atteint un bon équilibre entre la Précision et le Rappel.

F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}

Matrice de confusion

La Précision, le Rappel et le F1 peuvent représenter les performances globales du modèle avec une seule valeur. Cependant, si vous souhaitez savoir quelles catégories le modèle tend à mal classer, vous devez utiliser une matrice de confusion pour une analyse plus approfondie. La matrice de confusion compare les catégories réelles de chaque point de données de test avec les catégories prédites par le modèle, puis compte les résultats de prédiction entre les différentes catégories et les arrange en une matrice.

Par exemple, si l'ensemble de test contient trois catégories : panne réseau, panne matérielle et panne logicielle, les résultats de prédiction du modèle sont les suivants :

Catégorie réelle \ Catégorie préditePanne réseauPanne matériellePanne logicielle
Panne réseau4523
Panne matérielle1472
Panne logicielle6242

Chaque ligne représente la catégorie réelle des données, et chaque colonne représente la catégorie prédite par le modèle. Les nombres sur la diagonale de la matrice représentent le nombre de prédictions correctes ; par exemple, sur 50 données de panne réseau, 45 ont été correctement identifiées. Les nombres hors diagonale représentent les erreurs de prédiction ; par exemple, 6 pannes logicielles ont été incorrectement prédites comme des pannes réseau. À partir de la matrice de confusion, vous pouvez non seulement voir combien de points de données le modèle a correctement prédits, mais aussi découvrir plus en détail quelles catégories sont facilement confondues. Dans les résultats ci-dessus, les pannes logicielles ont été relativement plus fréquemment incorrectement prédites comme des pannes réseau, ce qui indique que la capacité du modèle à distinguer ces deux catégories a encore des améliorations possibles. En analysant ces catégories facilement confondues, vous pouvez découvrir plus en détail les problèmes du modèle et fournir des références pour compléter les données d'entraînement et optimiser le modèle.

Métriques d'évaluation de l'extraction d'informations

Pour des tâches telles que la reconnaissance d'entités nommées, l'extraction de champs et l'extraction d'informations structurées, les métriques d'évaluation couramment utilisées incluent la précision au niveau des champs, la Précision, le Rappel et le F1 au niveau des entités. Différentes métriques se concentrent sur des granularités d'évaluation différentes et peuvent être sélectionnées en fonction des tâches spécifiques.

Précision au niveau des champs

La précision au niveau des champs est principalement utilisée pour mesurer si le modèle extrait correctement les champs spécifiés. Sa méthode de calcul est :

\text{Précision au niveau des champs} =
\frac{\text{Nombre de champs correctement extraits}}
{\text{Nombre total de champs à extraire}}

Pour les tâches contenant plusieurs champs, la précision de différents champs peut être calculée séparément. Par exemple, calculer séparément la précision des noms d'entreprises et des noms de personnes peut analyser plus en détail dans quels champs le modèle a des capacités d'extraction plus faibles. Cependant, cette méthode a des limites : elle ne peut pas déterminer quelles entités le modèle a manquées. Par conséquent, pour les tâches d'extraction d'informations contenant plusieurs entités, la Précision, le Rappel et le F1 au niveau des entités sont nécessaires pour une évaluation plus détaillée.

Précision, Rappel et F1 au niveau des entités

Pour les tâches de reconnaissance d'entités nommées (NER), la Précision, le Rappel et le F1 au niveau des entités sont utilisés pour l'évaluation. Cette section est similaire aux métriques d'évaluation de classification de la section précédente.

Où :

  • TP (True Positive) : Entités correctement identifiées par le modèle ;
  • FP (False Positive) : Le modèle a identifié une entité, mais le résultat d'identification est incorrect ;
  • FN (False Negative) : Une entité existe dans la vérité terrain, mais le modèle ne l'a pas identifiée.

La Précision est utilisée pour mesurer combien des entités identifiées par le modèle sont correctes :

Precision = \frac{TP}{TP + FP}

Le Rappel est utilisé pour mesurer combien des entités dans la vérité terrain ont été identifiées avec succès par le modèle :

Recall = \frac{TP}{TP + FN}

Le F1 considère globalement la Précision et le Rappel :

F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}

Une Précision plus élevée indique que les entités identifiées par le modèle sont généralement plus exactes ; un Rappel plus élevé indique que le modèle a manqué moins d'entités ; le F1 est utilisé pour mesurer globalement les performances dans les deux aspects.

Métriques d'évaluation des tâches de génération

Contrairement aux tâches de classification et d'extraction d'informations, le contenu généré par les grands modèles de langue a généralement une forte ouverture, et les sorties des modèles n'ont généralement pas de réponse standard unique. Ce type de tâche doit généralement être évalué selon plusieurs dimensions, notamment l'exactitude, l'intégralité, la pertinence, le respect du format et les hallucinations.

Exactitude

L'exactitude juge principalement si le contenu généré par le modèle est correct, y compris s'il y a des erreurs dans les faits, les conclusions et les résultats de raisonnement. Pour les modèles fine-tunés, même si le langage de la réponse est fluide et le format est complet, s'il contient des faits ou des conclusions incorrects, le modèle ne peut pas être considéré comme ayant atteint de bonnes performances de génération. L'exactitude est généralement l'exigence la plus fondamentale lors de l'évaluation des résultats de génération.

Intégralité

L'intégralité juge principalement si le modèle a suffisamment répondu à la question et si des informations importantes qui auraient dû être incluses ont été omises. Certaines réponses, bien que n'ayant pas d'erreurs évidentes dans le contenu, ne répondent qu'à une partie de la question et omettent des informations clés. Dans de tels cas, la réponse du modèle a un certain degré d'exactitude, mais l'intégralité est encore insuffisante. L'intégralité ne se concentre pas seulement sur le fait que la réponse est correcte, mais aussi sur le fait que tout le contenu qui aurait dû être répondu a été traité.

Pertinence

La pertinence juge principalement si le contenu généré par le modèle tourne autour de la question de l'utilisateur. Les grands modèles de langue génèrent parfois une grande quantité de contenu qui semble raisonnable mais qui n'est pas étroitement lié à la question. Bien que ce contenu puisse ne pas être incorrect en soi, il réduit l'efficacité de la réponse. Une réponse avec une bonne pertinence devrait répondre directement à la question de l'utilisateur et minimiser le contenu non pertinent, répétitif ou excessivement étendu.

Respect du format

Dans les applications pratiques, en plus du contenu de la réponse elle-même, les modèles doivent généralement sortir les résultats dans un format spécifié. Par exemple, exiger que le modèle retourne les résultats au format JSON, ou organise le contenu selon des champs, un ordre et une structure spécifiés. Le respect du format évalue principalement si le modèle génère du contenu selon les exigences de sortie données. Même si le contenu de la réponse est correct, s'il n'est pas sorti selon le format spécifié, cela peut empêcher les programmes ultérieurs de l'analyser et de l'utiliser correctement. Pour les modèles qui ont subi un fine-tuning d'instruction ou qui ont des exigences de sortie fixes, le respect du format est également une dimension d'évaluation importante.

Hallucination

L'hallucination fait référence à la génération par le modèle de contenu qui manque de base, qui est incohérent avec les faits ou qui est inventé de toutes pièces. Lorsque le modèle ne connaît pas certaines informations, au lieu d'indiquer des informations insuffisantes, il génère un fait qui semble raisonnable mais qui n'existe pas réellement. C'est un problème typique d'hallucination.

L'hallucination est liée à l'exactitude mais se concentre sur des aspects différents. L'exactitude se concentre sur le fait que le contenu de la réponse est correct, tandis que l'hallucination se concentre davantage sur le fait que le modèle a généré des informations sans base fiable. Pour des scénarios tels que les Q&R sur les connaissances qui nécessitent une haute fiabilité factuelle, il est nécessaire de prêter une attention particulière à la situation d'hallucination du modèle.

Métriques de reconnaissance vocale

Les tâches de reconnaissance vocale (ASR) doivent généralement être évaluées selon deux aspects : la précision de reconnaissance et l'efficacité de traitement. Parmi ceux-ci, le CER et le WER sont utilisés pour mesurer les taux d'erreur dans les résultats de reconnaissance, tandis que le RTF est utilisé pour mesurer la vitesse de traitement de la parole par le modèle.

Avant d'introduire le CER et le WER, expliquons d'abord plusieurs symboles couramment utilisés dans les calculs de taux d'erreur de reconnaissance vocale :

  • S (Substitution) : Erreur de substitution, où les caractères ou mots correctement reconnus sont reconnus comme d'autres contenus ;
  • D (Deletion) : Erreur de suppression, où les caractères ou mots qui auraient dû être reconnus sont manqués ;
  • I (Insertion) : Erreur d'insertion, où des caractères ou mots absents du texte sont reconnus en supplément ;
  • N : Nombre total de caractères ou mots dans le texte standard.

Le CER et le WER sont tous deux calculés sur la base de ces types d'erreurs, la différence principale résidant dans les unités statistiques utilisées.

CER : Taux d'erreur de caractère

Le CER (Character Error Rate) mesure la différence entre les résultats de reconnaissance vocale et le texte standard en utilisant les caractères comme unités. Sa formule de calcul est :

CER = \frac{S + D + I}{N}

Un CER plus bas indique généralement des résultats de reconnaissance vocale plus exacts. Pour les tâches de reconnaissance vocale chinoise, le CER est une métrique d'évaluation couramment utilisée.

WER : Taux d'erreur de mot

Le WER (Word Error Rate) a essentiellement la même méthode de calcul que le CER :

WER = \frac{S + D + I}{N}

Le CER utilise les caractères comme unité de base, tandis que le WER utilise les mots comme unité de base. Il est plus couramment utilisé dans les tâches de reconnaissance vocale pour des langues comme l'anglais qui utilisent les mots comme unités linguistiques de base.

RTF : Facteur temps réel

En plus de la précision des résultats de reconnaissance, les modèles de reconnaissance vocale en déploiement réel doivent également prendre en compte la vitesse de traitement. Le RTF (Real-Time Factor) est une métrique couramment utilisée pour mesurer l'efficacité de traitement de la reconnaissance vocale. Sa formule de calcul est :

RTF =
\frac{\text{Temps de traitement du modèle}}
{\text{Durée de la parole}}

Par exemple, si un clip audio de 10 secondes prend 5 secondes à être reconnu, alors :

RTF = \frac{5}{10} = 0.5

Un RTF plus bas indique une vitesse de traitement plus rapide du modèle. Lorsque le RTF est inférieur à 1, cela signifie que la vitesse de traitement du modèle est plus rapide que la vitesse de lecture réelle de la parole, répondant aux conditions de base pour un traitement en temps réel.

En plus de métriques comme le CER, le WER et le RTF, les modèles peuvent également être évalués dans différents environnements de test. Par exemple, calculer le CER ou le WER séparément dans des conditions telles que le bruit de fond, différents accents, l'enregistrement à distance et plusieurs locuteurs. En comparant les taux d'erreur dans différents scénarios, la capacité de reconnaissance et la stabilité du modèle dans des environnements complexes peuvent être évaluées plus en détail.

Métriques d'évaluation de la synthèse vocale

La synthèse vocale (Text-to-Speech, TTS) vise à convertir le texte d'entrée en parole naturelle et claire. Contrairement aux modèles de génération de texte, les modèles TTS doivent non seulement s'assurer que le contenu généré correspond au texte d'entrée, mais aussi se concentrer sur la naturel de la parole, le timbre et la vitesse de génération. Les modèles TTS sont généralement évalués selon des aspects tels que l'exactitude du contenu, la naturel de la parole, la similarité du locuteur et les performances d'inférence.

Exactitude du contenu

Le TTS doit d'abord s'assurer que le texte d'entrée peut être lu à voix haute correctement, en évitant les problèmes de mauvaise lecture, de lecture manquée ou de répétition. Pendant l'évaluation, des modèles ASR peuvent être utilisés pour reconnaître à nouveau la parole générée par le TTS en texte, puis comparer les résultats de reconnaissance avec le texte d'entrée original. Les métriques d'exactitude du contenu sont cohérentes avec celles du chapitre ASR précédent, calculant le taux d'erreur de caractère (CER) et le taux d'erreur de mot (WER).

Naturel de la parole

En plus de lire correctement le texte, la parole générée par le TTS doit également avoir une bonne naturel, comme un débit raisonnable, des pauses naturelles, une intonation fluide et l'absence d'une sensation mécanique noticeable. Le score d'opinion moyen (Mean Opinion Score, MOS) est généralement utilisé. Pendant l'évaluation, plusieurs testeurs écoutent la parole générée et la notent selon certaines normes de notation, utilisant généralement une échelle de 1 à 5, où 1 indique une qualité de parole médiocre et 5 indique une parole naturelle et fluide proche de la parole humaine.

Le MOS final peut être exprimé comme :

MOS = \frac{1}{M}\sum_{i=1}^{M}s_i

Où $M$ représente le nombre de personnes participant au scoring, et $s_i$ représente la note donnée par le $i$ème évaluateur.

Le MOS peut refléter de manière relativement intuitive l'expérience auditive réelle des utilisateurs pour la parole générée, mais puisqu'il repose sur l'écoute manuelle, son coût d'évaluation est relativement élevé et il présente également un certain degré de subjectivité.

Similarité du locuteur

Pour les modèles de clonage vocal, TTS multi-locuteurs ou TTS zero-shot, simplement garantir la naturel de la parole ne suffit pas. Il est également nécessaire d'évaluer si la parole générée maintient les caractéristiques de timbre du locuteur cible. Une méthode courante est d'utiliser des modèles de reconnaissance de locuteur pour extraire les embeddings de locuteur de la parole de référence et de la parole générée séparément, puis de calculer la similarité cosinus entre les deux vecteurs :

SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}

Où $\mathbf{e}{ref}$ représente le vecteur de locuteur de la parole de référence, et $\mathbf{e}{gen}$ représente le vecteur de locuteur de la parole générée.

Un SIM plus élevé indique que la parole générée est plus proche du locuteur de référence en termes de caractéristiques de timbre. Cette métrique est particulièrement adaptée à l'évaluation de l'efficacité des modèles de clonage vocal.

Facteur temps réel

En termes de performances d'inférence, le TTS est similaire aux modèles de reconnaissance vocale et peut également utiliser le RTF pour mesurer l'efficacité de traitement du modèle. La différence est que le RTF dans la reconnaissance vocale représente généralement le rapport entre le temps de reconnaissance et la durée de la parole d'entrée, tandis que dans le TTS, il représente le rapport entre le temps de génération de la parole et la durée de la parole générée. Un RTF plus bas indique une efficacité de génération de parole plus élevée du modèle.

La formule de calcul du RTF est :

RTF =
\frac{T_{infer}}{T_{audio}}

Où $T_{infer}$ représente le temps d'inférence nécessaire pour générer la parole, et $T_{audio}$ représente la durée de la parole générée finale.

Pour les modèles TTS en streaming, il est également possible de se concentrer davantage sur le Time to First Audio, qui est le temps écoulé depuis que le modèle reçoit une requête de texte jusqu'à la sortie du premier segment audio jouable. Un Time to First Audio plus bas signifie que les utilisateurs peuvent entendre la parole générée plus rapidement, donc cette métrique est particulièrement importante pour les scénarios d'interaction vocale en temps réel.

Évaluation objective de la génération d'images

Pour des tâches telles que la génération de texte à image, l'image à image et l'édition d'images, il est difficile d'évaluer complètement les résultats de génération en n'utilisant qu'une seule métrique. Par exemple, la génération de texte à image doit juger si les images générées correspondent aux descriptions textuelles, l'édition d'images doit également juger si les résultats générés préservent les sujets principaux et la structure de l'image originale, et lors de l'évaluation des performances globales d'un modèle de génération d'images, il est également nécessaire de considérer la qualité et l'authenticité des images générées.

Cohérence texte-image

Pour les tâches de génération de texte à image, il faut d'abord juger si les images générées correspondent à la description textuelle d'entrée. Par exemple, si l'invite demande de générer des sujets, des scènes ou des styles spécifiques, les images générées par le modèle devraient contenir ces éléments autant que possible.

Une approche d'évaluation courante est d'utiliser des modèles de vision-language comme CLIP pour mapper le texte et les images dans le même espace de caractéristiques, puis de calculer le degré de similarité entre les deux. CLIP a été proposé par Radford et al. en 2021, s'entraînant sur des données massives « image-texte » pour permettre au modèle d'apprendre la correspondance entre le contenu de l'image et le langage naturel. La similarité cosinus entre l'image et le texte peut être exprimée comme :

Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}

Où

\mathbf{v}{image} 

représente le vecteur de caractéristiques de l'image,

\mathbf{v}{text} 

représente le vecteur de caractéristiques du texte. Généralement, une similarité plus élevée indique que l'image et le texte sont plus proches en termes de sémantique globale. Ce type de méthode évalue principalement si la sémantique globale correspond et ne peut pas garantir que tous les détails du texte sont générés avec exactitude, comme juger si les quantités, les positions et les détails dans l'image sont exacts.

Similarité d'image

Pour les tâches d'image à image et d'édition d'images, une image originale ou une image de référence est généralement également fournie. Ce type de tâche doit non seulement juger si les résultats générés répondent aux exigences textuelles, mais aussi se concentrer sur le fait que le contenu important de l'image originale a été correctement préservé.

Par exemple, dans l'édition d'images de produits, l'arrière-plan, l'éclairage ou le style global peuvent être modifiés, mais on souhaite généralement que les informations importantes telles que le sujet du produit, la structure de l'apparence et le logo restent cohérentes. Dans ce cas, l'efficacité de l'édition peut être évaluée en comparant les différences entre les images générées et les images de référence.

Le SSIM (Structural Similarity Index) est une méthode classique d'évaluation de la qualité d'image à référence complète, proposée par Wang et al. en 2004. Il compare principalement deux images sous des aspects tels que la luminosité, le contraste et la structure, en se concentrant particulièrement sur les changements dans les informations structurelles de l'image.

En plus du SSIM, le LPIPS (Learned Perceptual Image Patch Similarity) peut également être utilisé pour mesurer les différences perceptuelles entre deux images. Le LPIPS utilise des réseaux neuronaux profonds pour extraire les caractéristiques de l'image, puis juge les différences perceptuelles visuelles entre deux images en fonction des distances entre les caractéristiques. Des recherches connexes montrent que les caractéristiques profondes peuvent mieux refléter la perception humaine de la similarité des images. Bien que le SSIM et le LPIPS nécessitent tous deux des images de référence, ils se concentrent sur des aspects différents : le SSIM se concentre davantage sur les changements de structure de l'image, tandis que le LPIPS se concentre davantage sur les différences de perception visuelle. Dans les tâches pratiques, des métriques appropriées peuvent être sélectionnées en fonction des objectifs de l'édition d'images.

Pour les tâches avec des images de référence telles que l'édition d'images et l'image à image, la similarité entre les images générées et les images de référence peut être calculée.

FID

Les métriques précédentes sont principalement utilisées pour comparer la relation entre une image générée et du texte ou une image de référence. Si vous souhaitez évaluer les performances globales de génération d'un modèle de génération d'images, une analyse statistique d'un lot d'images générées est généralement nécessaire.

Le FID (Fréchet Inception Distance) a été proposé par Heusel et al. en 2017, principalement utilisé pour mesurer les différences de distributions de caractéristiques entre les images générées et les images réelles. FID. Le FID utilise d'abord des modèles d'image pour extraire les caractéristiques des images réelles et générées, puis calcule séparément les distributions des deux ensembles de caractéristiques et calcule la distance entre les deux distributions. Sa forme de base est :

FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)

Où $\mu_r$ et $\Sigma_r$ représentent la moyenne et la matrice de covariance des caractéristiques des images réelles, et $\mu_g$ et $\Sigma_g$ représentent la moyenne et la matrice de covariance des caractéristiques des images générées. Le FID ne compare pas deux images spécifiques mais les différences de distributions de caractéristiques entre deux lots d'images. Un FID plus bas indique que la distribution de caractéristiques des images générées est plus proche de celle des images réelles, le rendant adapté à la comparaison des performances globales entre modèles.

Score esthétique

En plus d'évaluer si les images correspondent aux descriptions textuelles, une évaluation automatique des images générées peut également être effectuée du point de vue des effets visuels. Le score esthétique utilise typiquement des données contenant des évaluations esthétiques humaines ou des informations de préférence pour entraîner des modèles d'évaluation, permettant au modèle d'apprendre les préférences humaines pour la qualité visuelle des images, puis de noter automatiquement les images générées.

Ce type de méthode reflète généralement de manière globale des caractéristiques telles que la composition de l'image, la couleur, l'éclairage, la clarté et l'attrait visuel global. Des scores plus élevés indiquent généralement de meilleures performances visuelles de l'image sous le modèle d'évaluation utilisé. L'évaluation esthétique présente un certain degré de subjectivité, car différents modèles de notation peuvent avoir des données d'entraînement et des préférences esthétiques différentes. Par conséquent, le score esthétique est plus adapté comme métrique auxiliaire et ne peut pas représenter indépendamment la qualité de génération d'images.

Évaluation subjective de la génération d'images

Les métriques objectives peuvent évaluer les résultats de génération sous des aspects tels que la cohérence texte-image, la similarité d'image et la distribution de caractéristiques, mais ces métriques ne peuvent pas complètement refléter les effets visuels réels des images. Par conséquent, dans les tâches de génération d'images, il est généralement nécessaire de combiner l'évaluation humaine pour juger la qualité des images générées du point de vue de la perception visuelle humaine et des besoins d'utilisation réels.

L'évaluation humaine peut se concentrer sur les aspects suivants :

  • Cohérence du contenu : Si les images générées correspondent aux descriptions textuelles d'entrées ou aux exigences d'édition ;
  • Qualité visuelle : Si les images sont claires et naturelles, et s'il y a des distorsions, un flou ou des erreurs structurelles évidentes ;
  • Cohérence du sujet : Pour les tâches d'image à image et d'édition d'images, si les sujets principaux tels que les personnes et les produits restent cohérents avec les images de référence ;
  • Qualité des détails : Si les positions sujettes aux erreurs telles que les mains des personnes, le texte, les logos et les bords sont normales ;
  • Utilisabilité pratique : Si les résultats générés peuvent être directement utilisés dans des scénarios d'affaires réels tels que les affiches et l'affichage de produits.

Pour réduire les différences causées par les jugements subjectifs individuels, des normes de notation unifiées peuvent être établies à l'avance, et plusieurs évaluateurs peuvent effectuer des évaluations séparément. L'évaluation subjective peut découvrir des problèmes visuels que les métriques automatisées ont du mal à refléter. Par conséquent, dans l'évaluation réelle de la génération d'images, les métriques objectives et l'évaluation subjective sont généralement utilisées ensemble pour juger plus complètement les performances de génération du modèle.

Évaluation des modèles de génération vidéo

Les modèles de génération vidéo doivent générer un contenu vidéo continu basé sur des entrées telles que le texte et les images. Contrairement à la génération d'images, la vidéo doit non seulement garantir la qualité des images individuelles, mais aussi se concentrer sur la continuité entre les différentes images, la cohérence du mouvement et la cohérence entre le contenu généré et les conditions d'entrée. Par conséquent, les modèles de génération vidéo doivent généralement être évalués de manière globale sous plusieurs aspects, notamment la cohérence texte-vidéo, la qualité vidéo globale, la cohérence temporelle, la qualité du mouvement et l'expérience de visionnage subjective.

Cohérence texte-vidéo

Semblable aux tâches de génération de texte à image, les tâches de génération de texte à vidéo doivent également évaluer la cohérence sémantique entre le contenu généré et le texte d'entrée. La différence est que la vidéo est composée d'images vidéo continues, nécessitant une considération supplémentaire du degré de correspondance entre le contenu vidéo global et la description textuelle. La méthode principale consiste à extraire plusieurs images vidéo des vidéos générées, utiliser des modèles de vision-language comme CLIP pour calculer séparément la similarité sémantique entre chaque image vidéo et le texte d'entrée, puis moyenner les résultats de plusieurs images vidéo (couramment appelé Frame-average CLIP Score) :

$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$

Où $N$ représente le nombre d'images vidéo participant à l'évaluation, $\mathbf{v}_{\text{frame}_i}$ représente le vecteur de caractéristiques de la $i$ème image vidéo, $\mathbf{v}_{\text{text}}$ représente le vecteur de caractéristiques du texte d'entré, et $\operatorname{Similarity}(\cdot, \cdot)$ utilise la similarité cosinus. Des scores plus élevés indiquent une correspondance sémantique plus élevée entre le contenu vidéo et le texte d'entrée. Cette métrique se concentre principalement sur la correspondance entre le contenu statique spatial et le texte et ne peut pas pleinement refléter la cohérence des actions et la logique temporelle physique dans la vidéo, elle doit donc être combinée avec des métriques telles que la cohérence temporelle et la qualité du mouvement pour une mesure globale.

Distance de Fréchet vidéo

La Distance de Fréchet vidéo (Fréchet Video Distance, FVD) est une métrique clé pour mesurer la qualité de la distribution de génération dans les tâches de génération vidéo, utilisée pour mesurer les différences dans les distributions de caractéristiques profondes entre les ensembles de vidéos générées et les ensembles de vidéos réelles. Lors du calcul de la FVD, les caractéristiques profondes des vidéos réelles et générées sont d'abord extraites, les paramètres de distribution gaussienne (vecteur moyen et matrice de covariance) des deux ensembles de caractéristiques sont calculés, et leur distance de Fréchet est calculée : $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$

Où $\mu_r$ et $\Sigma_r$ représentent respectivement le vecteur moyen et la matrice de covariance des caractéristiques des vidéos réelles, $\mu_g$ et $\Sigma_g$ représentent respectivement le vecteur moyen et la matrice de covariance des caractéristiques des vidéos générées, et $\operatorname{Tr}(\cdot)$ représente la trace d'une matrice. Des valeurs de FVD plus basses indiquent que la distribution de caractéristiques des vidéos générées est plus proche de celle des vidéos réelles, indiquant de meilleures performances globales du modèle en termes de fidélité visuelle, de cohérence temporelle et de diversité des échantillons.

Cohérence temporelle

La cohérence temporelle est principalement utilisée pour évaluer la stabilité des vidéos générées dans la dimension temporelle. La vidéo est composée d'images continues, nécessitant non seulement une bonne qualité d'image pour chaque image, mais également des transitions fluides de l'apparence du sujet, de la texture de l'arrière-plan, de la couleur et du style entre les images consécutives. Par exemple, dans les scénarios de génération de personnages, si les caractéristiques faciales ou les textures de vêtements clignotent ou se déforment fréquemment entre les images, même si la qualité des images individuelles est élevée, l'expérience de visionnage sera grandement diminuée. Dans l'évaluation réelle, une méthode courante consiste à utiliser des réseaux d'extraction de caractéristiques d'image pour obtenir les représentations d'images consécutives et à calculer la similarité cosinus moyenne entre les caractéristiques d'images adjacentes. Pour une vidéo contenant $N$ images vidéo, sa cohérence temporelle $TC$ peut être exprimée comme :

$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$

Où $\mathbf{f}_i$ et $\mathbf{f}_{i+1}$ représentent respectivement les vecteurs de caractéristiques visuelles de la $i$ème et de la $(i+1)ème image, et $N$ est le nombre total d'images échantillonnées. Généralement, des scores $TC$ plus élevés indiquent des sauts visuels plus petits entre les images adjacentes et des images plus stables. La cohérence temporelle n'est pas absolument meilleure lorsqu'elle est plus élevée : lorsque le modèle se dégrade et génère des images presque complètement statiques, $TC$ sera également anormalement élevé. La cohérence temporelle doit être combinée avec des métriques telles que le Dynamic Degree et l'amplitude du mouvement pour un jugement conjoint.

Fluidité du mouvement

Les modèles de génération vidéo doivent non seulement éviter le scintillement des images, mais aussi garantir que les trajectoires de mouvement des sujets sont cohérentes et naturelles, en évitant des phénomènes qui ne sont pas conformes au sens commun tels que les mutations de membres locales et les déplacements instantanés. La fluidité du mouvement est principalement utilisée pour mesurer la régularité des changements de vitesse et d'accélération du mouvement dans le temps. Dans les calculs spécifiques, des modèles d'estimation de flux optique pré-entraînés (tels que RAFT) sont généralement utilisés pour extraire les champs de flux optique denses ou les vecteurs de mouvement entre les images adjacentes. Soit le vecteur de mouvement (ou le flux optique moyen) de l'image $t$ à l'image $t+1$ $\mathbf{v}_t$, l'erreur de changement de mouvement $E_{\text{motion}}$ peut être définie à travers les différences de vecteurs de mouvement entre les périodes de temps adjacentes :

$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$

Où $\mathbf{v}_t$ reflète l'état de mouvement au stade $t$. Un $E_{\text{motion}}$ plus petit indique moins de changements brusques d'accélération de mouvement et des transitions d'action plus fluides.

VBench

Étant donné qu'il est difficile pour une métrique unique de refléter de manière globale les capacités des modèles de génération vidéo, des cadres d'évaluation globaux tels que VBench peuvent désormais être utilisés pour une évaluation multidimensionnelle des modèles de génération vidéo. VBench divise la qualité de génération vidéo en plusieurs dimensions d'évaluation, telles que la cohérence du sujet, la cohérence de l'arrière-plan, la fluidité du mouvement, le Dynamic Degree, la qualité esthétique et la qualité d'imagerie. Comparé aux métriques uniques telles que le CLIP Score et la FVD, l'avantage de VBench réside dans sa capacité à analyser les performances de génération vidéo sous de multiples perspectives, notamment la qualité de l'image, la stabilité temporelle, les performances de mouvement et la cohérence des conditions, le rendant plus adapté à la comparaison des capacités globales entre différents modèles de génération vidéo.

Évaluation humaine

Les sorties des grands modèles de langue ont une forte ouverture, et la même question peut souvent avoir plusieurs approches de réponse raisonnables. Il est difficile de juger complètement si les réponses sont correctes et répondent aux besoins des utilisateurs en se basant uniquement sur des métriques automatisées. Par conséquent, lors de l'évaluation des grands modèles de langue fine-tunés, l'évaluation humaine reste une méthode d'évaluation importante. Pour le contenu ouvert qui est difficile à évaluer avec précision en utilisant des métriques automatisées, des méthodes de test aveugle ou de notation par plusieurs personnes peuvent être utilisées. Les évaluateurs peuvent juger de manière globale les sorties du modèle sous des aspects tels que l'exactitude, l'intégralité, la pertinence, le suivi des instructions, la qualité d'expression et la sécurité.

Dans l'évaluation réelle, des normes de notation unifiées peuvent être établies à l'avance, telles que la notation de différentes dimensions d'évaluation sur une échelle de 1 à 5. Pour réduire les préjugés des évaluateurs envers les modèles, les noms et versions des modèles peuvent être cachés, permettant aux évaluateurs de mener des tests aveugles uniquement sur la base du contenu des réponses. Si vous comparez les modèles avant et après le fine-tuning, les réponses des deux modèles à la même question peuvent être affichées de manière anonyme, et les évaluateurs peuvent choisir la réponse avec les meilleures performances.

Puisque l'évaluation humaine présente un certain degré de subjectivité, la notation par plusieurs personnes peut également être adoptée pour des évaluations importantes. Le même lot de contenu est évalué indépendamment par plusieurs évaluateurs, puis les résultats de notation sont résumés. Lorsqu'il y a de grandes différences dans les notes entre différents évaluateurs, il est nécessaire de vérifier plus en détail si les critères d'évaluation sont clairs pour améliorer la cohérence et la fiabilité des résultats d'évaluation. Bien que l'évaluation humaine nécessite plus de temps et de main-d'œuvre, elle peut découvrir des problèmes que les métriques automatisées ont du mal à refléter. Lors de l'évaluation de l'efficacité du fine-tuning des grands modèles de langue, l'évaluation automatisée et l'évaluation humaine peuvent être combinées pour juger plus complètement si le modèle a véritablement été amélioré.

Leçon 4 sur 40% terminé
←Preference Alignment

Discussion

Se connecter pour rejoindre la discussion