Nach Abschluss der Modellfeinabstimmung muss das Modell durch Bewertung überprüft werden, ob es tatsächlich die erwarteten Ergebnisse erzielt hat. Da die Ziele verschiedener Aufgaben unterschiedlich sind, unterscheiden sich auch die verwendeten Bewertungsmethoden.
Zum Beispiel konzentrieren sich Klassifizierungsaufgaben hauptsächlich darauf, ob das Modell die richtige Klasse bestimmen kann; Informationsextraktionsaufgaben konzentrieren sich darauf, ob die benötigten Informationen vollständig und genau extrahiert werden; Generierungsaufgaben erfordern neben der Richtigkeit der Antwort auch die Bewertung der Vollständigkeit und Relevanz des Inhalts; Spracherkennung bewertet die Erkennungsergebnisse normalerweise anhand der Fehlerrate; Bildgenerierung erfordert die Kombination automatischer Metriken und manueller Bewertungen.
Wie genau getestet wird, erfahren Sie in [„Zuerst bewerten, dann auswählen: Erstellen Sie mit EvalScope den ersten Bericht über Open-Source-Modelle"]. In diesem Kapitel stellen wir Ihnen die verschiedenen Bewertungsmetriken für verschiedene Aufgaben vor.
Textklassifizierung ist eine häufige Aufgabe bei der Modellfeinabstimmung, wie z. B. Absichtserkennung, Stimmungsklassifizierung, Fehlerklassifizierung und Risikoklassifizierung.
Die Vorhersageresultate können in vier Fälle unterteilt werden:
Die Genauigkeit gibt den Anteil der korrekt vorhergesagten Beispiele an allen Beispielen an:
\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}
Wenn beispielsweise 1000 Datenpunkte getestet werden und das Modell 900 korrekt vorhersagt, beträgt die Genauigkeit 90 %. Die Genauigkeit kann die gesamte Klassifizierungsleistung des Modells recht direkt widerspiegeln. Wenn jedoch die Datenmengen der verschiedenen Klassen stark unterschiedlich sind, kann allein die Betrachtung der Genauigkeit zu Fehleinschätzungen führen. Wenn von 1000 Stimmungsklassifizierungsdaten nur 20 negative Daten vorhanden sind und das Modell einfach alle Daten als „positiv" vorhersagt, kann die Genauigkeit immer noch 98 % erreichen, obwohl tatsächlich keine der 20 negativen Daten erkannt wurde. Daher ist es bei unausgewogener Klassenverteilung normalerweise notwendig, Precision, Recall und F1 zur Bewertung des Modells zu kombinieren.
Anmelden an der Diskussion teilnehmen
Precision gibt an, wie viele der vom Modell als positiv vorhergesagten Beispiele tatsächlich positiv sind:
$\mathrm{Precision}=\frac{TP}{TP+FP} $
Recall gibt an, wie viele der als positiv markierten Beispiele vom Modell erfolgreich erkannt wurden:
$\mathrm{Recall}=\frac{TP}{TP+FN} $
Der F1-Score berücksichtigt Precision und Recall. Ein hoher F1-Wert deutet normalerweise darauf hin, dass das Modell eine gute Balance zwischen Precision und Recall erreicht hat.
F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}
Accuracy, Precision, Recall und F1 können die Gesamtleistung des Modells mit einem einzigen Wert ausdrücken. Wenn Sie jedoch herausfinden möchten, welche Klassen das Modell oft falsch klassifiziert, müssen wir die Konfusionsmatrix zur weiteren Analyse verwenden. Die Konfusionsmatrix vergleicht die tatsächliche Klasse jedes Testdatenpunkts mit der vom Modell vorhergesagten Klasse, ermittelt die Vorhersagesituation zwischen den verschiedenen Klassen und ordnet die Ergebnisse als Matrix an.
Wenn beispielsweise der Testdatensatz drei Kategorien enthält – Netzwerkfehler, Hardwarefehler und Softwarefehler –, sieht die Statistik der Modellvorhersagen wie folgt aus:
| Tatsächliche Klasse \ Vorhergesagte Klasse | Netzwerkfehler | Hardwarefehler | Softwarefehler |
| Netzwerkfehler | 45 | 2 | 3 |
| Hardwarefehler | 1 | 47 | 2 |
| Softwarefehler | 6 | 2 | 42 |
Jede Zeile repräsentiert die tatsächliche Klasse der Daten, jede Spalte die vom Modell vorhergesagte Klasse. Die Zahlen auf der Diagonale der Matrix geben die Anzahl der korrekten Vorhersagen an. Von 50 Netzwerkfehler-Datenpunkten wurden beispielsweise 45 korrekt erkannt. Die Zahlen außerhalb der Diagonale geben Fehlvorhersagen an. Beispielsweise wurden 6 Softwarefehler fälschlicherweise als Netzwerkfehler vorhergesagt. Aus der Konfusionsmatrix lässt sich nicht nur ermitteln, wie viele Daten das Modell korrekt vorhergesagt hat, sondern auch welche Klassen oft verwechselt werden. In den obigen Ergebnissen wurde der Softwarefehler relativ häufig als Netzwerkfehler vorhergesagt, was darauf hindeutet, dass die Unterscheidungsfähigkeit des Modells für diese beiden Klassen noch verbessert werden kann. Durch die Analyse dieser leicht verwechselbaren Klassen können die Probleme des Modells weiter untersucht und Referenzwerte für die anschließende Ergänzung der Trainingsdaten und die Optimierung des Modells bereitgestellt werden.
Für Aufgaben wie Named-Entity-Recognition, Feldextraktion und strukturierte Informationsextraktion umfassen die gebräuchlichen Bewertungsmetriken die Feldgenauigkeit, Precision, Recall und F1 auf Entitätsebene. Verschiedene Metriken konzentrieren sich auf unterschiedliche Bewertungsgranularitäten und können je nach konkreter Aufgabe ausgewählt werden.
Die Feldgenauigkeit dient hauptsächlich dazu, die korrekte Extraktion des Modells für ein bestimmtes Feld zu messen. Die Berechnung erfolgt wie folgt:
\text{Feldgenauigkeit} =
\frac{\text{Anzahl der korrekt extrahierten Felder}}
{\text{Gesamtanzahl der zu extrahierenden Felder}}
Für Aufgaben mit mehreren Feldern können die Genauigkeiten der einzelnen Felder separat ermittelt werden. Beispielsweise können die Genauigkeiten für Firmennamen und Personennamen separat berechnet werden, um weiter zu analysieren, in welchen Feldern die Extraktionsfähigkeit des Modells schwach ist. Diese Methode hat jedoch den Nachteil, dass nicht bestimmt werden kann, welche Entitäten das Modell nicht extrahiert hat. Für Informationsextraktionsaufgaben mit mehreren Entitäten sind daher weiterhin Precisions-, Recall- und F1-Bewertungen auf Entitätsebene erforderlich.
Für Named-Entity-Recognition (NER)-Aufgaben werden Precision, Recall und F1 auf Entitätsebene bewertet. Dieser Abschnitt ähnelt den Klassifizierungsbewertungsmetriken des vorherigen Abschnitts.
Dabei gilt:
Precision misst, wie viele der vom Modell erkannten Entitäten korrekt sind:
Precision = \frac{TP}{TP + FP}
Recall misst, wie viele der Entitäten in der Referenzantwort vom Modell erfolgreich erkannt wurden:
Recall = \frac{TP}{TP + FN}
F1 berücksichtigt Precision und Recall:
F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}
Eine hohe Precision bedeutet, dass die vom Modell erkannten Entitäten insgesamt ziemlich korrekt sind; ein hoher Recall bedeutet, dass das Modell wenige Entitäten übersieht; F1 misst die Gesamtleistung beider Aspekte.
Im Gegensatz zu Klassifizierungs- und Informationsextraktionsaufgaben haben von großen Sprachmodellen generierte Inhalte normalerweise einen stark offenen Charakter. Die Modellausgaben haben normalerweise keine einzige Standardantwort. Solche Aufgaben müssen normalerweise aus mehreren Dimensionen bewertet werden: Richtigkeit, Vollständigkeit, Relevanz, Formatkonformität und Halluzination.
Die Richtigkeit beurteilt hauptsächlich, ob die vom Modell generierten Inhalte korrekt sind, einschließlich der Fehlerhaftigkeit von Fakten, Schlussfolgerungen und Ergebnissen der Schlussfolgerung. Selbst wenn die Antwort nach einer Modellfeinabstimmung flüssig und vollständig formuliert ist, kann sie nicht als gute Generierungsleistung gelten, wenn sie falsche Fakten oder Schlussfolgerungen enthält. Die Richtigkeit ist normalerweise die grundlegende Anforderung bei der Bewertung von Generierungsergebnissen.
Die Vollständigkeit beurteilt hauptsächlich, ob das Modell die Frage vollständig beantwortet hat und ob wichtige Informationen nicht weggelassen wurden. Einige Antworten sind inhaltlich nicht offensichtlich falsch, beantworten aber nur einen Teil der Frage und lassen wichtige Inhalte aus. In diesem Fall hat die Antwort des Modells eine gewisse Richtigkeit, aber die Vollständigkeit fehlt noch. Die Vollständigkeit betrifft nicht nur die Richtigkeit der Antwort, sondern auch, ob die vorgelegten Fragen vollständig beantwortet wurden.
Die Relevanz beurteilt hauptsächlich, ob die vom Modell generierten Inhalte sich um die Frage des Benutzers drehen. Große Sprachmodelle generieren manchmal große Mengen an Inhalten, die sinnvoll erscheinen, aber nur wenig mit der Frage zusammenhängen. Obwohl diese Inhalte an sich nicht falsch sein mögen, verringern sie die Wirksamkeit der Antwort. Eine relevantere Antwort sollte direkt auf die Frage des Benutzers eingehen und unnötige, sich wiederholende oder übermäßig erweiterte Inhalte minimieren.
In der praktischen Anwendung muss das Modell neben dem eigentlichen Inhalt der Antwort die Ergebnisse normalerweise in einem bestimmten Format ausgeben. Beispielsweise kann das Modell aufgefordert werden, die Ergebnisse im JSON-Format zurückzugeben oder die Inhalte gemäß den vorgegebenen Feldern, Reihenfolgen und Strukturen zu organisieren. Die Formatkonformität bewertet hauptsächlich, ob das Modell gemäß den vorgegebenen Anforderungen an die Ausgabe Inhalte generiert. Selbst wenn der Antwortinhalt korrekt ist, kann eine Ausgabe, die nicht dem vorgegebenen Format entspricht, dazu führen, dass nachfolgende Programme die Daten nicht normal parsen und verwenden können. Für Modelle, die durch Anweisungsfeinabstimmung oder feste Ausgabeanforderungen trainiert wurden, ist die Formatkonformität ebenfalls eine wichtige Bewertungsdimension.
Halluzination bedeutet, dass das Modell Inhalte generiert, die keiner Grundlage entstammen, nicht den Tatsachen entsprechen oder frei erfunden sind. Wenn das Modell eine bestimmte Information nicht kennt, jedoch nicht darauf hinweist, dass die Information unzureichend ist, sondern einen sinnvoll erscheinenden, tatsächlich aber nicht existierenden Fakt generiert, handelt es sich um ein typisches Halluzinationsproblem.
Halluzination und Richtigkeit stehen in einem gewissen Zusammenhang, aber die Schwerpunkte sind unterschiedlich. Die Richtigkeit konzentriert sich darauf, ob die Antwort korrekt ist, während die Halluzination eher darauf, ob das Modell Informationen ohne zuverlässige Grundlage generiert hat. Für Szenen wie Wissensfragen, in denen eine hohe Faktentreue erforderlich ist, muss die Halluzination des Modells besonders berücksichtigt werden.
Bei der Spracherkennung (ASR) muss die Aufgabe normalerweise aus zwei Aspekten bewertet werden: Erkennungsgenauigkeit und Verarbeitungseffizienz. CER und WER dienen zur Messung der Fehlersituation in den Erkennungsergebnissen, während RTF die Geschwindigkeit der Modellverarbeitung von Sprache misst.
Bevor CER und WER vorgestellt werden, hier einige gebräuchliche Symbole bei der Berechnung der Spracherkennungsfehlerrate:
CER und WER basieren auf diesen Fehlertypen, wobei der Hauptunterschied in den verwendeten statistischen Einheiten liegt.
CER (Character Error Rate) misst den Unterschied zwischen Spracherkennungsergebnis und Standardtext in Zeicheneinheiten. Die Berechnungsformel lautet:
CER = \frac{S + D + I}{N}
Je niedriger der CER, desto genauer ist das Spracherkennungsergebnis. Für Spracherkennungsaufgaben in chinesischer Sprache ist CER eine gebräuchliche Bewertungsmetrik.
WER (Word Error Rate) berechnet sich im Grunde genauso wie CER:
WER = \frac{S + D + I}{N}
CER verwendet Zeichen als Basiseinheit, während Wörter als Basiseinheit verwendet werden, was in Spracherkennungsaufgaben für Englisch und andere Sprachen mit Wortebene häufiger eingesetzt wird.
Neben der Genauigkeit des Erkennungsergebnisses muss bei der praktischen Bereitstellung von Spracherkennungsmodellen auch die Verarbeitungsgeschwindigkeit berücksichtigt werden. RTF (Real-Time Factor) ist eine gebräuchliche Metrik zur Messung der Verarbeitungseffizienz der Spracherkennung. Die Berechnungsformel lautet:
RTF =
\frac{\text{Modellverarbeitungszeit}}
{\text{Sprachdauer}}
Wenn beispielsweise eine 10-sekündige Sprachaufnahme 5 Sekunden zur Erkennung benötigt, gilt:
RTF = \frac{5}{10} = 0.5
Je kleiner der RTF, desto schneller das Modell. Wenn RTF kleiner als 1 ist, bedeutet dies, dass die Verarbeitungsgeschwindigkeit des Modells schneller als die tatsächliche Wiedergabegeschwindigkeit der Sprache ist und somit die grundlegenden Voraussetzungen für die Echtzeitverarbeitung erfüllt sind.
Neben CER, WER und RTF können Modelle auch unter verschiedenen Testumgebungen bewertet werden. Beispielsweise können CER oder WER unter Bedingungen wie Hintergrundgeräusche, verschiedene Akzente, Fernaufnahmen und Mehrsprecher-Aufnahmen separat berechnet werden. Durch den Vergleich der Fehlerraten in verschiedenen Szenarien können die Erkennungsfähigkeit und Stabilität des Modells in komplexen Umgebungen weiter bewertet werden.
Das Ziel von Text-to-Speech (TTS) ist die Umwandlung von Eingabetext in natürliches, klares Sprachsignal. Im Gegensatz zu Textgenerierungsmodellen muss ein TTS-Modell nicht nur die Übereinstimmung des generierten Inhalts mit dem Eingabetext gewährleisten, sondern auch die Natürlichkeit der Stimme, den Klang und die Generierungsgeschwindigkeit berücksichtigen. TTS-Modelle werden normalerweise nach inhaltlicher Genauigkeit, Sprachnatur, Sprechersimilarität und Inferenzleistung bewertet.
TTS muss zunächst sicherstellen, dass der eingegebene Text korrekt vorgelesen wird und Fehler wie Fehllesungen, Auslassungen oder Wiederholungen vermieden werden. Bei der Bewertung kann ein ASR-Modell verwendet werden, um die von TTS generierte Sprache erneut in Text umzuwandeln und das Erkennungsergebnis mit dem ursprünglichen Eingabetext zu vergleichen. Die Metriken für die inhaltliche Richtigkeit stimmen mit den Metriken im vorherigen Kapitel ASR überein, wobei CER (Zeichenfehlerrate) und WER (Wortfehlerrate) berechnet werden.
Neben der korrekten Vorlesung des Textes muss die von TTS generierte Sprache eine gute Natürlichkeit aufweisen, z. B. angemessene Sprechgeschwindigkeit, natürliche Pausen, flüssige Intonation und keine offensichtliche mechanische Klangfarbe. Normalerweise wird der Mean Opinion Score (MOS) verwendet. Bei der Bewertung hören mehrere Tester die generierte Sprache an und bewerten sie nach einem bestimmten Bewertungsstandard. Üblicherweise wird eine Skala von 1 bis 5 verwendet, wobei 1 eine schlechte Sprachqualität und 5 eine natürliche, flüssige Sprache bedeutet, die nahe an menschlicher Sprache liegt.
Der endgültige MOS kann ausgedrückt werden als:
MOS = \frac{1}{M}\sum_{i=1}^{M}s_i
wobei $M$ die Anzahl der Bewertungsteilnehmer und $s_i$ die Bewertung des $i$-ten Testers darstellt.
MOS kann die tatsächliche Hörwahrnehmung des Benutzers für die generierte Sprache relativ direkt widerspiegeln. Aufgrund der Abhängigkeit von manueller Anhörung sind die Bewertungskosten jedoch hoch und die Bewertung hat einen gewissen subjektiven Charakter.
Bei Sprachklon-, Mehrsprecher-TTS- oder Zero-Shot-TTS-Modellen reicht es nicht aus, nur die Natürlichkeit der Stimme zu gewährleisten. Es muss auch bewertet werden, ob die generierte Stimme die Klangmerkmale des Zielsprechers beibehält. Eine gängige Methode besteht darin, ein Spracherkennungsmodell zu verwenden, um die Speaker Embeddings von Referenzstimme und generierter Stimme extrahieren zu lassen und dann die Kosinusähnlichkeit zwischen den beiden Vektoren zu berechnen:
SIM =
\frac{
\mathbf{e}_{ref} \cdot \mathbf{e}_{gen}
}{
|\mathbf{e}_{ref}| |\mathbf{e}_{gen}|
}
wobei $\mathbf{e}_{ref}$ den Sprechervektor der Referenzstimme und $\mathbf{e}_{gen}$ den Sprechervektor der generierten Stimme darstellt.
Je höher der SIM, desto ähnlicher ist die generierte Stimme der Referenzstimme in ihren Klangmerkmalen. Diese Metrik eignet sich besonders für die Bewertung von Sprachklonmodellen.
In Bezug auf die Inferenzleistung können TTS-Modelle ähnlich wie Spracherkennungsmodelle den Echtzeitfaktor (RTF) zur Messung der Verarbeitungseffizienz verwenden. Der Unterschied besteht darin, dass der RTF bei der Spracherkennung normalerweise das Verhältnis zwischen Erkennungsdauer und Eingabesprachdauer angibt, während er bei TTS das Verhältnis zwischen Sprachgenerierungsdauer und generierter Sprachdauer angibt. Je niedriger der RTF, desto höher die Sprachgenerierungseffizienz des Modells.
Die Berechnungsformel für RTF lautet:
RTF =
\frac{T_{infer}}{T_{audio}}
wobei $T_{infer}$ die Inferenzzeit für die Sprachgenerierung und $T_{audio}$ die Dauer der generierten Sprache darstellt.
Für Streaming-TTS-Modelle kann auch die Paketverzögerung beim ersten Audio (Time to First Audio) berücksichtigt werden, also die Zeitspanne vom Empfangen der Textanfrage durch das Modell bis zur Ausgabe des ersten abspielbaren Audios. Je niedriger die Paketverzögerung beim ersten Audio, desto schneller kann der Benutzer die generierte Sprache hören. Diese Metrik ist daher besonders wichtig für Echtzeit-Sprachinteraktionsszenarien.
Für Aufgaben wie Text-zu-Bild, Bild-zu-Bild und Bildbearbeitung ist es schwierig, die Generierungsqualität anhand einer einzigen Metrik umfassend zu bewerten. Beispielsweise muss bei Text-zu-Bild beurteilt werden, ob das generierte Bild der Textbeschreibung entspricht. Bei der Bildbearbeitung muss zusätzlich beurteilt werden, ob das Ergebnis die Hauptobjekte und Strukturen des Originalbilds beibehält. Bei der Bewertung der Gesamtleistung eines Bildgenerierungsmodells müssen auch die Qualität und Realität der generierten Bilder berücksichtigt werden.
Bei Text-zu-Bild-Aufgaben muss zunächst beurteilt werden, ob das generierte Bild der eingegebenen Textbeschreibung entspricht. Wenn der Prompt beispielsweise ein bestimmtes Objekt, eine bestimmte Szene oder einen bestimmten Stil erfordert, sollte das vom Modell generierte Bild diese Inhalte nach Möglichkeit enthalten.
Eine gängige Bewertungsmethode besteht darin, visuelle Sprachmodelle wie CLIP zu verwenden, um Text und Bild in denselben Merkmalsraum abzubilden und dann den Ähnlichkeitsgrad zwischen beiden zu berechnen. CLIP wurde von Radford et al. 2021 vorgeschlagen und durch groß angelegte „Bild-Text"-Daten trainiert, sodass das Modell die Korrespondenz zwischen Bildinhalten und natürlicher Sprache erlernen kann. Die Kosinusähnlichkeit zwischen Bild und Text kann ausgedrückt werden als:
Similarity =
\frac{\mathbf{v}_{image}\cdot\mathbf{v}_{text}}
{|\mathbf{v}_{image}||\mathbf{v}_{text}|}
wobei
\mathbf{v}_{image}
den Merkmalsvektor des Bilds und
\mathbf{v}_{text}
den Merkmalsvektor des Texts darstellt. Normalerweise bedeutet eine höhere Ähnlichkeit, dass Bild und Text in ihrer Gesamtsemantik näher beieinander liegen. Diese Methoden bewerten hauptsächlich, ob die Gesamtsemantik übereinstimmt, können jedoch nicht garantieren, dass alle Details des Texts korrekt generiert wurden. Beispielsweise ob die Anzahl, Position und Details im Bild korrekt sind.
Für Bild-zu-Bild- und Bildbearbeitungsaufgaben wird normalerweise ein Originalbild oder Referenzbild bereitgestellt. Solche Aufgaben erfordern nicht nur die Beurteilung, ob das Ergebnis den Textanforderungen entspricht, sondern auch, ob wichtige Inhalte des Originalbilds korrekt beibehalten wurden.
Bei der Bearbeitung von Produktfotos können beispielsweise der Hintergrund, die Beleuchtung oder der Gesamtstil geändert werden, wobei jedoch gewünscht ist, dass Produktgestalt, äußere Struktur und Logo übereinstimmen. In diesem Fall kann die Bearbeitungsleistung durch Vergleich der Unterschiede zwischen dem generierten Bild und dem Referenzbild bewertet werden.
SSIM (Structural Similarity Index) ist eine klassische bildbasierte Bildqualitätsbewertungsmethode, die von Wang et al. 2004 vorgeschlagen wurde. Sie vergleicht zwei Bilder hauptsächlich nach Helligkeit, Kontrast und Struktur und konzentriert sich besonders darauf, ob sich die Bildstrukturinformationen verändert haben.
Neben SSIM kann auch LPIPS (Learned Perceptual Image Patch Similarity) zur Messung des wahrgenommenen Unterschieds zwischen zwei Bildern verwendet werden. LPIPS extrahiert Bildmerkmale mithilfe eines tiefen neuronalen Netzwerks und beurteilt dann den visuell wahrnehmbaren Unterschied zwischen zwei Bildern anhand des Abstands zwischen den Merkmalen. Verwandte Studien zeigen, dass tiefe Merkmale das menschliche Empfinden für Bildähnlichkeit gut widerspiegeln können. Obwohl SSIM und LPIPS beide Referenzbilder benötigen, unterscheiden sich ihre Schwerpunkte: SSIM konzentriert sich mehr auf Veränderungen der Bildstruktur, während LPIPS sich stärker auf Unterschiede auf der visuellen Wahrnehmungsebene konzentriert. In der Praxis können je nach Ziel der Bildbearbeitung die geeigneten Metriken ausgewählt werden.
Für Bildbearbeitungs- und Bild-zu-Bild-Aufgaben mit Referenzbildern kann der Ähnlichkeitsgrad zwischen dem generierten Bild und dem Referenzbild berechnet werden.
Die vorherigen Metriken dienen hauptsächlich zum Vergleich einer generierten Bild mit einem Text oder Referenzbild. Wenn die Gesamtleistung eines Bildgenerierungsmodells bewertet werden soll, ist normalerweise eine statistische Analyse einer Reihe von generierten Bildern erforderlich.
FID (Fréchet Inception Distance) wurde von Heusel et al. 2017 vorgeschlagen und dient hauptsächlich zur Messung der Unterschiede in der Merkmalsverteilung zwischen generierten und realen Bildern (FID). FID extrahiert zunächst die Merkmale der realen und generierten Bilder mithilfe eines Bildmodells, ermittelt dann die Verteilungen der beiden Merkmalsgruppen und berechnet den Abstand zwischen den beiden Verteilungen. Die Grundform lautet:
FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)
wobei $\mu_r$ und $\Sigma_r$ den Mittelwert und die Kovarianzmatrix der Merkmale der realen Bilder und $\mu_g$ und $\Sigma_g$ den Mittelwert und die Kovarianzmatrix der Merkmale der generierten Bilder darstellen. FID vergleicht nicht zwei konkrete Bilder, sondern die Unterschiede in der Merkmalsverteilung zweier Bildgruppen. Je niedriger der FID, desto ähnlicher sind die Merkmalsverteilungen der generierten und realen Bilder, was ihn für den Vergleich der Gesamtleistung zwischen Modellen besonders geeignet macht.
Neben der Bewertung, ob das Bild der Textbeschreibung entspricht, können generierte Bilder auch aus Sicht der visuellen Wirkung automatisch bewertet werden. Die ästhetische Bewertung (Aesthetic Score) verwendet normalerweise Daten mit menschlichen Ästhetikbewertungen oder Präferenzinformationen, um das Bewertungsmodell zu trainieren. Das Modell lernt die visuelle Qualitätspräferenz der Menschen für Bilder und bewertet dann die generierten Bilder automatisch.
Diese Methoden spiegeln normalerweise die Komposition, Farbe, Beleuchtung, Schärfe und die visuelle Gesamtattraktivität des Bildes wider. Ein höherer Wert bedeutet in der Regel, dass das Bild unter dem verwendeten Bewertungsmodell eine bessere visuelle Leistung aufweist. Die ästhetische Bewertung hat einen gewissen subjektiven Charakter, da die Trainingsdaten und ästhetischen Präferenzen der verschiedenen Bewertungsmodelle unterschiedlich sein können. Daher eignet sich die ästhetische Bewertung besser als Hilfsmetrik und kann nicht allein die Qualität der Bildgenerierung repräsentieren.
Objektive Metriken können die Generierungsergebnisse aus den Bereichen Bild-Text-Konsistenz, Bildähnlichkeit und Merkmalsverteilung bewerten. Diese Metriken können jedoch die tatsächliche visuelle Wirkung des Bildes nicht vollständig widerspiegeln. Daher ist es bei Bildgenerierungsaufgaben normalerweise erforderlich, die objektiven Metriken mit manuellen Bewertungen zu kombinieren, um die Qualität der generierten Bilder anhand der menschlichen visuellen Wahrnehmung und der tatsächlichen Anwendungsanforderungen zu beurteilen.
Manuelle Bewertungen können sich auf die folgenden Aspekte konzentrieren:
Um die Unterschiede durch individuelle subjektive Urteile zu minimieren, können im Voraus einheitliche Bewertungsstandards festgelegt und von mehreren Testern separat bewertet werden. Subjektive Bewertungen können visuelle Probleme aufdecken, die durch automatische Metriken schwer zu erfassen sind. Daher ist es in der praktischen Bildgenerierungsbewertung normalerweise erforderlich, objektive Metriken und subjektive Bewertungen zu kombinieren, um die Generierungsleistung des Modells umfassend zu beurteilen.
Videogenerierungsmodelle müssen auf Basis von Text, Bildern und anderen Eingaben zusammenhängende Videoinhalte generieren. Im Vergleich zur Bildgenerierung muss ein Video nicht nur die Qualität einzelner Frames gewährleisten, sondern auch die Kontinuität zwischen den Frames, die Plausibilität der Bewegung und die Übereinstimmung zwischen dem generierten Inhalt und den Eingabebedingungen berücksichtigen. Daher müssen Videogenerierungsmodelle normalerweise aus mehreren Aspekten umfassend bewertet werden: Text-Video-Konsistenz, Gesamtvideoqualität, zeitliche Konsistenz, Bewegungsqualität und subjektive Betrachtung.
Ähnlich wie bei Text-zu-Bild-Aufgaben muss auch bei Text-zu-Video-Aufgaben die semantische Übereinstimmung zwischen dem generierten Inhalt und dem eingegebenen Text bewertet werden. Der Unterschied besteht darin, dass Video aus zusammenhängenden Frames besteht und die Übereinstimmung des gesamten Videoinhalts mit der Textbeschreibung berücksichtigt werden muss. Die Hauptmethode besteht darin, mehrere Videoframes aus dem generierten Video zu extrahieren, visuelle Sprachmodelle wie CLIP zu verwenden, um die semantische Ähnlichkeit zwischen jedem Frame und dem Eingabetext zu berechnen und dann die Ergebnisse mehrerer Frames zu mitteln (häufig als Frame-average CLIP Score bezeichnet):
$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$
wobei $N$ die Anzahl der bewerteten Videoframes, $\mathbf{v}_{\text{frame}_i}$ den Merkmalsvektor des $i$-ten Frames und $\mathbf{v}_{\text{text}}$ den Merkmalsvektor des Eingabetexts darstellt. $\operatorname{Similarity}(\cdot, \cdot)$ verwendet die Kosinusähnlichkeit; je höher der Wert, desto höher die semantische Übereinstimmung zwischen dem Videobildinhalt und dem Eingabetext. Diese Metrik konzentriert sich hauptsächlich auf die Übereinstimmung zwischen statischem räumlichem Inhalt und Text und kann die Handlungskontinuität und physikalische Zeitlogik im Video nicht vollständig widerspiegeln. Daher muss sie weiterhin mit Metriken wie zeitlicher Konsistenz und Bewegungsqualität kombiniert werden.
Fréchet Video Distance (FVD) ist eine Kernmetrik in Videogenerierungsaufgaben zur Messung der Qualität der generierten Verteilung und dient zur Bewertung der Unterschiede in der Merkmalsverteilung zwischen der Menge der generierten und der Menge der realen Videos. Bei der Berechnung von FVD werden zunächst die tiefen Merkmale der realen und generierten Videos extrahiert, die Parameter der Gaussverteilung (Mittelwert und Kovarianzmatrix) der beiden Merkmalsgruppen statistisch ermittelt und dann die Fréchet-Distanz berechnet: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$
wobei $\mu_r$ und $\Sigma_r$ den Mittelwertvektor und die Kovarianzmatrix der Merkmale der realen Videos und $\mu_g$ und $\Sigma_g$ den Mittelwertvektor und die Kovarianzmatrix der Merkmale der generierten Videos darstellen. $\operatorname{Tr}(\cdot)$ stellt die Spur der Matrix dar. Je niedriger der FVD-Wert, desto ähnlicher ist die Merkmalsverteilung der generierten Videos der der realen Videos, was darauf hindeutet, dass das Modell in den Bereichen visuelle Treue, zeitliche Plausibilität und Stichprobenvariabilität eine bessere Gesamtleistung erbringt.
Die zeitliche Konsistenz (Temporal Consistency) dient hauptsächlich zur Bewertung der Stabilität des generierten Videos in der Zeitdimension. Video besteht aus zusammenhängenden Frames, die nicht nur eine gute Bildqualität aufweisen müssen, sondern auch ein gleichmäßiges Übergang von Hauptobjektaussehen, Hintergrundtextur, Farbe und Stil zwischen den Frames erfordern. Wenn beispielsweise in Personengenerierungsszenen Gesichtszüge oder Kleidungstexturen zwischen den Frames häufig flackern oder sich verformen, ist die visuelle Wirkung selbst bei einer hohen Einzelbildqualität stark beeinträchtigt. In der praktischen Bewertung wird häufig eine Bildmerkmalextraktion verwendet, um die Repräsentationen aufeinanderfolgender Frames zu erfassen, und der Mittelwert der Kosinusähnlichkeit der Merkmale aufeinanderfolgender Frames berechnet. Für ein Video mit $N$ Frames kann die zeitliche Konsistenz $TC$ ausgedrückt werden als:
$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$
wobei $\mathbf{f}_i$ und $\mathbf{f}_{i+1}$ die visuellen Merkmalsvektoren des $i$-ten und des $i+1$-ten Frames darstellen und $N$ die Gesamtzahl der abgetasteten Frames ist. Normalerweise bedeutet ein höherer $TC$-Wert, dass die visuellen Sprünge zwischen benachbarten Frames geringer und das Bild stabiler ist. Die zeitliche Konsistenz ist nicht absolut: Wenn das Modell degeneriert und fast vollständig statische Bilder generiert, ist auch $TC$ anomal hoch. Die zeitliche Konsistenz muss daher zusammen mit Metriken wie dem dynamischen Grad (Dynamic Degree) und der Bewegungsamplitude beurteilt werden.
Videogenerierungsmodelle müssen nicht nur Bildflackern vermeiden, sondern auch sicherstellen, dass die Bewegungsbahnen der Hauptobjekte zusammenhängend und natürlich sind und Phänomene wie lokale Extremitätenveränderungen oder Momentverschiebungen vermieden werden, die den physikalischen Gesetzen widersprechen. Die Bewegungsglättung (Motion Smoothness) dient hauptsächlich zur Messung der Stabilität der Änderungen von Bewegungsgeschwindigkeit und -beschleunigung in der Zeitsequenz. Bei der Berechnung wird normalerweise ein vortrainiertes optisches Fluss-Schätzmodell (wie RAFT) verwendet, um dichte optische Flussfelder oder Bewegungsvektoren zwischen aufeinanderfolgenden Frames zu extrahieren. Wenn der Bewegungsvektor (oder der mittlere optische Fluss) vom Frame $t$ bis zum Frame $t+1$ als $\mathbf{v}_t$ bezeichnet wird, kann der Bewegungsänderungsfehler $E_{\text{motion}}$ durch den Unterschied der Bewegungsvektoren benachbarter Zeiträume definiert werden:
$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$
wobei $\mathbf{v}_t$ den Bewegungszustand der $t$-ten Phase widerspiegelt. Je kleiner $E_{\text{motion}}$, desto weniger plötzliche Änderungen der Bewegungsbeschleunigung und desto sanfter und flüssiger der Aktionsübergang.
Da eine einzelne Metrik die Fähigkeiten eines Videogenerierungsmodells nur schwer umfassend widerspiegelt, können derzeit auch umfassende Bewertungsrahmen wie VBench zur mehrdimensionalen Bewertung von Videogenerierungsmodellen verwendet werden. VBench unterteilt die Videogenerierungsqualität in mehrere Bewertungsdimensionen, wie z. B. Objektkonsistenz (Subject Consistency), Hintergrundkonsistenz (Background Consistency), Bewegungsglättung (Motion Smoothness), dynamischer Grad (Dynamic Degree), ästhetische Qualität (Aesthetic Quality) und Bildqualität (Imaging Quality). Im Vergleich zu einzelnen Metriken wie CLIP-Score und FVD liegt der Vorteil von VBench darin, dass es die Videoqualität aus verschiedenen Perspektiven analysieren kann, einschließlich Bildqualität, zeitliche Stabilität, Bewegungsleistung und Bedingungskonsistenz, was ihn besonders für den Vergleich der Gesamtleistung verschiedener Videogenerierungsmodelle geeignet macht.
Die Ausgaben großer Sprachmodelle haben einen stark offenen Charakter, und für dieselbe Frage gibt es normalerweise mehrere vernünftige Antwortmöglichkeiten. Allein anhand automatischer Metriken ist es schwierig, vollständig zu beurteilen, ob die Antwort korrekt ist und den Anforderungen des Benutzers entspricht. Daher ist die manuelle Bewertung bei der Bewertung von feinabgestimmten großen Sprachmodellen immer noch eine wichtige Bewertungsmethode. Für offene Inhalte, die durch automatische Metriken nur schwer genau bewertet werden können, können Blindtests oder Mehrpersonen-Bewertungen durchgeführt werden. Die Tester können die Modellausgaben anhand von Richtigkeit, Vollständigkeit, Relevanz, Anweisungsbefolgung, Ausdrucksqualität und Sicherheit umfassend beurteilen.
Bei der praktischen Bewertung können im Voraus einheitliche Bewertungsstandards festgelegt werden, z. B. eine Bewertungsskala von 1 bis 5 für verschiedene Bewertungsdimensionen. Um die Voreingenommenheit der Tester gegenüber dem Modell zu minimieren, können Modellname und Version ausgeblendet werden, sodass die Tester die Blindbewertung nur anhand des Antwortinhalts durchführen. Wenn vor und nach der Feinabstimmung vergleichende Modelle bewertet werden sollen, können die Antworten beider Modelle auf dieselbe Frage anonym präsentiert und die Tester können die bessere Antwort auswählen.
Da die manuelle Bewertung einen gewissen subjektiven Charakter hat, können für wichtige Bewertungen auch Mehrpersonen-Bewertungen durchgeführt werden. Dieselben Inhalte werden von mehreren Testern unabhängig bewertet und die Bewertungsergebnisse werden zusammengefasst. Wenn die Bewertungsunterschiede zwischen den Testern groß sind, müssen die Bewertungsstandards weiter überprüft werden, um die Konsistenz und Zuverlässigkeit der Bewertungsergebnisse zu verbessern. Obwohl die manuelle Bewertung mehr Zeit und Personal erfordert, können Probleme aufgedeckt werden, die durch automatische Metriken schwer zu erfassen sind. Bei der Bewertung der Feinabstimmung großer Sprachmodelle können automatische und manuelle Bewertungen kombiniert werden, um umfassend zu beurteilen, ob das Modell tatsächlich verbessert wurde.