AIUnlimited
🌳

AI-Fundamenten

🌱
AI Seeds

Begin bij nul

🌿
AI Sprouts

Bouw een fundament

🌳
AI Branches

Pas toe in de praktijk

🏕️
AI Canopy

Ga de diepte in

🌲
AI Forest

Beheers AI

🔨

AI-Meesterschap

✏️
AI Sketch

Begin bij nul

🪨
AI Chisel

Bouw een fundament

⚒️
AI Craft

Pas toe in de praktijk

💎
AI Polish

Ga de diepte in

🏆
AI Masterpiece

Beheers AI

📘

AI Praktijk

📖
Open-source modellen begrijpen

Fundamenten en bronnen voor open-source modellen

🎯
Van probleem naar modeltaak

Bedrijfsproblemen omzetten in modeltaken

⚡
Uw eerste model uitvoeren

Zie uw eerste resultaten in 30 minuten

🔧
Fijntuning en evaluatie

Modellen fijntunen en prestaties evalueren

🚀
Applicatiesystemen

Bouw echte AI-toepassingen

🎨
Generatieve AI

Verken open-source AIGC-modellen

🤖
Agents

Leer Agent-frameworks en MCP-tools

📐
Aanvullende fundamenten

LLM-basis en evaluatie

🎓

Claude Academie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Lab

7 experimenten geladen
🧬Neuraal Netwerk Sandbox🤖AI of Mens?🥋Prompt Engineering Dojo🏁Algoritme-race🧠AI-triviant🏗️Systeemontwerp Canvas
🎯Proef-sollicitatieGa naar het lab→
🚀

Carrièreontwikkeling

🚀
Interview Startplatform

Start je reis

🌟
Gedragsinterview Meesterschap

Beheers soft skills

💻
Technische Interviews

Slaag voor de codeerronde

🤖
AI- & ML-interviews

ML-interview meesterschap

🏆
Aanbod & verder

Bemachtig het beste aanbod

Begin met leren
AIUnlimited

MIT-licentie.

沪ICP备18025655号-11

Leren

  • AI-basis
  • AI Praktijk
  • Claude Academie
  • Lab
  • Carrièreontwikkeling

Community

  • Over ons
  • FAQ

Ondersteuning

  • footer.terms
  • footer.privacy
  • footer.contact
AI & Engineering Opleidingen›🔧 Fijntuning en evaluatie›Lessen›Evaluating Fine-Tuned Models
📏
Fijntuning en evaluatie • Beginner⏱️ 25 min leestijd

Evaluating Fine-Tuned Models

Hoe weet je of fine-tuning werkt? Test het!

Na het voltooien van het fine-tuning van het model is een beoordeling nodig om te bepalen of het model daadwerkelijk de verwachte resultaten heeft bereikt. Aangezien verschillende taken verschillende doelen hebben, zullen de gebruikte beoordelingsmethoden ook variëren.

Bijvoorbeeld, classificatietaken concentreren zich voornamelijk op of het model de juiste categorie kan bepalen; informatie-extractietaken concentreren zich op of de vereiste informatie volledig en nauwkeurig wordt geëxtraheerd; generatietaken moeten naast het beoordelen of antwoorden correct zijn, ook de volledigheid en relevantie van de inhoud beoordelen; spraakherkenning beoordeelt resultaten doorgaans via foutpercentages; beeldgeneratie vereist een combinatie van automatische metrieken en menselijke beoordeling.

Voor specifieke testmethoden, zie 【Vooraf beoordelen voordat je selecteert: Gebruik EvalScope om het eerste rapport voor open-source modellen te maken】. Dit hoofdstuk zal je vertellen welke beoordelingsmetrieken beschikbaar zijn voor verschillende taken~

Beoordelingsmetrieken voor classificatietaken

Tekstclassificatie is een relatief veelvoorkomend type taak bij het fine-tuning van modellen, zoals intentieherkenning, sentimentclassificatie, foutclassificatie en risicoclassificatie.

Doorgaans kunnen voorspellingsresultaten in vier gevallen worden verdeeld:

  • TP (True Positive): Werkelijk een positief monster, en het model voorspelt het als positief;
  • TN (True Negative): Werkelijk een negatief monster, en het model voorspelt het als negatief;
  • FP (False Positive): Werkelijk een negatief monster, maar het model voorspelt het als positief;
  • FN (False Negative): Werkelijk een positief monster, maar het model voorspelt het als negatief.

Nauwkeurigheid (Accuracy)

De nauwkeurigheid geeft het aandeel van de juist voorspelde monsters onder alle monsters weer:

\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}  

Als bijvoorbeeld 1000 gegevenspunten worden getest en het model voorspelt er 900 correct, dan is de Accuracy 90%. Accuracy kan de algehele classificatieprestatie van het model intuïtief weerspiegelen. Wanneer de datavolumes van verschillende categorieën echter significant verschillen, kan alleen op Accuracy vertrouwen tot verkeerde oordelen leiden. Als er onder 1000 sentimentclassificatiegegevenspunten maar 20 negatief zijn, en het model voorspelt eenvoudigweg alle gegevens als "positief", kan de Accuracy nog steeds 98% bereiken, maar in werkelijkheid werd geen van de 20 negatieve gegevenspunten geïdentificeerd. Daarom is het bij een onevenwichtige klassenverdeling doorgaans nodig om het model te beoordelen met Precision, Recall en F1 samen.

Precision, Recall en F1

De Precision geeft aan hoeveel van de als positief voorspelde gegevens daadwerkelijk tot positieve monsters behoren:

Les 4 van 40% voltooid
←Preference Alignment

Discussie

Inloggen deelnemen aan de discussie

$\mathrm{Precision}=\frac{TP}{TP+FP} $

De Recall geeft aan hoeveel van de als positief gelabelde gegevens succesvol door het model zijn geïdentificeerd:

$\mathrm{Recall}=\frac{TP}{TP+FN} $

De F1 Score houdt integraliter rekening met Precision en Recall. Een hogere F1 geeft doorgaans aan dat het model een goed evenwicht heeft bereikt tussen Precision en Recall.

F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}

Verwarringsmatrix

Precision, Recall en F1 kunnen de algehele prestatie van het model met één enkele waarde weergeven. Als je echter wilt weten welke categorieën het model de neiging heeft om verkeerd te classificeren, moet je een verwarringsmatrix gebruiken voor verdere analyse. De verwarringsmatrix vergelijkt de ware categorieën van elk testgegevenspunt met de voorspelde categorieën van het model, telt dan de voorspellingsresultaten tussen verschillende categorieën en rangschikt ze in een matrix.

Als de testset bijvoorbeeld drie categorieën bevat: netwerkfout, hardwarefout en softwarefout, zijn de voorspellingsresultaten van het model als volgt:

Ware categorie \ Voorspelde categorieNetwerkfoutHardwarefoutSoftwarefout
Netwerkfout4523
Hardwarefout1472
Softwarefout6242

Elke rij vertegenwoordigt de ware categorie van de gegevens, en elke kolom vertegenwoordigt de voorspelde categorie van het model. De getallen op de matrixdiagonaal vertegenwoordigen het aantal juiste voorspellingen; van de 50 netwerkfoutgegevenspunten werden er bijvoorbeeld 45 correct geïdentificeerd. Getallen buiten de diagonaal vertegenwoordigen voorspellingsfouten; bijvoorbeeld werden 6 softwarefouten verkeerd voorspeld als netwerkfouten. Uit de verwarringsmatrix kun je niet alleen zien hoeveel gegevenspunten het model correct heeft voorspeld, maar ook verder ontdekken welke categorieën gemakkelijk worden verward. In de bovenstaande resultaten werden softwarefouten relatief vaker verkeerd voorspeld als netwerkfouten, wat aangeeft dat het vermogen van het model om deze twee categorieën te onderscheiden nog ruimte voor verbetering heeft. Door deze gemakkelijk te verwarren categorieën te analyseren, kun je verdere problemen met het model ontdekken en referenties bieden voor het aanvullen van trainingsgegevens en het optimaliseren van het model.

Beoordelingsmetrieken voor informatie-extractie

Voor taken zoals named entity recognition, veldextractie en gestructureerde informatie-extractie omvatten de veelgebruikte beoordelingsmetrieken veldnauwkeurigheid, entity-level Precision, Recall en F1. Verschillende metrieken concentreren zich op verschillende beoordelingsgranulariteiten en kunnen worden geselecteerd op basis van specifieke taken.

Veldnauwkeurigheid

De veldnauwkeurigheid wordt voornamelijk gebruikt om te meten of het model de opgegeven velden correct extraheert. De berekeningsmethode is:

\text{Veldnauwkeurigheid} =
\frac{\text{Aantal correct geëxtraheerde velden}}
{\text{Totaal aantal te extraheren velden}}

Voor taken met meerdere velden kan de nauwkeurigheid van verschillende velden apart worden berekend. Bijvoorbeeld, de nauwkeurigheid van bedrijfsnamen en persoonsnamen apart berekenen kan verder analyseren in welke velden het model zwakkere extractievermogens heeft. Deze methode heeft echter beperkingen: het kan niet bepalen welke entities het model heeft gemist. Daarom zijn voor informatie-extractietaken met meerdere entities entity-level Precision, Recall en F1 nodig voor een gedetailleerdere beoordeling.

Entity-level Precision, Recall en F1

Voor named entity recognition (NER)-taken worden entity-level Precision, Recall en F1 gebruikt voor beoordeling. Deze sectie is vergelijkbaar met de classificatiebeoordelingsmetriken in de vorige sectie.

Waar:

  • TP (True Positive): Entities correct geïdentificeerd door het model;
  • FP (False Positive): Het model heeft een entity geïdentificeerd, maar het identificatieresultaat is onjuist;
  • FN (False Negative): Er bestaat een entity in de waarheid, maar het model heeft deze niet geïdentificeerd.

De Precision wordt gebruikt om te meten hoeveel van de door het model geïdentificeerde entities correct zijn:

Precision = \frac{TP}{TP + FP}

De Recall wordt gebruikt om te meten hoeveel van de entities in de waarheid succesvol door het model zijn geïdentificeerd:

Recall = \frac{TP}{TP + FN}

F1 houdt integraliter rekening met Precision en Recall:

F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}

Hogere Precision geeft aan dat de door het model geïdentificeerde entities over het algemeen nauwkeuriger zijn; hogere Recall geeft aan dat het model minder entities heeft gemist; F1 wordt gebruikt om de prestaties in beide aspecten integraal te meten.

Beoordelingsmetrieken voor generatietaken

In tegenstelling tot classificatie- en informatie-extractietaken heeft de inhoud die door grote taalmodellen wordt gegenereerd doorgaans een sterke openheid, en hebben modeloutputs doorgaans geen uniek standaardantwoord. Dit type taak moet doorgaans worden beoordeeld vanuit meerdere dimensies, waaronder correctheid, volledigheid, relevantie, formaatnaleving en hallucinaties.

Correctheid

De correctheid beoordeelt voornamelijk of de door het model gegenereerde inhoud correct is, inclusief of er fouten zijn in feiten, conclusies en redeneringsresultaten. Voor fijntuned modellen kan het model niet als goede generatieprestatie worden beschouwd, zelfs als de antwoordtaal vloeiend is en het formaat compleet, als het onjuiste feiten of conclusies bevat. Correctheid is doorgaans de meest fundamentele vereiste bij het beoordelen van generatieresultaten.

Volledigheid

De volledigheid beoordeelt voornamelijk of het model de vraag voldoende heeft beantwoord en of belangrijke informatie die zou moeten worden opgenomen, is weggelaten. Sommige antwoorden bevatten hoewel geen duidelijke fouten in de inhoud, beantwoorden slechts een deel van de vraag en laten belangrijke informatie weg. In dergelijke gevallen heeft het antwoord van het model een zekere mate van correctheid, maar de volledigheid is nog steeds onvoldoende. De volledigheid richt zich niet alleen op of het antwoord correct is, maar ook op of alle inhoud die zou moeten worden beantwoord, daadwerkelijk is beantwoord.

Relevantie

De relevantie beoordeelt voornamelijk of de door het model gegenereerde inhoud draait om de vraag van de gebruiker. Grote taalmodellen genereren soms een grote hoeveelheid inhoud die redelijk lijkt, maar niet nauw met de vraag verbonden is. Hoewel deze inhoud op zich niet onjuist mag zijn, vermindert het de effectiviteit van het antwoord. Een antwoord met goede relevantie zou rechtstreeks op de vraag van de gebruiker moeten ingaan en irrelevante, herhaalde of overmatig uitgebreide inhoud minimaliseren.

Formaatnaleving

In praktische toepassingen moeten modellen naast de antwoordinhoud zelf de resultaten doorgaans in een opgegeven formaat produceren. Bijvoorbeeld, het model verlangen om resultaten in JSON-formaat terug te geven, of inhoud te organiseren volgens opgegeven velden, volgorde en structuur. De formaatnaleving beoordeelt voornamelijk of het model inhoud genereert volgens de opgegeven outputvereisten. Zelfs als de antwoordinhoud correct is, als het niet in het opgegeven formaat wordt geproduceerd, kan dit ertoe leiden dat opvolgende programma's het niet correct kunnen analyseren en gebruiken. Voor modellen die instructiefijntuning hebben ondergaan of vaste outputvereisten hebben, is formaatnaleving ook een belangrijke beoordelingsdimensie.

Hallucinatie

Hallucinatie verwijst naar het genereren van inhoud door het model die gebrek aan basis heeft, inconsistent is met feiten, of uit het niets is gefabriceerd. Wanneer het model bepaalde informatie niet kent, genereert het in plaats van aan te geven dat de informatie onvoldoende is, een feit dat redelijk lijkt maar eigenlijk niet bestaat. Dit is een typisch hallucinatieprobleem.

Hallucinatie heeft betrekking op correctheid maar richt zich op verschillende aspecten. Correctheid richt zich op of de antwoordinhoud correct is, terwijl hallucinatie zich meer richt op of het model informatie zonder betrouwbare basis heeft gegenereerd. Voor scenario's zoals kennisvragen en -antwoorden die een hoge feitelijke betrouwbaarheid vereisen, is het noodzakelijk om aandacht te besteden aan de hallucinatiesituatie van het model.

Spraakherkenningmetriken

Spraakherkenning (ASR)-taken moeten doorgaans vanuit twee aspecten worden beoordeeld: herkenningsnauwkeurigheid en verwerkingsefficiëntie. Daarbij worden CER en WER gebruikt om foutpercentages in herkenningsresultaten te meten, terwijl RTF wordt gebruikt om de snelheid van spraakverwerking door het model te meten.

Voordat CER en WER worden geïntroduceerd, leggen we eerst enkele veelgebruikte symbolen uit in de foutpercentageberekeningen van spraakherkenning:

  • S (Substitutie): Substitutiefout, waarbij correct herkende tekens of woorden worden herkend als andere inhoud;
  • D (Deletie): Verwijderingsfout, waarbij tekens of woorden die hadden moeten worden herkend, worden weggelaten;
  • I (Insertie): Invoegingsfout, waarbij tekens of woorden die niet in de tekst aanwezig zijn, extra worden herkend;
  • N: Totaal aantal tekens of woorden in de standaardtekst.

Zowel CER als WER worden berekend op basis van deze foutsoorten, waarbij het belangrijkste verschil de gebruikte statistische eenheden is.

CER: Tekensfoutpercentage

CER (Character Error Rate) meet het verschil tussen spraakherkenningsresultaten en standaardtekst met tekens als eenheden. De formule is:

CER = \frac{S + D + I}{N}

Een lagere CER geeft doorgaans nauwkeurigere spraakherkenningsresultaten aan. Voor Chinese spraakherkenningstaken is CER een veelgebruikte beoordelingsmetrik.

WER: Woordenfoutpercentage

WER (Word Error Rate) heeft in wezen dezelfde berekeningsmethode als CER:

WER = \frac{S + D + I}{N}

CER gebruikt tekens als basiseenheid, terwijl WER woorden als basiseenheid gebruikt. Het wordt vaker gebruikt bij spraakherkenningstaken voor talen zoals Engels die woorden als basistalheden gebruiken.

RTF: Real-time factor

Naast de nauwkeurigheid van de herkenningsresultaten moeten spraakherkenningsmodellen bij daadwerkelijke implementatie ook de verwerkingssnelheid overwegen. RTF (Real-Time Factor) is een veelgebruikte metrik om de spraakherkenningsverwerkingsefficiëntie te meten. De berekeningsformule is:

RTF =
\frac{\text{Modelverwerkingstijd}}
{\text{Spraakduur}}

Als bijvoorbeeld een audioclip van 10 seconden 5 seconden nodig heeft om te worden herkend, dan:

RTF = \frac{5}{10} = 0.5

Een lagere RTF geeft een snellere modelverwerkingssnelheid aan. Wanneer RTF kleiner dan 1 is, betekent dit dat de verwerkingssnelheid van het model sneller is dan de werkelijke afspeelsnelheid van de spraak, wat voldoet aan de basisvoorwaarden voor real-time verwerking.

Naast metrieken zoals CER, WER en RTF kunnen modellen ook worden beoordeeld in verschillende testomgevingen. Bijvoorbeeld, CER of WER apart berekenen onder omstandigheden zoals achtergrondgeluid, verschillende accenten, opname op afstand en meerdere sprekers. Door de foutpercentages in verschillende scenario's te vergelijken, kunnen het herkenningsvermogen en de stabiliteit van het model in complexe omgevingen verder worden beoordeeld.

Beoordelingsmetrieken voor tekst-naar-spraak

Tekst-naar-spraak (Text-to-Speech, TTS) heeft als doel om invoertekst om te zetten in natuurlijke, heldere spraak. In tegenstelling tot tekstgeneratiemodellen moeten TTS-modellen niet alleen garanderen dat de gegenereerde inhoud overeenkomt met de invoertekst, maar ook de natuurlijkheid van de spraak, de toon en de generaatsnelheid beoordelen. TTS-modellen worden doorgaans beoordeeld vanuit aspecten zoals inhoudsnauwkeurigheid, spraaknaturaliteit, sprekerovereenkomst en inferentieprestaties.

Inhoudsnauwkeurigheid

TTS moet eerst garanderen dat de invoertekst correct hardop kan worden gelezen, waarbij problemen zoals verkeerd lezen, weggelaten lezen of herhaling worden vermeden. Tijdens de beoordeling kunnen ASR-modellen worden gebruikt om de door TTS gegenereerde spraak opnieuw als tekst te herkennen, en dan de herkenningsresultaten te vergelijken met de originele invoertekst. De metrieken voor inhoudsnauwkeurigheid zijn consistent met die in het vorige ASR-hoofdstuk, waarbij het tekensfoutpercentage (CER) en het woordenfoutpercentage (WER) worden berekend.

Spraaknaturaliteit

Naast het correct lezen van de tekst moet de door TTS gegenereerde spraak ook een goede naturaliteit hebben, zoals een redelijk spreektempo, natuurlijke pauzes, vloeiende intonatie en afwezigheid van een opvallend mechanisch gevoel. De Mean Opinion Score (MOS) wordt doorgaans gebruikt. Tijdens de beoordeling luisteren meerdere testers naar de gegenereerde spraak en beoordelen deze volgens bepaalde beoordelingsnormen, waarbij doorgaans een schaal van 1 tot 5 wordt gebruikt, waarbij 1 duidt op slechte spraakkwaliteit en 5 op natuurlijke, vloeiende spraak dicht bij menselijke spraak.

De uiteindelijke MOS kan worden uitgedrukt als:

MOS = \frac{1}{M}\sum_{i=1}^{M}s_i

Waar $M$ het aantal personen dat deelneemt aan de beoordeling vertegenwoordigt, en $s_i$ de score vertegenwoordigt die door de $i$-de beoordelaar is gegeven.

MOS kan het werkelijke luisterervaring van gebruikers met de gegenereerde spraak relatief intuïtief weerspiegelen, maar omdat het afhankelijk is van handmatig luisteren, zijn de beoordelingskosten relatief hoog en heeft het ook een zekere mate van subjectiviteit.

Sprekerovereenkomst

Voor spraakklonende, multi-spreker TTS- of zero-shot TTS-modellen is het niet voldoende om alleen de naturaliteit van de spraak te garanderen. Het moet ook worden beoordeeld of de gegenereerde spraak de toonkenmerken van de doelspreker behoudt. Een veelgebruikte methode is om spraakherkenningsmodellen te gebruiken om Speaker Embeddings apart te extraheren uit referentiespraak en gegenereerde spraak, en dan de cosinusgelijkenis tussen de twee vectoren te berekenen:

SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}

Waar $\mathbf{e}{ref}$ de sprekervector van de referentiespraak en $\mathbf{e}{gen}$ de sprekervector van de gegenereerde spraak vertegenwoordigt.

Een hogere SIM geeft aan dat de gegenereerde spraak qua toonkenmerken dichter bij de referentiespreker staat. Deze metrik is bijzonder geschikt voor het beoordelen van de effectiviteit van spraakklonende modellen.

Real-time factor

Wat inferentieprestaties betreft, is TTS vergelijkbaar met spraakherkenningsmodellen en kan ook RTF gebruiken om de verwerkingsefficiëntie van het model te meten. Het verschil is dat RTF in spraakherkenning doorgaans de verhouding tussen herkenningsduur en invoerspraakduur vertegenwoordigt, terwijl het bij TTS de verhouding tussen spraakgenereerstijd en gegenereerde spraakduur vertegenwoordigt. Een lagere RTF geeft een hogere spraakgeneratieefficiëntie van het model aan.

De RTF-berekeningsformule is:

RTF =
\frac{T_{infer}}{T_{audio}}

Waar $T_{infer}$ de inferentietijd vertegenwoordigt die nodig is om spraak te genereren, en $T_{audio}$ de duur van de uiteindelijk gegenereerde spraak vertegenwoordigt.

Voor streaming TTS-modellen kan ook verder worden gelet op Time to First Audio, dat wil zeggen de tijd die verstrijkt vanaf het moment dat het model een tekstverzoek ontvangt tot het uitvoeren van het eerste afspelbare audioblok. Een lagere Time to First Audio betekent dat gebruikers de gegenereerde spraak sneller kunnen horen, daarom is deze metrik bijzonder belangrijk voor real-time spraakinteractiescenario's.

Objectieve beoordeling van beeldgeneratie

Voor taken zoals tekst-naar-beeld, beeld-naar-beeld en beeldbewerking is het moeilijk om de generatieresultaten volledig te beoordelen met slechts één metrik. Bijvoorbeeld, tekst-naar-beeld moet beoordelen of gegenereerde afbeeldingen overeenkomen met tekstbeschrijvingen, beeldbewerking moet ook beoordelen of gegenereerde resultaten de hoofdonderwerpen en structuur van het originele beeld behouden, en bij het beoordelen van de algehele prestaties van een beeldgeneratiemodel moet ook de kwaliteit en authenticiteit van gegenereerde afbeeldingen worden overwogen.

Tekst-beeldconsistentie

Voor tekst-naar-beeld-taken moet eerst worden beoordeeld of gegenereerde afbeeldingen overeenkomen met de invoertekstbeschrijving. Als de prompt bijvoorbeeld vereist dat specifieke onderwerpen, scènes of stijlen worden gegenereerd, moeten de door het model gegenereerde afbeeldingen deze elementen zoveel mogelijk bevatten.

Een veelgebruikte beoordelingsaanpak is om visueel-taalmodellen zoals CLIP te gebruiken om tekst en afbeeldingen in dezelfde kenmerkenruimte te projecteren, en dan de overeenkomstgraad tussen beide te berekenen. CLIP werd voorgesteld door Radford et al. in 2021, getraind met massieve "beeld-tekst" gegevens zodat het model de correspondentie tussen beeldinhoud en natuurlijke taal kan leren. De cosinusgelijkenis tussen beeld en tekst kan worden uitgedrukt als:

Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}

Waar

\mathbf{v}{image} 

de beeldkenmerkenvector vertegenwoordigt,

\mathbf{v}{text} 

de tekstkenmerkenvector vertegenwoordigt. Over het algemeen geeft een hogere gelijkenis aan dat beeld en tekst in totale semantiek dichter bij elkaar staan. Dit type methode beoordeelt voornamelijk of de totale semantiek overeenkomt en kan niet garanderen dat alle details in de tekst nauwkeurig worden gegenereerd, zoals het beoordelen of de hoeveelheden, posities en details in het beeld nauwkeurig zijn.

Beeldgelijkenis

Voor beeld-naar-beeld- en beeldbewakingstaken wordt doorgaans ook een origineel beeld of referentiebeeld verstrekt. Dit type taak moet niet alleen beoordelen of gegenereerde resultaten voldoen aan tekstvereisten, maar ook beoordelen of belangrijke inhoud van het originele beeld correct is behouden.

Bijvoorbeeld, bij het bewerken van productafbeeldingen kunnen de achtergrond, belichting of totale stijl worden gewijzigd, maar het wordt over het algemeen gewenst dat belangrijke informatie zoals het productonderwerp, de uiterlijke structuur en het logo consistent blijven. In dit geval kan de effectiviteit van de bewerking worden beoordeeld door de verschillen tussen gegenereerde afbeeldingen en referentieafbeeldingen te vergelijken.

SSIM (Structural Similarity Index) is een klassieke volledige referentie beeldkwaliteitsbeoordelingsmethode, voorgesteld door Wang et al. in 2004. Het vergelijkt voornamelijk twee afbeeldingen vanuit aspecten zoals helderheid, contrast en structuur, met bijzondere aandacht voor of de beeldstructuurinformatie is veranderd.

Naast SSIM kan ook LPIPS (Learned Perceptual Image Patch Similarity) worden gebruikt om perceptuele verschillen tussen twee afbeeldingen te meten. LPIPS gebruikt diepe neurale netwerken om beeldkenmerken te extraheren, en beoordeelt dan perceptuele visuele verschillen tussen twee afbeeldingen op basis van afstanden tussen kenmerken. Verwacht onderzoek toont aan dat diepe kenmerken de menselijke perceptie van beeldgelijkenis beter kunnen weerspiegelen. Hoewel zowel SSIM als LPIPS referentieafbeeldingen vereisen, richten ze zich op verschillende aspecten: SSIM richt zich meer op veranderingen in beeldstructuur, terwijl LPIPS zich meer richt op verschillen in visuele perceptie. In praktische taken kunnen geschikte metrieken worden geselecteerd op basis van de beeldbewerkingsdoelen.

Voor taken met referentieafbeeldingen zoals beeldbewerking en beeld-naar-beeld kan de gelijkenis tussen gegenereerde afbeeldingen en referentieafbeeldingen worden berekend.

FID

De vorige metrieken worden voornamelijk gebruikt om de relatie tussen een gegenereerd beeld en tekst of een referentiebeeld te vergelijken. Als je de algehele generatieprestaties van een beeldgeneratiemodel wilt beoordelen, is doorgaans een statistische analyse van een batch gegenereerde afbeeldingen nodig.

FID (Fréchet Inception Distance) werd voorgesteld door Heusel et al. in 2017, voornamelijk gebruikt om verschillen in kenmerkverdelingen tussen gegenereerde afbeeldingen en echte afbeeldingen te meten. FID. FID extraheert eerst met beeldmodellen kenmerken van echte en gegenereerde afbeeldingen, berekent dan apart de verdelingen van de twee kenmerksets en berekent de afstand tussen de twee verdelingen. De basisvorm is:

FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)

Waar $\mu_r$ en $\Sigma_r$ de gemiddelde waarde en covariantiematrix van de kenmerken van echte afbeeldingen en $\mu_g$ en $\Sigma_g$ de gemiddelde waarde en covariantiematrix van de kenmerken van gegenereerde afbeeldingen vertegenwoordigen. FID vergelijkt niet twee specifieke afbeeldingen, maar de verschillen in kenmerkverdelingen tussen twee batches afbeeldingen. Een lagere FID geeft aan dat de kenmerkverdeling van gegenereerde afbeeldingen dichter bij die van echte afbeeldingen staat, wat het geschikt maakt voor het vergelijken van algehele prestaties tussen modellen.

Esthetische score

Naast het beoordelen of afbeeldingen overeenkomen met tekstbeschrijvingen, kan ook een automatische beoordeling van gegenereerde afbeeldingen vanuit het perspectief van visuele effecten worden uitgevoerd. De esthetische score gebruikt doorgaans gegevens met menselijke esthetische beoordelingen of voorkeursinformatie om beoordelingsmodellen te trainen, zodat het model menselijke voorkeuren voor visuele beeldkwaliteit leert, en dan automatisch gegenereerde afbeeldingen beoordeelt.

Dit type methode weerspiegelt doorgaans volledig kenmerken zoals beeldcompositie, kleur, belichting, helderheid en totale visuele aantrekkingskracht. Hogere scores geven over het algemeen betere visuele prestaties van het beeld aan onder het gebruikte beoordelingsmodel. Esthetische beoordeling heeft een zekere mate van subjectiviteit, aangezien verschillende scoremodellen verschillende trainingsgegevens en esthetische voorkeuren kunnen hebben. Daarom is de esthetische score meer geschikt als hulpmetrik en kan het de kwaliteit van beeldgeneratie niet alleen vertegenwoordigen.

Subjectieve beoordeling van beeldgeneratie

Objectieve metrieken kunnen de generatieresultaten beoordelen vanuit aspecten zoals tekst-beeldconsistentie, beeldgelijkenis en kenmerkverdeling, maar deze metrieken kunnen de werkelijke visuele effecten van afbeeldingen niet volledig weerspiegelen. Daarom moet bij beeldgeneratietaken doorgaans ook menselijke beoordeling worden gecombineerd om de kwaliteit van gegenereerde afbeeldingen te beoordelen vanuit het perspectief van menselijke visuele perceptie en werkelijke behoeften.

De menselijke beoordeling kan zich op de volgende aspecten concentreren:

  • Inhoudelijke consistentie: Of gegenereerde afbeeldingen overeenkomen met invoertekstbeschrijvingen of bewerkingsvereisten;
  • Visuele kwaliteit: Of afbeeldingen helder en natuurlijk zijn, en of er opvallende vervormingen, onscherpte of structuurfouten zijn;
  • Onderwerpconsistentie: Voor beeld-naar-beeld- en beeldbewakingstaken, of hoofdonderwerpen zoals personen en producten consistent blijven met referentieafbeeldingen;
  • Detailkwaliteit: Of foutgevoelige posities zoals handen van personen, tekst, logo's en randen normaal zijn;
  • Praktische bruikbaarheid: Of gegenereerde resultaten direct kunnen worden gebruikt in werkelijke bedrijfssscenario's zoals posters en productpresentaties.

Om verschillen door individuele subjectieve oordelen te verminderen, kunnen van tevoren eenvormige beoordelingsnormen worden vastgesteld, en kunnen meerdere beoordelaars beoordelingen apart uitvoeren. De subjectieve beoordeling kan visuele problemen ontdekken die geautomatiseerde metrieken moeilijk kunnen weerspiegelen. Daarom worden bij de daadwerkelijke beoordeling van beeldgeneratie objectieve metrieken en subjectieve beoordeling doorgaans gecombineerd om de generatieprestaties van het model vollediger te beoordelen.

Beoordeling van videogeneratiemodellen

Videogeneratiemodellen moeten continu videogeneratie inhoud genereren op basis van invoer zoals tekst en afbeeldingen. In tegenstelling tot beeldgeneratie moet video niet alleen de kwaliteit van individuele frames garanderen, maar ook de continuïteit tussen verschillende frames, de redelijkheid van beweging en de consistentie tussen de gegenereerde inhoud en de invoeromstandigheden beoordelen. Daarom moeten videogeneratiemodellen doorgaans volledig worden beoordeeld vanuit meerdere aspecten, waaronder tekst-videoconsistentie, totale videokwaliteit, temporele consistentie, bewegingskwaliteit en subjectieve kijkervaring.

Tekst-videoconsistentie

Vergelijkbaar met tekst-naar-beeld-taken, moeten tekst-naar-video-taken ook de semantische consistentie tussen de gegenereerde inhoud en de invoertekst beoordelen. Het verschil is dat video bestaat uit opeenvolgende videoframes, wat verdere overweging vereist van de mate van overeenkomst tussen de totale video-inhoud en de tekstbeschrijving. De belangrijkste methode is om enkele videoframes te extraheren uit gegenereerde video's, visueel-taalmodellen zoals CLIP te gebruiken om apart de semantische gelijkenis te berekenen tussen elk videoframe en de invoertekst, en dan de resultaten van meerdere videoframes te middelen (vaak Frame-average CLIP Score genoemd):

$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$

Waar $N$ het aantal videoframes dat deelneemt aan de beoordeling vertegenwoordigt, $\mathbf{v}_{\text{frame}_i}$ de kenmerkenvector van het $i$-de videoframe, $\mathbf{v}_{\text{text}}$ de kenmerkenvector van de invoertekst, en $\operatorname{Similarity}(\cdot, \cdot)$ cosinusgelijkenis gebruikt. Hogere scores geven een hogere semantische overeenkomst aan tussen video-inhoud en invoertekst. Deze metrik richt zich voornamelijk op de overeenkomst tussen ruimtelijke statische inhoud en tekst en kan de actiecoherentie en fysieke tijdslogica in video niet volledig weerspiegelen, daarom moet het nog worden gecombineerd met metrieken zoals temporele consistentie en bewegingskwaliteit voor volledige meting.

Fréchet Video Distance

Fréchet Video Distance (FVD) is een kernmetrik om de kwaliteit van de generatieverdeling te meten in videogeneratietaken, gebruikt om verschillen in diepe kenmerkverdelingen tussen gegenereerde videosets en echte videosets te meten. Bij het berekenen van FVD worden eerst de diepe kenmerken van echte en gegenereerde video's geëxtraheerd, de parameters van de Gaussianverdeling (gemiddelde waarde en covariantiematrix) van de twee kenmerksets berekend, en hun Fréchet-afstand berekend: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$

Waar $\mu_r$ en $\Sigma_r$ respectievelijk de gemiddelde vector en covariantiematrix van de kenmerken van echte video's en $\mu_g$ en $\Sigma_g$ respectievelijk de gemiddelde vector en covariantiematrix van de kenmerken van gegenereerde video's vertegenwoordigen, en $\operatorname{Tr}(\cdot)$ de spoor van een matrix aangeeft. Lagere FWD-waarden geven aan dat de kenmerkverdeling van gegenereerde video's dichter bij die van echte video's staat, wat wijst op betere algehele prestaties van het model in visuele getrouwheid, temporele coherentie en steekproefdiversiteit.

Temporele consistentie

Temporele consistentie wordt voornamelijk gebruikt om de stabiliteit van gegenereerde video's in de tijd dimensie te beoordelen. Video bestaat uit opeenvolgende frames die niet alleen goede beeldkwaliteit vereisen voor elk frame, maar ook vloeiende overgangen van onderwerpuitstraling, achtergrondtextuur, kleur en stijl tussen opeenvolgende frames. In scenario's met personengeneratie bijvoorbeeld, als gezichtsuitdrukkingen of kledingtexturen frequent flikkeren of vervormen tussen frames, zelfs als de individuele framekwaliteit hoog is, zal de kijkervaring sterk worden aangetast. In de daadwerkelijke beoordeling is een veelgebruikte methode om beeldkenmerkenextraktienetwerken te gebruiken om representaties van opeenvolgende frames te verkrijgen en de gemiddelde cosinusgelijkenis te berekenen tussen kenmerken van aangrenzende frames. Voor een video met $N$ videoframes kan de temporele consistentie $TC$ worden uitgedrukt als:

$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$

Waar $\mathbf{f}_i$ en $\mathbf{f}_{i+1}$ respectievelijk de visuele kenmerkenvectoren van het $i$-de en $(i+1)$-de frame en $N$ het totale aantal bemonsterde frames. Over het algemeen geven hogere $TC$-scores kleinere visuele sprongen tussen aangrenzende frames en stabielere frames aan. Temporele consistentie is niet absoluut beter wanneer hoger: wanneer het model degradeert en bijna volledig statische frames genereert, zal $TC$ ook abnormaal hoog zijn. Temporele consistentie moet worden gecombineerd met metrieken zoals Dynamic Degree en bewegingsamplitude voor gezamenlijke beoordeling.

Bewegingsvloeiendheid

Videogeneratiemodellen moeten niet alleen beeldflikkeren vermijden, maar ook garanderen dat de bewegingsbanen van onderwerpen coherent en natuurlijk zijn, waarbij verschijnselen zoals lokale ledemaatmutaties en onmiddellijke verplaatsingen worden vermeden die niet stroken met het gezonde verstand. De bewegingsvloeiendheid wordt voornamelijk gebruikt om de regulariteit van veranderingen in bewegingssnelheid en -acceleratie over de tijd te meten. Bij de concrete berekening worden doorgaans voorgeleerde optische stroom schattingsmodellen (zoals RAFT) gebruikt om dichte optische stroomvelden of bewegingsvectoren tussen aangrenzende frames te extraheren. Zij de bewegingsvector (of gemiddelde optische stroom) van frame $t$ naar frame $t+1$ $\mathbf{v}_t$, kan de bewegingsveranderingsfout $E_{\text{motion}}$ worden gedefinieerd via verschillen in bewegingsvectoren tussen aangrenzende tijdperiodes:

$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$

Waar $\mathbf{v}_t$ de bewegingstoestand in fase $t$ weerspiegelt. Een kleinere $E_{\text{motion}}$ geeft minder plotselinge veranderingen in bewegingsacceleratie en vloeiendere actieovergangen aan.

VBench

Omdat het moeilijk is voor één enkele metrik om de mogelijkheden van videogeneratiemodellen volledig weer te geven, kunnen nu uitgebreide beoordelingskaders zoals VBench worden gebruikt voor multidimensionale beoordeling van videogeneratiemodelen. VBench verdeelt de videokwaliteit in meerdere beoordelingsdimensies, zoals onderwerpconsistentie, achtergrondconsistentie, bewegingsvloeiendheid, Dynamic Degree, esthetische kwaliteit en beeldkwaliteit. Vergeleken met individuele metriken zoals CLIP Score en FVD, ligt het voordeel van VBench in het vermogen om de videogeneratieprestaties vanuit meerdere perspectieven te analyseren, waaronder beeldkwaliteit, temporele stabiliteit, bewegingsprestaties en voorwaardeconsistentie, wat het geschikter maakt voor het vergelijken van algehele mogelijkheden tussen verschillende videogeneratiemodellen.

Menselijke beoordeling

De output van grote taalmodellen heeft een sterke openheid, en dezelfde vraag kan vaak meerdere redelijke antwoordbenaderingen hebben. Het is moeilijk om volledig te beoordelen of antwoorden correct zijn en voldoen aan de behoeften van gebruikers door alleen op geautomatiseerde metrieken te vertrouwen. Daarom blijft menselijke beoordeling bij het evalueren van fijntuned grote taalmodellen een belangrijke beoordelingsmethode. Voor open inhoud die moeilijk nauwkeurig kan worden beoordeeld met geautomatiseerde metrieken, kunnen blinde tests of meerpersoons-scoremethoden worden gebruikt. De beoordelaars kunnen de modeloutputs volledig beoordelen vanuit aspecten zoals correctheid, volledigheid, relevantie, instructieopvolging, uitdrukkingskwaliteit en veiligheid.

Bij de daadwerkelijke beoordeling kunnen van tevoren eenvormige beoordelingsnormen worden vastgesteld, zoals het beoordelen van verschillende beoordelingsdimensies op een schaal van 1 tot 5. Om vooringenomenheid van beoordelaars jegens modellen te verminderen, kunnen modelnamen en -versies worden verborgen, zodat de beoordelaars blinde tests kunnen uitvoeren alleen op basis van de antwoordinhoud. Als modellen voor en na fijntuning worden vergeleken, kunnen de antwoorden van beide modellen op dezelfde vraag anoniem worden weergegeven, en kunnen de beoordelaars het beter presterende antwoord kiezen.

Omdat menselijke beoordeling een zekere mate van subjectiviteit heeft, kan voor belangrijke beoordelingen ook meerpersonsscore worden toegepast. Dezelfde inhoudsbatch wordt onafhankelijk beoordeeld door meerdere beoordelaars, en dan worden de score-resultaten samengevat. Wanneer er grote verschillen zijn in scores tussen verschillende beoordelaars, is het noodzakelijk om verder te controleren of de beoordelingsnormen duidelijk zijn om de consistentie en betrouwbaarheid van de beoordelingsresultaten te verbeteren. Hoewel menselijke beoordeling meer tijd en mankracht vereist, kan het problemen ontdekken die geautomatiseerde metrieken moeilijk kunnen weerspiegelen. Bij het beoordelen van de fijntuning effectiviteit van grote taalmodellen kunnen geautomatiseerde beoordeling en menselijke beoordeling worden gecombineerd om vollediger te beoordelen of het model daadwerkelijk is verbeterd.