मॉडल का Fine-Tuning पूरा होने के बाद, यह निर्धारित करने के लिए मूल्यांकन की आवश्यकता होती है कि क्या मॉडल वास्तव में अपेक्षित परिणाम प्राप्त कर चुका है। चूंकि विभिन्न कार्यों के अलग-अलग लक्ष्य होते हैं, इसलिए उपयोग की जाने वाली मूल्यांकन विधियाँ भी अलग-अलग होंगी।
उदाहरण के लिए, वर्गीकरण कार्य मुख्य रूप से इस बात पर ध्यान केंद्रित करते हैं कि क्या मॉडल सही श्रेणी निर्धारित कर सकता है; सूचना निकासी कार्य इस बात पर ध्यान केंद्रित करते हैं कि क्या आवश्यक जानकारी पूर्ण रूप से सटीक रूप से निकाली जाती है; उत्पादन कार्यों में, यह निर्धारित करने के अलावा कि क्या उत्तर सही हैं, सामग्री की पूर्णता और प्रासंगिकता पर भी ध्यान देना चाहिए; वाक् पहचान आमतौर पर त्रुटि दरों के माध्यम से मूल्यांकन करती है; छवि निर्माण के लिए स्वचालित मापदंडों और मानव मूल्यांकन के संयोजन की आवश्यकता होती है।
विशिष्ट परीक्षण विधियों के लिए, देखें 【पहले मूल्यांकन करें, फिर चुनें: EvalScope का उपयोग करके ओपन-सोर्स मॉडल के लिए पहली रिपोर्ट बनाएं】। यह अध्याय आपको बताएगा कि विभिन्न कार्यों के लिए कौन से मूल्यांकन मापदंड उपलब्ध हैं~
पाठ वर्गीकरण मॉडल के Fine-Tuning में एक तुलनात्मक रूप से सामान्य कार्य प्रकार है, जैसे अभिप्राय पहचान, भावना वर्गीकरण, दोष वर्गीकरण और जोखिम वर्गीकरण।
आमतौर पर, भविष्यवाणी परिणामों को चार स्थितियों में विभाजित किया जा सकता है:
सटीकता सभी नमूनों में से सही भविष्यवाणी किए गए नमूनों का अनुपात दर्शाती है:
\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}
उदाहरण के लिए, यदि 1000 डेटा बिंदुओं का परीक्षण किया जाता है और मॉडल 900 की सही भविष्यवाणी करता है, तो Accuracy 90% होती है। Accuracy मॉडल के समग्र वर्गीकरण प्रदर्शन को तुलनात्मक रूप से स्पष्ट रूप से दर्शा सकती है। हालांकि, जब विभिन्न श्रेणियों के डेटा की मात्रा में काफी अंतर होता है, तो केवल Accuracy पर भरोसा करने से गलत निर्णय हो सकते हैं। यदि 1000 भावना वर्गीकरण डेटा बिंदुओं में से केवल 20 नकारात्मक हैं, और मॉडल सभी डेटा को "सकारात्मक" भविष्यवाणी करता है, तो Accuracy अभी भी 98% तक पहुंच सकती है, लेकिन वास्तव में, 20 नकारात्मक डेटा बिंदुओं में से एक भी पहचाना नहीं गया। इसलिए, असंतुलित श्रेणी वितरण की स्थिति में, आमतौर पर Precision, Recall और F1 के साथ मॉडल का मूल्यांकन करने की आवश्यकता होती है।
Precision दर्शाता है कि सकारात्मक नमूनों के रूप में भविष्यवाणी किए गए डेटा में से कितने वास्तव में सकारात्मक नमूनों से संबंधित हैं:
$\mathrm{Precision}=\frac{TP}{TP+FP} $
साइन इन करें चर्चा में शामिल हों
Recall दर्शाता है कि सकारात्मक नमूनों के रूप में लेबल किए गए डेटा में से कितने मॉडल द्वारा सफलतापूर्वक पहचाने गए:
$\mathrm{Recall}=\frac{TP}{TP+FN} $
F1 Score समग्र रूप से Precision और Recall पर विचार करता है। अधिक F1 आमतौर पर दर्शाता है कि मॉडल ने Precision और Recall के बीच एक अच्छा संतुलन प्राप्त किया है。
F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}
Accuracy, Recall और F1 एक ही मान के साथ मॉडल के समग्र प्रदर्शन का प्रतिनिधित्व कर सकते हैं। हालांकि, यदि आप जानना चाहते हैं कि मॉडल किन श्रेणियों को गलत वर्गीकृत करने की प्रवृत्ति रखता है, तो आपको आगे के विश्लेषण के लिए भ्रम मैट्रिक्स का उपयोग करने की आवश्यकता है। भ्रम मैट्रिक्स प्रत्येक परीक्षण डेटा बिंदु की वास्तविक श्रेणी की तुलना मॉडल की भविष्यवाणी श्रेणी से करता है, फिर विभिन्न श्रेणियों के बीच भविष्यवाणी परिणामों की गणना करता है और परिणामों को एक मैट्रिक्स में व्यवस्थित करता है।
उदाहरण के लिए, यदि परीक्षण सेट में नेटवर्क दोष, हार्डवेयर दोष और सॉफ्टवेयर दोष की तीन श्रेणियाँ हैं, तो मॉडल के भविष्यवाणी परिणाम निम्नानुसार हैं:
| वास्तविक श्रेणी \ भविष्यवाणी श्रेणी | नेटवर्क दोष | हार्डवेयर दोष | सॉफ्टवेयर दोष |
| नेटवर्क दोष | 45 | 2 | 3 |
| हार्डवेयर दोष | 1 | 47 | 2 |
| सॉफ्टवेयर दोष | 6 | 2 | 42 |
प्रत्येक पंक्ति डेटा की वास्तविक श्रेणी का प्रतिनिधित्व करती है, और प्रत्येक स्तंभ मॉडल की भविष्यवाणी श्रेणी का प्रतिनिधित्व करता है। मैट्रिक्स विकर्ण पर आँकड़े सही भविष्यवाणियों की संख्या का प्रतिनिधित्व करते हैं; उदाहरण के लिए, 50 नेटवर्क दोष डेटा बिंदुओं में से, 45 को सही ढंग से पहचाना गया। विकर्ण से बाहर के आँकड़े भविष्यवाणी त्रुटियों का प्रतिनिधित्व करते हैं; उदाहरण के लिए, 6 सॉफ्टवेयर दोषों को गलत तरीके से नेटवर्क दोष के रूप में भविष्यवाणी किया गया था। भ्रम मैट्रिक्स से आप न केवल यह देख सकते हैं कि मॉडल ने कितने डेटा बिंदुओं की सही भविष्यवाणी की, बल्कि यह भी आगे पता लगा सकते हैं कि कौन सी श्रेणियाँ आसानी से भ्रमित होती हैं। ऊपर के परिणामों में, सॉफ्टवेयर दोषों को अपेक्षाकृत अधिक बार नेटवर्क दोष के रूप में गलत भविष्यवाणी किया गया था, जो दर्शाता है कि इन दो श्रेणियों को अलग करने की मॉडल की क्षमता में अभी भी सुधार की गुंजाइश है। इन आसानी से भ्रमित होने वाली श्रेणियों का विश्लेषण करके, आप मॉडल की समस्याओं को और अधिक पता लगा सकते हैं और प्रशिक्षण डेटा पूरक बनाने और मॉडल को अनुकूलित करने के लिए संदर्भ प्रदान कर सकते हैं।
नामित इकाई पहचान, फ़ील्ड निकासी और संरचित सूचना निकासी जैसे कार्यों के लिए, सामान्य रूप से उपयोग किए जाने वाले मूल्यांकन मापदंडों में फ़ील्ड सटीकता, इकाई-स्तरीय Precision, Recall और F1 शामिल हैं। विभिन्न मापदंड विभिन्न मूल्यांकन विशिष्टता पर ध्यान केंद्रित करते हैं और विशिष्ट कार्यों के अनुसार चुने जा सकते हैं।
फ़ील्ड सटीकता मुख्य रूप से यह मापने के लिए उपयोग की जाती है कि क्या मॉडल निर्दिष्ट फ़ील्डों को सही ढंग से निकालता है। इसकी गणना विधि इस प्रकार है:
\text{फ़ील्ड सटीकता} =
\frac{\text{सही ढंग से निकाले गए फ़ील्डों की संख्या}}
{\text{निकालने की आवश्यकता वाले फ़ील्डों की कुल संख्या}}
कई फ़ील्डों वाले कार्यों के लिए, विभिन्न फ़ील्डों की सटीकता की अलग-अलग गणना की जा सकती है। उदाहरण के लिए, कंपनी के नाम और व्यक्ति के नाम की सटीकता की अलग-अलग गणना करके, आप और अधिक विश्लेषण कर सकते हैं कि किन फ़ील्डों में मॉडल की निकासी क्षमता कमजोर है। हालांकि, इस विधि में सीमाएँ हैं: यह निर्धारित नहीं कर सकता कि मॉडल ने किन इकाइयों को छोड़ दिया। इसलिए, कई इकाइयों वाले सूचना निकासी कार्यों के लिए, अधिक विस्तृत मूल्यांकन के लिए इकाई-स्तरीय Precision, Recall और F1 का उपयोग करना आवश्यक है।
नामित इकाई पहचान (NER) कार्यों के लिए, इकाई-स्तरीय Precision, Recall और F1 मूल्यांकन के लिए उपयोग किए जाते हैं। यह अनुभाग पिछले अनुभाग के वर्गीकरण मूल्यांकन मापदंडों के समान है。
जहाँ:
Precision का उपयोग यह मापने के लिए किया जाता है कि मॉडल द्वारा पहचानी गई इकाइयों में से कितनी सही हैं:
Precision = \frac{TP}{TP + FP}
Recall का उपयोग यह मापने के लिए किया जाता है कि ग्राउंड ट्रुथ में मौजूद इकाइयों में से कितनी मॉडल द्वारा सफलतापूर्वक पहचानी गईं:
Recall = \frac{TP}{TP + FN}
F1 समग्र रूप से Precision और Recall पर विचार करता है:
F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}
अधिक Precision दर्शाता है कि मॉडल द्वारा पहचानी गई इकाइयाँ समग्र रूप से अधिक सटीक हैं; अधिक Recall दर्शाता है कि मॉडल ने कम इकाइयों को छोड़ा है; F1 का उपयोग दोनों पहलुओं में प्रदर्शन को समग्र रूप से मापने के लिए किया जाता है।
वर्गीकरण और सूचना निकासी कार्यों के विपरीत, बड़े भाषा मॉडल द्वारा उत्पादित सामग्री में आमतौर पर मजबूत खुलापन होता है, और मॉडल आउटपुट में आमतौर पर एक अद्वितीय मानक उत्तर नहीं होता है। इस प्रकार के कार्य को आमतौर पर सटीकता, पूर्णता, प्रासंगिकता, प्रारूप अनुपालन और भ्रम सहित कई आयामों से मूल्यांकन करने की आवश्यकता होती है।
सटीकता मुख्य रूप से यह निर्धारित करती है कि क्या मॉडल द्वारा उत्पादित सामग्री सही है, जिसमें तथ्यों, निष्कर्षों और तर्क परिणामों में त्रुटियाँ शामिल हैं। Fine-Tuning किए गए मॉडलों के लिए, भले ही उत्तर भाषा धाराप्रवाह हो और प्रारूप पूर्ण हो, यदि इसमें गलत तथ्य या निष्कर्ष शामिल हैं, तो मॉडल को अच्छा उत्पादन प्रदर्शन प्राप्त करने वाला नहीं माना जा सकता। सटीकता आमतौर पर उत्पादन परिणामों का मूल्यांकन करते समय सबसे बुनियादी आवश्यकता होती है।
पूर्णता मुख्य रूप से यह निर्धारित करती है कि क्या मॉडल ने प्रश्न का पर्याप्त उत्तर दिया है और क्या शामिल होने वाली महत्वपूर्ण जानकारी छूट गई है। कुछ उत्तर, भले ही सामग्री में स्पष्ट त्रुटियाँ न हों, केवल प्रश्न के एक हिस्से का उत्तर देते हैं और महत्वपूर्ण सामग्री को छोड़ देते हैं। ऐसी स्थितियों में, मॉडल के उत्तर में निश्चित सटीकता होती है, लेकिन पूर्णता अभी भी अपर्याप्त है। पूर्णता केवल इस बात पर ध्यान केंद्रित नहीं करती कि क्या उत्तर सही है, बल्कि इस बात पर भी ध्यान केंद्रित करती है कि क्या उत्तर देने योग्य सभी सामग्री का उत्तर दिया गया है।
प्रासंगिकता मुख्य रूप से यह निर्धारित करती है कि क्या मॉडल द्वारा उत्पादित सामग्री उपयोगकर्ता के प्रश्न के चारों ओर घूमती है। बड़े भाषा मॉडल कभी-कभी ऐसी बड़ी मात्रा में सामग्री उत्पन्न करते हैं जो उचित लगती है लेकिन प्रश्न से बहुत संबंधित नहीं है। यद्यपि यह सामग्री स्वयं में गलत नहीं हो सकती, यह उत्तर की प्रभावशीलता को कम करती है। अच्छी प्रासंगिकता वाले उत्तर को सीधे उपयोगकर्ता के प्रश्न का जवाब देना चाहिए और गैर-प्रासंगिक, दोहराव या अत्यधिक विस्तारित सामग्री को कम से कम करना चाहिए।
व्यावहारिक अनुप्रयोगों में, उत्तर सामग्री के अलावा, मॉडलों को आमतौर पर निर्दिष्ट प्रारूप में परिणाम आउटपुट करने की आवश्यकता होती है। उदाहरण के लिए, मॉडल को JSON प्रारूप में परिणाम लौटाने की आवश्यकता होती है, या निर्दिष्ट फ़ील्ड, क्रम और संरचना के अनुसार सामग्री को व्यवस्थित करने की आवश्यकता होती है। प्रारूप अनुपालन मुख्य रूप से यह मूल्यांकन करता है कि क्या मॉडल दिए गए आउटपुट आवश्यकताओं के अनुसार सामग्री उत्पन्न करता है। भले ही उत्तर सामग्री सही हो, यदि निर्दिष्ट प्रारूप में आउटपुट नहीं किया जाता है, तो इससे बाद के प्रोग्रामों के लिए इसे सही ढंग से पार्स करना और उपयोग करना मुश्किल हो सकता है। निर्देश Fine-Tuning से गुजरने वाले या निश्चित आउटपुट आवश्यकताओं वाले मॉडलों के लिए, प्रारूप अनुपालन भी एक महत्वपूर्ण मूल्यांकन आयाम है।
भ्रम का तात्पर्य उस सामग्री के मॉडल द्वारा उत्पादन से है जिसमें आधार की कमी हो, तथ्यों से मेल न खाता हो, या शून्य से बनाया गया हो। जब मॉडल को किसी जानकारी के बारे में पता नहीं होता है, तो अपर्याप्त जानकारी बताने के बजाय, यह एक तथ्य उत्पन्न करता है जो उचित लगता है लेकिन वास्तव में मौजूद नहीं है। यह एक विशिष्ट भ्रम समस्या है।
भ्रम और सटीकता के बीच एक संबंध है लेकिन अलग-अलग पहलुओं पर ध्यान केंद्रित करता है। सटीकता इस बात पर ध्यान केंद्रित करती है कि क्या उत्तर सामग्री सही है, जबकि भ्रम इस बात पर अधिक ध्यान केंद्रित करता है कि क्या मॉडल ने विश्वसनीय आधार के बिना जानकारी उत्पन्न की है। ज्ञान प्रश्नोत्तर जैसे परिदृश्यों के लिए जिन्हें उच्च तथ्यात्मक विश्वसनीयता की आवश्यकता होती है, मॉडल की भ्रम स्थिति पर विशेष ध्यान देना आवश्यक है।
वाक् पहचान (ASR) कार्यों को आमतौर पर दो पहलुओं से मूल्यांकन करने की आवश्यकता होती है: पहचान सटीकता और प्रसंस्करण दक्षता। इनमें से, CER और WER का उपयोग पहचान परिणामों में त्रुटि दरों को मापने के लिए किया जाता है, जबकि RTF का उपयोग वाक् के मॉडल प्रसंस्करण की गति को मापने के लिए किया जाता है।
CER और WER को पेश करने से पहले, आइए वाक् पहचान त्रुटि दर गणना में उपयोग किए जाने वाले कई सामान्य प्रतीकों की व्याख्या करें:
CER और WER दोनों इन प्रकार की त्रुटियों के आधार पर गणना की जाती हैं, मुख्य अंतर उपयोग की जाने वाली सांख्यिकीय इकाइयों में है।
CER (Character Error Rate) वाक् पहचान परिणामों और मानक टेक्स्ट के बीच अंतर को अक्षरों को इकाइयों के रूप में उपयोग करके मापता है। इसका सूत्र इस प्रकार है:
CER = \frac{S + D + I}{N}
कम CER आमतौर पर अधिक सटीक वाक् पहचान परिणाम दर्शाता है। चीनी वाक् पहचान कार्यों के लिए, CER एक तुलनात्मक रूप से सामान्य उपयोग किया जाने वाला मूल्यांकन मापदंड है।
WER (Word Error Rate) की गणना विधि CER के समान है:
WER = \frac{S + D + I}{N}
CER अक्षरों को बुनियादी इकाई के रूप में उपयोग करता है, जबकि WER शब्दों को बुनियादी इकाई के रूप में उपयोग करता है। यह अंग्रेजी जैसी भाषाओं के वाक् पहचान कार्यों में अधिक उपयोग किया जाता है जो शब्दों को बुनियादी भाषा इकाइयों के रूप में उपयोग करती हैं।
पहचान परिणामों की सटीकता के अलावा, वास्तविक तैनाती में वाक् पहचान मॉडलों को प्रसंस्करण गति पर भी विचार करने की आवश्यकता होती है। RTF (Real-Time Factor) वाक् पहचान प्रसंस्करण दक्षता को मापने के लिए उपयोग किया जाने वाला एक सामान्य मापदंड है। इसका सूत्र इस प्रकार है:
RTF =
\frac{\text{मॉडल प्रसंस्करण समय}}
{\text{वाक् अवधि}}
उदाहरण के लिए, यदि 10 सेकंड की ऑडियो क्लिप को पहचानने में 5 सेकंड लगते हैं, तो:
RTF = \frac{5}{10} = 0.5
कम RTF तेज़ मॉडल प्रसंस्करण गति दर्शाता है। जब RTF 1 से कम होता है, तो इसका मतलब है कि मॉडल की प्रसंस्करण गति वाक् की वास्तविक प्ले गति से तेज है, जो वास्तविक समय प्रसंस्करण की बुनियादी शर्तों को पूरा करती है।
CER, WER और RTF जैसे मापदंडों के अलावा, मॉडल का विभिन्न परीक्षण वातावरणों में भी मूल्यांकन किया जा सकता है। उदाहरण के लिए, पृष्ठभूमि शोर, अलग-अलग लहजे, दूरस्थ रिकॉर्डिंग और कई वक्ताओं जैसी स्थितियों में CER या WER की अलग-अलग गणना करें। विभिन्न परिदृश्यों में त्रुटि दरों की तुलना करके, जटिल वातावरण में मॉडल की पहचान क्षमता और स्थिरता का आगे मूल्यांकन किया जा सकता है।
पाठ से वाक् (Text-to-Speech, TTS) का लक्ष्य इनपुट पाठ को प्राकृतिक, स्पष्ट वाक् में बदलना है। पाठ उत्पादन मॉडल के विपरीत, TTS मॉडल को न केवल यह सुनिश्चित करने की आवश्यकता होती है कि उत्पादित सामग्री इनपुट पाठ से मेल खाती है, बल्कि वाक् की प्राकृतिकता, टोन और उत्पादन गति पर भी ध्यान देने की आवश्यकता होती है। TTS मॉडल को आमतौर पर सामग्री सटीकता, वाक् प्राकृतिकता, वक्ता समानता और अनुमान प्रदर्शन जैसे पहलुओं से मूल्यांकन किया जाता है।
TTS को सबसे पहले यह सुनिश्चित करने की आवश्यकता है कि इनपुट पाठ को सही ढंग से पढ़ा जा सकता है, जिसमें गलत पढ़ना, छूटना या दोहराव की समस्याओं से बचना शामिल है। मूल्यांकन के दौरान, ASR मॉडल का उपयोग करके TTS द्वारा उत्पादित वाक् को फिर से पाठ के रूप में पहचाना जा सकता है, फिर पहचान परिणामों की तुलना मूल इनपुट पाठ से की जा सकती है। सामग्री सटीकता के मापदंड पिछले ASR अध्याय में मापदंडों के साथ संगत हैं, अक्षर त्रुटि दर (CER) और शब्द त्रुटि दर (WER) की गणना करते हैं।
पाठ को सही ढंग से पढ़ने के अलावा, TTS द्वारा उत्पादित वाक् में अच्छी प्राकृतिकता भी होनी चाहिए, जैसे उचित बोलने की गति, प्राकृतिक रुकना, धाराप्रवाह स्वर और स्पष्ट मैकेनिकल अनुभव की अनुपस्थिति। औसत राय स्कोर (Mean Opinion Score, MOS) आमतौर पर उपयोग किया जाता है। मूल्यांकन के दौरान, कई परीक्षक उत्पादित वाक् को सुनते हैं और निश्चित स्कोरिंग मानदंडों के अनुसार इसे स्कोर करते हैं, जो आमतौर पर 1 से 5 के पैमाने का उपयोग करता है, जहाँ 1 खराब वाक् गुणवत्ता और 5 प्राकृतिक, धाराप्रवाह वाक्, मानव वाक् के करीब दर्शाता है।
अंतिम MOS को इस प्रकार व्यक्त किया जा सकता है:
MOS = \frac{1}{M}\sum_{i=1}^{M}s_i
जहाँ $M$ स्कोरिंग में भाग लेने वाले लोगों की संख्या दर्शाता है, और $s_i$ $i$वें मूल्यांकनकर्ता द्वारा दिया गया स्कोर दर्शाता है।
MOS उपयोगकर्ताओं के उत्पादित वाक् के साथ वास्तविक सुनने के अनुभव को तुलनात्मक रूप से स्पष्ट रूप से दर्शा सकता है, लेकिन यह मैनुअल सुनने पर निर्भर होने के कारण, इसकी मूल्यांकन लागत तुलनात्मक रूप से अधिक है और इसमें निश्चित सीमा तक व्यक्तिपरकता भी है।
आवाज़ क्लोनिंग, बहु-वक्ता TTS या ज़ीरो-शॉट TTS मॉडल के लिए, केवल वाक् की प्राकृतिकता सुनिश्चित करना पर्याप्त नहीं है। यह भी मूल्यांकन करने की आवश्यकता है कि क्या उत्पादित वाक् लक्ष्य वक्ता के टोन लक्षणों को बनाए रखता है। एक सामान्य विधि वक्ता पहचान मॉडल का उपयोग करके संदर्भ वाक् और उत्पादित वाक् से अलग-अलग Speaker Embeddings निकालना है, फिर दोनों वेक्टरों के बीच कोसाइन समानता की गणना करना है:
SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}
जहाँ $\mathbf{e}{ref}$ संदर्भ वाक् का वक्ता वेक्टर दर्शाता है, और $\mathbf{e}{gen}$ उत्पादित वाक् का वक्ता वेक्टर दर्शाता है।
अधिक SIM दर्शाता है कि उत्पादित वाक् टोन लक्षणों के संदर्भ में संदर्भ वक्ता के करीब है। यह मापदंड विशेष रूप से आवाज़ क्लोनिंग मॉडल की प्रभावशीलता के मूल्यांकन के लिए उपयुक्त है।
अनुमान प्रदर्शन के संदर्भ में, TTS वाक् पहचान मॉडलों के समान है और मॉडल की प्रसंस्करण दक्षता को मापने के लिए RTF का उपयोग भी कर सकता है। अंतर यह है कि वाक् पहचान में RTF आमतौर पर पहचान समय और इनपुट वाक् अवधि के अनुपात का प्रतिनिधित्व करता है, जबकि TTS में यह वाक् उत्पादन समय और उत्पादित वाक् अवधि के अनुपात का प्रतिनिधित्व करता है। कम RTF उच्च मॉडल वाक् उत्पादन दक्षता दर्शाता है।
RTF का सूत्र इस प्रकार है:
RTF =
\frac{T_{infer}}{T_{audio}}
जहाँ $T_{infer}$ वाक् उत्पन्न करने के लिए आवश्यक अनुमान समय दर्शाता है, और $T_{audio}$ अंतिम उत्पादित वाक् की अवधि दर्शाता है।
स्ट्रीमिंग TTS मॉडल के लिए, Time to First Audio पर भी अधिक ध्यान दिया जा सकता है, जो मॉडल द्वारा पाठ अनुरोध प्राप्त करने से लेकर पहले चलाने योग्य ऑडियो सेगमेंट को आउटपुट करने तक का समय है। कम Time to First Audio का मतलब है कि उपयोगकर्ता उत्पादित वाक् को जल्दी सुन सकते हैं, इसलिए यह मापदंड वास्तविक समय वाक् अंतःक्रिया परिदृश्यों के लिए विशेष रूप से महत्वपूर्ण है।
पाठ से छवि, छवि से छवि और छवि संपादन जैसे कार्यों के लिए, केवल एक मापदंड के साथ उत्पादन परिणामों का व्यापक मूल्यांकन करना कठिन है। उदाहरण के लिए, पाठ से छवि को यह निर्धारित करने की आवश्यकता होती है कि क्या उत्पादित छवियाँ पाठ विवरणों से मेल खाती हैं, छवि संपादन को यह भी निर्धारित करने की आवश्यकता होती है कि क्या उत्पादित परिणाम मूल छवि के मुख्य विषयों और संरचना को बनाए रखते हैं, और जब छवि निर्माण मॉडल के समग्र प्रदर्शन का मूल्यांकन किया जाता है, तो उत्पादित छवियों की गुणवत्ता और प्रामाणिकता पर भी विचार करने की आवश्यकता होती है।
पाठ से छवि कार्यों के लिए, सबसे पहले यह निर्धारित करने की आवश्यकता होती है कि क्या उत्पादित छवियाँ इनपुट पाठ विवरण से मेल खाती हैं। उदाहरण के लिए, यदि प्रॉम्प्ट विशिष्ट विषयों, दृश्यों या शैलियों के उत्पादन की मांग करता है, तो मॉडल द्वारा उत्पादित छवियों में इन तत्वों को यथासंभव शामिल करना चाहिए।
एक सामान्य मूल्यांकन दृष्टिकोण CLIP जैसे दृश्य-भाषा मॉडल का उपयोग करना है, पाठ और छवियों को एक ही विशेषता स्थान में मैप करना है, फिर दोनों के बीच समानता की डिग्री की गणना करना है। CLIP को Radford और अन्य ने 2021 में प्रस्तावित किया था, जो बड़े पैमाने पर "छवि-पाठ" डेटा के साथ प्रशिक्षित होता है, जिससे मॉडल छवि सामग्री और प्राकृतिक भाषा के बीच संगतता सीख सकता है। छवि और पाठ के बीच कोसाइन समानता को इस प्रकार व्यक्त किया जा सकता है:
Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}
जहाँ
\mathbf{v}{image}
छवि विशेषता वेक्टर दर्शाता है,
\mathbf{v}{text}
पाठ विशेषता वेक्टर दर्शाता है। आमतौर पर, अधिक समानता दर्शाती है कि छवि और पाठ समग्र अर्थ में करीब हैं। इस प्रकार की विधि मुख्य रूप से यह मूल्यांकन करती है कि क्या समग्र अर्थ मेल खाता है और यह गारंटी नहीं दे सकता कि पाठ में सभी विवरण सटीक रूप से उत्पादित होते हैं, जैसे छवि में मात्रा, स्थिति और विवरण के सटीक होने का निर्धारण करना।
छवि से छवि और छवि संपादन कार्यों के लिए, आमतौर पर एक मूल छवि या संदर्भ छवि भी प्रदान की जाती है। इस प्रकार के कार्य को न केवल यह निर्धारित करने की आवश्यकता होती है कि क्या उत्पादित परिणाम पाठ आवश्यकताओं को पूरा करते हैं, बल्कि यह भी ध्यान देने की आवश्यकता होती है कि क्या मूल छवि की महत्वपूर्ण सामग्री सही ढंग से संरक्षित की गई है।
उदाहरण के लिए, उत्पाद छवि संपादन में, पृष्ठभूमि, प्रकाश या समग्र शैली को संशोधित किया जा सकता है, लेकिन आमतौर पर उत्पाद विषय, उपस्थिति संरचना और लोगो जैसी महत्वपूर्ण जानकारी के संगत बने रहने की उम्मीद होती है। इस स्थिति में, उत्पादित छवियों और संदर्भ छवियों के बीच अंतर की तुलना करके संपादन प्रभावशीलता का मूल्यांकन किया जा सकता है।
SSIM (Structural Similarity Index) एक शास्त्रीय पूर्ण-संदर्भ छवि गुणवत्ता मूल्यांकन विधि है, जिसे Wang और अन्य ने 2004 में प्रस्तावित किया था। यह मुख्य रूप से चमक, कंट्रास्ट और संरचना जैसे पहलुओं से दो छवियों की तुलना करता है, विशेष रूप से छवि संरचना जानकारी में बदलाव पर ध्यान केंद्रित करता है।
SSIM के अलावा, LPIPS (Learned Perceptual Image Patch Similarity) का उपयोग दो छवियों के बीच धारणात्मक अंतर को मापने के लिए भी किया जा सकता है। LPIPS गहन तंत्रिका नेटवर्क का उपयोग करके छवि विशेषताएं निकालता है, फिर विशेषताओं के बीच दूरी के आधार पर दो छवियों के बीच दृश्य धारणात्मक अंतर का निर्णय करता है। संबंधित शोध से पता चलता है कि गहन विशेषताएं छवि समानता की मानव धारणा को बेहतर ढंग से प्रतिबिंबित कर सकती हैं। यद्यपि SSIM और LPIPS दोनों को संदर्भ छवियों की आवश्यकता होती है, लेकिन वे अलग-अलग कोणों पर ध्यान केंद्रित करते हैं: SSIM छवि संरचना में बदलाव पर अधिक ध्यान केंद्रित करता है, जबकि LPIPS दृश्य धारणा स्तर के अंतर पर अधिक ध्यान केंद्रित करता है। व्यावहारिक कार्यों में, छवि संपादन लक्ष्यों के आधार पर उपयुक्त मापदंड चुने जा सकते हैं।
संदर्भ छवियों वाले कार्यों जैसे छवि संपादन और छवि से छवि के लिए, उत्पादित छवियों और संदर्भ छवियों के बीच समानता की गणना की जा सकती है।
पिछले मापदंड मुख्य रूप से एक उत्पादित छवि और पाठ या संदर्भ छवि के बीच संबंध की तुलना करने के लिए उपयोग किए जाते हैं। यदि आप छवि निर्माण मॉडल के समग्र उत्पादन प्रदर्शन का मूल्यांकन करना चाहते हैं, तो आमतौर पर उत्पादित छवियों के एक बैच का सांख्यिकीय विश्लेषण आवश्यक है।
FID (Fréchet Inception Distance) को Heusel और अन्य ने 2017 में प्रस्तावित किया था, जो मुख्य रूप से उत्पादित छवियों और वास्तविक छवियों के बीच विशेषता वितरण में अंतर को मापने के लिए उपयोग किया जाता है। FID। FID पहले छवि मॉडल का उपयोग करके वास्तविक और उत्पादित छवियों की विशेषताएं निकालता है, फिर अलग-अलग दो विशेषता समूहों के वितरण की गणना करता है और दो वितरणों के बीच दूरी की गणना करता है। इसका बुनियादी रूप इस प्रकार है:
FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)
जहाँ $\mu_r$ और $\Sigma_r$ वास्तविक छवि विशेषताओं का औसत और सह-प्रकीर्णता मैट्रिक्स दर्शाते हैं, और $\mu_g$ और $\Sigma_g$ उत्पादित छवि विशेषताओं का औसत और सह-प्रकीर्णता मैट्रिक्स दर्शाते हैं। FID दो विशिष्ट छवियों की तुलना नहीं करता है, बल्कि दो छवि बैचों के बीच विशेषता वितरण में अंतर की तुलना करता है। कम FID दर्शाता है कि उत्पादित छवियों का विशेषता वितरण वास्तविक छवियों के करीब है, जो मॉडलों के बीच समग्र प्रदर्शन तुलना के लिए उपयुक्त है।
छवियों के पाठ विवरणों से मेल खाने के मूल्यांकन के अलावा, दृश्य प्रभावों के दृष्टिकोण से उत्पादित छवियों का स्वचालित मूल्यांकन भी किया जा सकता है। सौंदर्य स्कोर आमतौर पर मानव सौंदर्य मूल्यांकन या प्राथमिकता जानकारी वाले डेटा का उपयोग करके मूल्यांकन मॉडल को प्रशिक्षित करता है, जिससे मॉडल छवि दृश्य गुणवत्ता के मानव प्राथमिकताओं को सीखता है, फिर उत्पादित छवियों को स्वचालित रूप से स्कोर करता है।
यह प्रकार की विधि आमतौर पर छवि रचना, रंग, प्रकाश, स्पष्टता और समग्र दृश्य आकर्षण जैसे लक्षणों को समग्र रूप से प्रतिबिंबित करती है। अधिक स्कोर आमतौर पर दर्शाता है कि छवि उपयोग किए गए मूल्यांकन मॉडल के तहत बेहतर दृश्य प्रदर्शन रखती है। सौंदर्य मूल्यांकन में निश्चित सीमा तक व्यक्तिपरकता होती है, क्योंकि अलग-अलग स्कोरिंग मॉडल के प्रशिक्षण डेटा और सौंदर्य प्राथमिकताओं में अंतर हो सकता है। इसलिए, सौंदर्य स्कोर एक सहायक मापदंड के रूप में अधिक उपयुक्त है और छवि निर्माण गुणवत्ता का एकमात्र प्रतिनिधित्व नहीं कर सकता।
वस्तुनिष्ठ मापदंड पाठ-छवि संगतता, छवि समानता और विशेषता वितरण जैसे पहलुओं से उत्पादन परिणामों का मूल्यांकन कर सकते हैं, लेकिन ये मापदंड छवियों के वास्तविक दृश्य प्रभावों को पूरी तरह से प्रतिबिंबित नहीं कर सकते। इसलिए, छवि निर्माण कार्यों में, आमतौर पर मानव मूल्यांकन को जोड़ने की भी आवश्यकता होती है ताकि मानव दृश्य धारणा और वास्तविक उपयोग आवश्यकताओं के दृष्टिकोण से उत्पादित छवियों की गुणवत्ता का निर्धारण किया जा सके।
मानव मूल्यांकन निम्नलिखित पहलुओं पर ध्यान केंद्रित कर सकता है:
व्यक्तिगत व्यक्तिपरक निर्णयों से होने वाले अंतर को कम करने के लिए, पहले से एकीकृत स्कोरिंग मानदंड निर्धारित किए जा सकते हैं, और कई मूल्यांकनकर्ता अलग-अलग मूल्यांकन कर सकते हैं। व्यक्तिपरक मूल्यांकन स्वचालित मापदंडों द्वारा प्रतिबिंबित करने में कठिन दृश्य समस्याओं को खोज सकता है। इसलिए, वास्तविक छवि निर्माण मूल्यांकन में, आमतौर पर मॉडल के उत्पादन प्रदर्शन का अधिक व्यापक रूप से निर्धारण करने के लिए वस्तुनिष्ठ मापदंडों और व्यक्तिपरक मूल्यांकन का संयोजन किया जाता है।
वीडियो निर्माण मॉडलों को पाठ, छवियों जैसे इनपुट के आधार पर निरंतर वीडियो सामग्री उत्पन्न करने की आवश्यकता होती है। छवि निर्माण के विपरीत, वीडियो को न केवल एकल फ्रेम की गुणवत्ता सुनिश्चित करनी होती है, बल्कि विभिन्न फ्रेमों के बीच निरंतरता, गतिविधि युक्तता और उत्पादित सामग्री और इनपुट शर्तों के बीच संगतता पर भी ध्यान देना होता है। इसलिए, वीडियो निर्माण मॉडलों को आमतौर पर पाठ-वीडियो संगतता, समग्र वीडियो गुणवत्ता, कालक्रमिक निरंतरता, गतिविधि गुणवत्ता और व्यक्तिपरक देखने के अनुभव सहित कई पहलुओं से व्यापक रूप से मूल्यांकन करने की आवश्यकता होती है।
पाठ से छवि कार्यों के समान, पाठ से वीडियो कार्यों को भी उत्पादित सामग्री और इनपुट पाठ के बीच अर्थपूर्ण संगतता का मूल्यांकन करने की आवश्यकता होती है। अंतर यह है कि वीडियो निरंतर वीडियो फ्रेमों से बना होता है, जिसके लिए पूरे वीडियो सामग्री और पाठ विवरण के बीच मिलान डिग्री पर आगे विचार करने की आवश्यकता होती है। मुख्य विधि उत्पादित वीडियो से कई वीडियो फ्रेम निकालना, CLIP जैसे दृश्य-भाषा मॉडल का उपयोग करके प्रत्येक वीडियो फ्रेम और इनपुट पाठ के बीच अर्थपूर्ण समानता की अलग-अलग गणना करना, फिर कई वीडियो फ्रेमों के परिणामों का औसत निकालना है (आमतौर पर Frame-average CLIP Score कहा जाता है):
$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$
जहाँ $N$ मूल्यांकन में भाग लेने वाले वीडियो फ्रेमों की संख्या दर्शाता है, $\mathbf{v}_{\text{frame}_i}$ $i$वें वीडियो फ्रेम का विशेषता वेक्टर दर्शाता है, $\mathbf{v}_{\text{text}}$ इनपुट पाठ का विशेषता वेक्टर दर्शाता है, और $\operatorname{Similarity}(\cdot, \cdot)$ कोसाइन समानता का उपयोग करता है। अधिक स्कोर दर्शाता है कि वीडियो सामग्री और इनपुट पाठ के बीच अर्थपूर्ण मिलान अधिक है। यह मापदंड मुख्य रूप से स्थिर स्थानिक सामग्री और पाठ के मिलान पर ध्यान केंद्रित करता है और वीडियो में गतिविधि निरंतरता और भौतिक कालक्रमिक तर्क को पूरी तरह से प्रतिबिंबित नहीं कर सकता, इसलिए इसे कालक्रमिक निरंतरता और गतिविधि गुणवत्ता जैसे मापदंडों के साथ व्यापक मापन के लिए संयोजित करने की आवश्यकता है।
फ्रेशे वीडियो दूरी (Fréchet Video Distance, FVD) वीडियो निर्माण कार्यों में उत्पादन वितरण गुणवत्ता को मापने के लिए एक मूल मापदंड है, जो उत्पादित वीडियो सेट और वास्तविक वीडियो सेट के बीच गहन विशेषता वितरण में अंतर को मापने के लिए उपयोग किया जाता है। FVD की गणना करते समय, पहले वास्तविक और उत्पादित वीडियो की गहन विशेषताएं निकाली जाती हैं, दो विशेषता समूहों के गौसियन वितरण पैरामीटर (औसत और सह-प्रकीर्णता मैट्रिक्स) की गणना की जाती है, और उनकी फ्रेशे दूरी की गणना की जाती है: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$
जहाँ $\mu_r$ और $\Sigma_r$ क्रमशः वास्तविक वीडियो विशेषताओं के औसत वेक्टर और सह-प्रकीर्णता मैट्रिक्स, $\mu_g$ और $\Sigma_g$ क्रमशः उत्पादित वीडियो विशेषताओं के औसत वेक्टर और सह-प्रकीर्णता मैट्रिक्स, और $\operatorname{Tr}(\cdot)$ मैट्रिक्स का अनुरेख दर्शाता है। कम FWD मान दर्शाते हैं कि उत्पादित वीडियो का विशेषता वितरण वास्तविक वीडियो के करीब है, जो दृश्य निष्ठा, कालक्रमिक युक्तता और नमूना विविधता में मॉडल के समग्र प्रदर्शन के बेहतर होने का संकेत देता है।
कालक्रमिक निरंतरता मुख्य रूप से उत्पादित वीडियो की समय आयाम में स्थिरता का मूल्यांकन करने के लिए उपयोग की जाती है। वीडियो निरंतर फ्रेमों से बना होता है, जिसके लिए न केवल प्रत्येक फ्रेम की अच्छी छवि गुणवत्ता, बल्कि निरंतर फ्रेमों के बीच विषय की उपस्थिति, पृष्ठभूमि बनावट, रंग और शैली के सहज संक्रमण की भी आवश्यकता होती है। उदाहरण के लिए, व्यक्ति निर्माण परिदृश्यों में, यदि चेहरे की विशेषताएं या कपड़ों की बनावट फ्रेमों के बीच बार-बार टिमटिमाती या विकृत होती हैं, तो भले ही एकल फ्रेम की गुणवत्ता उच्च हो, देखने का अनुभव बहुत प्रभावित होगा। वास्तविक मूल्यांकन में, एक सामान्य विधि छवि विशेषता निष्कर्षण नेटवर्क का उपयोग करके निरंतर फ्रेमों के प्रतिनिधित्व प्राप्त करना और पड़ोसी फ्रेम विशेषताओं के बीच कोसाइन समानता का औसत निकालना है। $N$ वीडियो फ्रेम वाले वीडियो के लिए, इसकी कालक्रमिक निरंतरता $TC$ इस प्रकार व्यक्त की जा सकती है:
$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$
जहाँ $\mathbf{f}_i$ और $\mathbf{f}_{i+1}$ क्रमशः $i$वें और $(i+1)$वें फ्रेम के दृश्य विशेषता वेक्टर, और $N$ नमूना लिए गए फ्रेमों की कुल संख्या है। आमतौर पर, अधिक $TC$ स्कोर दर्शाते हैं कि पड़ोसी फ्रेमों के बीच दृश्य कूद छोटे हैं और फ्रेम अधिक स्थिर हैं। कालक्रमिक निरंतरता निरपेक्ष रूप से अधिक बेहतर नहीं है: जब मॉडल विकृत होता है और लगभग पूरी तरह से स्थिर फ्रेम उत्पन्न करता है, तो $TC$ भी असामान्य रूप से ऊंचा होगा। कालक्रमिक निरंतरता को गतिशीलता डिग्री और गतिविधि आयाम जैसे मापदंडों के साथ संयुक्त निर्णय के लिए संयोजित करना चाहिए।
वीडियो निर्माण मॉडलों को न केवल छवि टिमटिमाने से बचना होता है, बल्कि यह भी सुनिश्चित करना होता है कि विषयों की गतिविधि पथ निरंतर और प्राकृतिक हों, स्थानीय अंग उत्परिवर्तन और तत्काल विस्थापन जैसी भौतिक सामान्य ज्ञान के अनुरूप न होने वाली घटनाओं से बचें। गतिविधि चिकनाई मुख्य रूप से समय श्रृंखला में गति और त्वरण में बदलाव की नियमितता को मापने के लिए उपयोग की जाती है। विशिष्ट गणना में, आमतौर पर RAFT जैसे पूर्व-प्रशिक्षित ऑप्टिकल फ्लो अनुमान मॉडल का उपयोग करके पड़ोसी फ्रेमों के बीच घना ऑप्टिकल फ्लो क्षेत्र या गतिविधि वेक्टर निकाले जाते हैं। मान लें कि $t$ फ्रेम से $(t+1)$ फ्रेम तक का गतिविधि वेक्टर (या औसत ऑप्टिकल फ्लो) $\mathbf{v}_t$ है, तो पड़ोसी समय अवधि के गतिविधि वेक्टरों के अंतर से गतिविधि परिवर्तन त्रुटि $E_{\text{motion}}$ को परिभाषित किया जा सकता है:
$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$
जहाँ $\mathbf{v}_t$ $t$ चरण में गतिविधि अवस्था को दर्शाता है। छोटा $E_{\text{motion}}$ कम गतिविधि त्वरण बदलाव और अधिक सहज क्रिया संक्रमण दर्शाता है।
चूंकि किसी एक मापदंड के लिए वीडियो निर्माण मॉडलों की क्षमताओं को पूरी तरह से प्रतिबिंबित करना कठिन है, इसलिए अब VBench जैसे व्यापक मूल्यांकन ढांचों का उपयोग वीडियो निर्माण मॉडलों के बहु-आयामी मूल्यांकन के लिए किया जा सकता है। VBench वीडियो निर्माण गुणवत्ता को कई मूल्यांकन आयामों में विभाजित करता है, जैसे विषय संगतता, पृष्ठभूमि संगतता, गतिविधि चिकनाई, गतिशीलता डिग्री, सौंदर्य गुणवत्ता और छवि गुणवत्ता। CLIP Score और FVD जैसे एकल मापदंडों की तुलना में, VBench का लाभ यह है कि यह छवि गुणवत्ता, कालक्रमिक स्थिरता, गतिविधि प्रदर्शन और शर्त संगतता सहित कई कोणों से वीडियो निर्माण प्रदर्शन का विश्लेषण कर सकता है, जो विभिन्न वीडियो निर्माण मॉडलों के बीच व्यापक क्षमता तुलना के लिए अधिक उपयुक्त है।
बड़े भाषा मॉडल के आउटपुट में मजबूत खुलापन होता है, और एक ही प्रश्न के कई उचित उत्तर दृष्टिकोण हो सकते हैं। केवल स्वचालित मापदंडों पर भरोसा करके यह पूरी तरह से निर्धारित करना कठिन है कि क्या उत्तर सही हैं और उपयोगकर्ता की आवश्यकताओं को पूरा करते हैं। इसलिए, Fine-Tuning किए गए बड़े भाषा मॉडलों का मूल्यांकन करते समय, मानव मूल्यांकन अभी भी एक महत्वपूर्ण मूल्यांकन विधि है। स्वचालित मापदंडों द्वारा सटीक रूप से मूल्यांकन करना कठिन खुली सामग्री के लिए, अंध परीक्षण या बहु-व्यक्ति स्कोरिंग विधियों को अपनाया जा सकता है। मूल्यांकनकर्ता मॉडल आउटपुट को सटीकता, पूर्णता, प्रासंगिकता, निर्देश अनुसरण, अभिव्यक्ति गुणवत्ता और सुरक्षा सहित पहलुओं से व्यापक रूप से निर्धारित कर सकते हैं।
वास्तविक मूल्यांकन में, पहले से एकीकृत स्कोरिंग मानदंड निर्धारित किए जा सकते हैं, जैसे 1 से 5 के पैमाने पर विभिन्न मूल्यांकन आयामों को स्कोर करना। मॉडल के प्रति मूल्यांकनकर्ताओं के पूर्वाग्रह को कम करने के लिए, मॉडल के नाम और संस्करण छिपाए जा सकते हैं, जिससे मूल्यांकनकर्ता केवल उत्तर सामग्री के आधार पर अंध परीक्षण कर सकते हैं। यदि Fine-Tuning से पहले और बाद में मॉडलों की तुलना कर रहे हैं, तो दोनों मॉडलों के एक ही प्रश्न के उत्तर गुमनाम रूप से प्रदर्शित किए जा सकते हैं, और मूल्यांकनकर्ता बेहतर प्रदर्शन वाले उत्तर का चयन कर सकते हैं।
चूंकि मानव मूल्यांकन में निश्चित सीमा तक व्यक्तिपरकता होती है, महत्वपूर्ण मूल्यांकन के लिए बहु-व्यक्ति स्कोरिंग को भी अपनाया जा सकता है। एक ही सामग्री बैच का कई मूल्यांकनकर्ताओं द्वारा स्वतंत्र रूप से मूल्यांकन किया जाता है, फिर स्कोरिंग परिणामों का सारांश बनाया जाता है। जब विभिन्न मूल्यांकनकर्ताओं के स्कोर में बड़ा अंतर होता है, तो मूल्यांकन परिणामों की एकरूपता और विश्वसनीयता में सुधार के लिए मूल्यांकन मानदंडों के स्पष्ट होने की आगे जांच करना आवश्यक है। यद्यपि मानव मूल्यांकन को अधिक समय और श्रम की आवश्यकता होती है, यह स्वचालित मापदंडों द्वारा प्रतिबिंबित करना कठिन समस्याओं को खोज सकता है। बड़े भाषा मॉडल के Fine-Tuning प्रभाव का मूल्यांकन करते समय, स्वचालित मूल्यांकन और मानव मूल्यांकन को संयोजित किया जा सकता है ताकि यह अधिक व्यापक रूप से निर्धारित किया जा सके कि क्या मॉडल वास्तव में सुधार हुआ है।