AIUnlimited
🌳

أسس الذكاء الاصطناعي

🌱
AI Seeds

Start from zero

🌿
AI Sprouts

Build foundations

🌳
AI Branches

Apply in practice

🏕️
AI Canopy

Go deep

🌲
AI Forest

Master AI

🔨

إتقان الذكاء الاصطناعي

✏️
AI Sketch

Start from zero

🪨
AI Chisel

Build foundations

⚒️
AI Craft

Apply in practice

💎
AI Polish

Go deep

🏆
AI Masterpiece

Master AI

📘

تطبيق الذكاء الاصطناعي

📖
فهم النماذج مفتوحة المصدر

أسس وموارد للنماذج مفتوحة المصدر

🎯
من المشكلة إلى مهمة النموذج

تحويل مشاكل الأعمال إلى مهام نموذجية

⚡
تشغيل نموذجك الأول

شاهد نتائجك الأولى في 30 دقيقة

🔧
التحسين الدقيق والتقييم

حسّن النماذج وقيّم الأداء

🚀
أنظمة التطبيقات

بناء تطبيقات ذكاء اصطناعي واقعية

🎨
الذكاء الاصطناعي التوليدي

استكشف نماذج AIGC مفتوحة المصدر

🤖
الوكيل

تعلم أطر عمل الوكيل وأدوات MCP

📐
أسس تكميلية

أساسيات LLM والتقييم

🎓

أكاديمية كلاود

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

المختبر

تم تحميل 7 تجارب
🧬ملعب الشبكة العصبية🤖ذكاء اصطناعي أم إنسان؟🥋دوجو التوجيهات🏁سباق الخوارزميات🧠مسابقة معلومات الذكاء الاصطناعي🏗️لوحة تصميم النظام
🎯مقابلة تجريبيةدخول المختبر→
🚀

التطوير المهني

🚀
منصة انطلاق المقابلات

ابدأ رحلتك

🌟
إتقان المقابلات السلوكية

أتقن المهارات الشخصية

💻
المقابلات التقنية

تفوّق في جولة البرمجة

🤖
مقابلات الذكاء الاصطناعي وتعلم الآلة

إتقان مقابلات تعلم الآلة

🏆
العرض وما بعده

احصل على أفضل عرض

ابدأ الآن
AIUnlimited

رخصة MIT

沪ICP备18025655号-11

تعلّم

  • أساسيات الذكاء الاصطناعي
  • تطبيق الذكاء الاصطناعي
  • أكاديمية كلاود
  • المختبر
  • التطوير المهني

المجتمع

  • عن المنصة
  • الأسئلة الشائعة

الدعم

  • footer.terms
  • footer.privacy
  • footer.contact
البرامج الأكاديمية للذكاء الاصطناعي والهندسة›🔧 التحسين الدقيق والتقييم›الدروس›Evaluating Fine-Tuned Models
📏
التحسين الدقيق والتقييم • مبتدئ⏱️ 25 دقيقة للقراءة

Evaluating Fine-Tuned Models

هل التموين فعّال؟ اختبر لتعرف!

بعد الانتهاء من تموين النموذج، لا يزال يجب تقييمه للتحقق مما إذا كان قد حقق الفعالية المتوقعة. نظرًا لاختلاف أهداف المهام المختلفة، تختلف أيضًا الأساليب المستخدمة في التقييم.

على سبيل المثال، تركز مهام التصنيف بشكل أساسي على قدرة النموذج على تحديد الفئة الصحيحة؛ تركز مهام استخراج المعلومات على ما إذا كانت المعلومات المطلوبة مستخرجة بشكل كامل ودقيق؛ تقييم المهام التوليدية يشمل بالإضافة إلى صحة الإجابة اكتمال المحتوى وعلاقته بالسياق؛ يُقيَّم التعرف على الصوت عادةً بمعدل الخطأ؛ وتوليد الصور يتطلب دمج مقاييس تلقائية وتقييم يدوي.

كيفية الاختبار التفصيلية تُعرض في 【قيّم قبل أن تختار: استخدم EvalScope لإنشاء التقرير الأول للنماذج المفتوحة المصدر】، ويناقش هذا الفصل مقاييس التقييم المختلفة لكل نوع من المهام~

مقاييس تقييم مهام التصنيف

يُعد تصنيف النصوص من المهام الأكثر شيوعًا في تموين النموذج، مثل التعرف على النوايا، والتصنيف العاطفي، وتصنيف الأخطاء، وتصنيف المخاطر.

يمكن تقسيم نتائج التنبؤ عمومًا إلى أربع حالات:

  • TP (True Positive): العينة فعليًا إيجابية والنموذج تنبأ بها إيجابية؛
  • TN (True Negative): العينة فعليًا سلبية والنموذج تنبأ بها سلبية؛
  • FP (False Positive): العينة فعليًا سلبية لكن النموذج تنبأ بها إيجابية؛
  • FN (False Negative): العينة فعليًا إيجابية لكن النموذج تنبأ بها سلبية.

الدقة (Accuracy)

تُعبّر الدقة عن نسبة التنبؤات الصحيحة من إجمالي العينات:

\mathrm{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}  

على سبيل المثال، عند اختبار 1000 عنصر بيانات، تنبأ النموذج بشكل صحيح بـ 900 عنصر، بحيث تكون الدقة 90%. تعكس الدقة بشكل مباشر الأداء العام للتصنيف لدى النموذج. ومع ذلك، عندما تختلف أعداد الفئات بشكل كبير، قد يؤدي الاعتماد فقط على الدقة إلى اتخاذ أحكام خاطئة. ففي بيانات التصنيف العاطفي التي تتألف من 1000 عنصر، إذا كانت هناك فقط 20 عنصرًا سلبيًا، وإذا تنبأ النموذج بشكل بسيط بأن جميع البيانات "إيجابية"، يمكن أن تصل الدقة إلى 98%، لكن في الواقع لم يتم التعرف على أي من العناصر السلبية الـ 20. لذلك، في حالة عدم توزان الفئات، عادةً ما يكون من الضروري تقييم النموذج بالتزامن مع Precision و Recall و F1.

الدقة التفصيلية (Precision) ومعدل الاستدعاء (Recall) و F1

تمثّل الدقة التفصيلية (Precision) نسبة البيانات التي تنبأ بها النموذج إيجابية وهي فعليًا إيجابية:

$\mathrm{Precision}=\frac{TP}{TP+FP} $

يُمثل معدل الاستدعاء (Recall) نسبة البيانات المُعلّمة إيجابية التي تم التعرف عليها بنجاح من قبل النموذج:

$`\mathrm=\frac ``

يأخذ درجة F1 بعين الاعتبار كلًا من Precision و Recall. درجة F1 الأعلى تشير عمومًا إلى أن النموذج قد حقق توازنًا جيدًا بين الدقة التفصيلية ومعدل الاستدعاء.

F1 = 2 \times \frac{\mathrm{Precision} \times \mathrm{Recall}}
{\mathrm{Precision} + \mathrm{Recall}}
الدرس 4 من 40٪ مكتمل
←Preference Alignment

مناقشة

تسجيل الدخول للانضمام إلى النقاش

مصفوفة الارتباك (Confusion Matrix)

يمكن تمثيل Accuracy و Precision و Recall و F1 برقم واحد يمثل الأداء العام للنموذج، لكن إذا أردت معرفة الفئات التي يخطئ النموذج في تصنيفها غالبًا، يجب استخدام مصفوفة الارتباك لمزيد من التحليل. ستقوم مصفوفة الارتباك بمقارنة الفئة الحقيقية مع الفئة المتنبأ بها لكل عنصر اختبار، ثم إحصاء توقعات الفئات المختلفة وتنسيق النتائج في مصفوفة.

على سبيل المثال، يحتوي مجموعة الاختبار على ثلاث فئات: أخطاء الشبكة، وأخطاء الأجهزة، وأخطاء البرمجيات، وتُصَف إحصائيات التوقعات كالتالي:

الفئة الحقيقية \ الفئة المتنبأ بهاأخطاء الشبكةأخطاء الأجهزةأخطاء البرمجيات
أخطاء الشبكة4523
أخطاء الأجهزة1472
أخطاء البرمجيات6242

يمثل كل صف الفئة الحقيقية للبيانات، وكل عمود يمثل الفئة المتنبأ بها. الأرقام الموجودة على خط القطر للمصفوفة تمثل عدد التنبؤات الصحيحة، على سبيل المثال، من أصل 50 عنصرًا من بيانات أخطاء الشبكة، تم التعرف على 45 بشكل صحيح؛ الأرقام الموجودة خارج خط القطر تمثل حالات التنبؤ الخاطئ، على سبيل المثال، تم التنبؤ بشكل خاطئ بأن 6 عناصر من أخطاء البرمجيات هي أخطاء شبكة. من مصفوفة الارتباك لا يمكن فقط رؤية عدد البيانات التي تنبأ بها النموذج بشكل صحيح، بل يمكن أيضًا اكتشاف الفئات التي يسهل الخلط بينها. في النتائج أعلاه، كانت التنبؤات الخاطئة لأخطاء البرمجيات على أنها أخطاء شبكة أكثر عددًا، مما يدل على أن قدرة النموذج على تمييز هاتين الفئتين ما زالت بحاجة إلى تحسين. من خلال تحليل هذه الفئات السهلة الالتباس، يمكن اكتشاف مشاكل النموذج بشكل أعمق، وتوفير مرجع لتعزيز بيانات التدريب لاحقًا وتحسين النموذج.

مقاييس تقييم استخراج المعلومات

بالنسبة للمهام مثل التعرف على الكيانات المسمّاة، واستخراج الحقول، واستخراج المعلومات المهيكلة، تتضمن مقاييس التقييم الشائعة دقة الحقل، والدقة على مستوى الكيان، ومعدل الاستدعاء، وF1. تختلف مقاييس التقييم المختلفة في درجة التفصيل التي تركز عليها، ويمكن اختيارها بناءً على المهمة المحددة.

دقة الحقل

تُستخدم دقة الحقل بشكل أساسي لقياس ما إذا كان استخراج النموذج للحقول المحددة صحيحًا، ويتم حسابها كالتالي:

\text{دقة الحقل} =
\frac{\text{عدد الحقول المستخرجة بشكل صحيح}}
{\text{إجمالي الحقول التي تحتاج إلى استخراج}}

بالنسبة للمهام التي تحتوي على حقول متعددة، يمكن حساب دقة كل حقل على حدة. على سبيل المثال، حساب دقة اسم الشركة واسم الشخص بشكل منفصل، مما يساعد على تحليل أي الحقول يكون فيها أداء الاستخراج ضعيفًا. ومع ذلك، يجب ملاحظة أن هذا النهج له عيوبه، حيث لا يمكن تحديد أي الكيانات فاتها النموذج. لذلك، بالنسبة لمهام استخراج المعلومات التي تحتوي على كيانات متعددة، يجب استخدام الدقة على مستوى الكيان ومعدل الاستدعاء وF1 للتقييم بشكل أكثر تفصيلاً.

Precision و Recall و F1 على مستوى الكيان

بالنسبة لمهمة التعرف على الكيانات المسمّاة (NER)، يتم تقييم الأداء باستخدام الدقة على مستوى الكيان ومعدل الاستدعاء وF1، وهذا مشابه لمقاييس تقييم التصنيف التي ناقشناها في القسم السابق.

حيث:

  • TP (True Positive): الكيانات التي تعرف عليها النموذج بشكل صحيح؛
  • FP (False Positive): الكيانات التي تعرف عليها النموذج لكن بشكل خاطئ؛
  • FN (False Negative): الكيانات الموجودة في الإجابة المعيارية لكن النموذج لم يتعرف عليها.

تُستخدم الدقة التفصيلية (Precision) لقياس نسبة الكيانات الصحيحة من مجموع الكيانات التي تعرف عليها النموذج:

Precision = \frac{TP}{TP + FP}

يُستخدم معدل الاستدعاء (Recall) لقياس نسبة الكيانات التي تعرف عليها النموذج بنجاح من مجموع الكيانات الموجودة في الإجابة المعيارية:

Recall = \frac{TP}{TP + FN}

تجمع F1 بين الدقة التفصيلية ومعدل الاستدعاء:

F1 =
\frac{2 \times Precision \times Recall}
{Precision + Recall}

تشير الدقة التفصيلية العالية إلى أن الكيانات التي تعرف عليها النموذج دقيقة بشكل عام؛ ويشير معدل الاستدعاء العالي إلى أن النموذج فاتته كيانات قليلة؛ أما F1 فتُستخدم لقياس الأداء الشامل لكلا الجانبين.

مقاييس تقييم المهام التوليدية

على عكس مهام التصنيف واستخراج المعلومات، عادةً ما يكون لمحتوى النماذج اللغوية الكبيرة طابع انفتاحي قوي، ولا توجد إجابة معيارية واحدة للoutput. تتطلب هذه المهام التقييم من أوجه متعددة تشمل الصحة والاكتمال والعلاقة بالسياق والامتثال للتنسيق والهلوسة.

الصحة

تركز الصحة بشكل أساسي على ما إذا كان المحتوى الذي أنشأه النموذج صحيحًا أم لا، بما في ذلك صحة الحقائق والاستنتاجات ونتائج الاستدلال. بالنسبة للنموذج المُموَّن، حتى لو كانت اللغة سلسة والتنسيق كاملًا، إذا تضمن حقائق أو استنتاجات خاطئة، فلا يمكن اعتبار أن النموذج قد حقق أداء توليديًا جيدًا. تُعد الصحة عادةً من أبسط المتطلبات في تقييم نتائج التوليد.

الاكتمال

يُركز الاكتمال بشكل أساسي على ما إذا كان النموذج قد أجاب عن السؤال بشكل كافٍ، وما إذا كان قد فاتته معلومات مهمة يجب أن تتضمنها الإجابة. بعض الإجابات قد لا تحتوي على أخطاء واضحة في المحتوى، لكنها تجيب فقط عن جزء من السؤال وتُهمّل المحتوى الأساسي. في هذه الحالة، تكون الإجابة صحيحة بشكل نسبي، لكنها تفتقر إلى الاكتمال. يهتم الاكتمال ليس فقط بصحة الإجابة، بل أيضًا بالتحقق مما إذا كان كل المحتوى المطلوب قد تم الإجابة عنه.

العلاقة بالسياق

تركز العلاقة بالسياق على ما إذا كان المحتوى الذي أنشأه النموذج يتبع مشكلة المستخدم. قد تولد النماذج اللغوية الكبيرة أحيانًا كميات كبيرة من المحتوى الذي يبدو معقولًا لكنه غير ذي صلة كبير بالمسألة. على الرغم من أن هذا المحتوى قد لا يحتوي على أخطاء في حد ذاته، إلا أنه يقلل من فعالية الإجابة. يجب أن تتبع الإجابة الجيدة سؤال المستخدم مباشرة، وتقليل المحتوى غير الضروري أو المكرر أو الموسّع بشكل مفرط.

الامتثال للتنسيق

في التطبيقات العملية، بالإضافة إلى محتوى الإجابة نفسه، عادةً ما يحتاج النموذج إلى output بتنسيق محدد. على سبيل المثال، يُطلب من النموذج إرجاع النتائج بتنسيق JSON، أو تنظيم المحتوى وفقًا للحقول والترتيب والهيكل المحدد. يُقيّم الامتثال للتنسيق ما إذا كان النموذج ينتج المحتوى وفقًا لمتطلبات الإخراج المحددة. حتى لو كان محتوى الإجابة صحيحًا، إذا لم يتم الإخراج بالتنسيق المحدد، فقد يؤدي ذلك إلى عدم قدرة البرامج اللاحقة على التحليل والاستخدام بشكل صحيح. بالنسبة للنماذج التي تمت تموينها بالتعليمات أو التي لها متطلبات إخراج ثابتة، يُعد الامتثال للتنسيق أيضًا من أبعاد التقييم المهمة.

الهلوسة

تُشير الهلوسة (Hallucination) إلى المحتوى الذي ينتجه النموذج وهو خالٍ من الأدلة أو غير متوافق مع الحقائق أو مختلق من العدم. عندما لا يعرف النموذج معلومة معينة، بدلاً من الإشارة إلى عدم كفاية المعلومات، ينتج حقيقة تبدو معقولة لكنها غير موجودة في الواقع، وهذا يُعد مشكلة هلوسة نموذجية.

للهلوسة صلة بالصحة، لكن التركيز يختلف بينهما. تركز الصحة على صحة محتوى الإجابة، بينما تركز الهلوسة بشكل أكبر على ما إذا كان النموذج قد أنتج معلومات غير موثوقة. بالنسبة للأسئلة والمعرفة التي تتطلب أعلى درجات الموثوقية في الحقائق، يجب التركيز بشكل كبير على حالة الهلوسة في النموذج.

مقاييس التعرف على الصوت

تتطلب مهمة التعرف على الصوت (ASR) عادةً التقييم من زاويتين: دقة التعرف وكفاءة المعالجة. تُستخدم CER و WER لقياس حالة الأخطاء في نتائج التعرف، بينما يُستخدم RTF لسرعة معالجة النموذج للصوت.

قبل تقديم CER و WER، دعنا نوضح بعض الرموز المستخدمة بشكل شائع في حساب معدل خطأ التعرف على الصوت:

  • S (Substitution): خطأ الاستبدال، التعرف على حرف أو كلمة صحيحة بشكل خاطئ؛
  • D (Deletion): خطأ الحذف، عدم التعرف على حرف أو كلمة كان يجب التعرف عليها؛
  • I (Insertion): خطأ الإدراج، التعرف بشكل إضافي على حرف أو كلمة غير موجودة في النص؛
  • N: إجمالي الأحرف أو الكلمات في النص المعياري.

تستند CER و WER إلى هذه الأنواع من الأخطاء في الحساب، والفرق الرئيسي بينهما هو وحدات الإحصال المختلفة المستخدمة.

CER: معدل خطأ الحرف

يقيس CER (Character Error Rate، معدل خطأ الحرف) الفرق بين نتائج التعرف على الصوت والنص المعياري بوحدة الحرف، وصيغة الحساب كالتالي:

CER = \frac{S + D + I}{N}

كلما كان CER أقل، يُشير عادةً إلى أن نتائج التعرف على الصوت أكثر دقة. بالنسبة لمهمة التعرف على الصوت الصيني، يُعد CER من مقاييس التقييم الأكثر استخدامًا.

WER: معدل خطأ الكلمة

يكون حساب WER (Word Error Rate، معدل خطأ الكلمة) مشابهًا بشكل أساسي لحساب CER:

WER = \frac{S + D + I}{N}

يستخدم CER الحرف كوحدة أساسية، بينما يستخدم WER الكلمة كوحدة أساسية، ويُستخدم بشكل أكبر في مهام التعرف على الصوت باللغات مثل الإنجليزية التي تستخدم الكلمة كوحدة لغوية أساسية.

RTF: العامل الزمني الحقيقي

بشكل إضافة إلى دقة نتائج التعرف، يجب مراعاة سرعة المعالجة عند نشر نموذج التعرف على الصوت عمليًا. يُعد RTF (Real-Time Factor، العامل الزمني الحقيقي) من المقاييس الشائعة لقياس كفاءة معالجة التعرف على الصوت، وصيغة الحساب كالتالي:

RTF =
\frac{\text{وقت معالجة النموذج}}
{\text{مدة الصوت}}

على سبيل المثال، إذا كانت مقطع صوت مدته 10 ثوانٍ يحتاج 5 ثوانٍ لإتمام التعرف، يكون:

RTF = \frac{5}{10} = 0.5

كلما كان RTF أقل، يُشير إلى أن سرعة معالجة النموذج أسرع. عندما يكون RTF أقل من 1، يُشير إلى أن سرعة معالجة النموذج أسرع من سرعة تشغيل الصوت الفعلية، مما يوفر الشرط الأساسي للمعالجة في الوقت الحقيقي.

بالإضافة إلى مقاييس مثل CER و WER و RTF، يمكن أيضًا تقييم النموذج في بيئات اختبار مختلفة. على سبيل المثال، حساب CER أو WER في ظل ظروف مثل الضوضاء الخلفية، واللكنات المختلفة، والتسجيل عن بُعد، وتحدث عدة أشخاص، ومن خلال مقارنة معدل الخطأ في سيناريوهات مختلفة، يمكن تقييم قدرة النموذج على التعرف والاستقرار في بيئات معقدة بشكل أكبر.

مقاييس تقييم تحويل النص إلى كلام

يهدف تحويل النص إلى كلام (Text-to-Speech، TTS) إلى تحويل النص المُدخَل إلى صوت طبيعي وواضح. على عكس نماذج توليد النص، تتطلب نماذج TTS ليس فقط ضمان تطابق المحتوى المُنتَج مع النص المُدخَل، بل أيضًا الاهتمام بطبيعة الصوت ولون الصوت وسرعة التوليد. عادةً ما تُقيَّم نماذج TTS من جوانب تشمل دقة المحتوى، وطبيعة الصوت، والتشابه بين المتحدثين، وأداء الاستدلال.

دقة المحتوى

يحتاج TTS أولًا إلى ضمان قراءة النص المُدخَل بشكل صحيح، وتجنب مشاكل مثل القراءة الخاطئة أو نسيان أجزاء أو التكرار. أثناء التقييم، يمكن استخدام نموذج ASR لإعادة تحويل الصوت الذي أنشأه TTS إلى نص، ثم مقارنة نتائج التعرف مع النص المُدخَل الأصلي. تتوافق مقاييس دقة المحتوى مع المقاييس في فصل ASR السابق، أي حساب CER و WER.

طبيعة الصوت

بالإضافة إلى القراءة الصحيحة للنص، يحتاج الصوت الذي يولده TTS أيضًا إلى أن يتمتع بطبيعة جيدة، مثل معقولية سرعة الكلام، والوقوف الطبيعي، وسلاسة النبرة، وغياب الإحساس الآلي الواضح. عادةً ما يُستخدم متوسط درجة الرأي (Mean Opinion Score، MOS). أثناء التقييم، يستمع العديد من المختبرين إلى الصوت المُنتَج ويمنحون درجات بناءً على معايير تقييم محددة، وتُستخدم عادةً مقياس من 1 إلى 5، حيث تُشير الدرجة 1 إلى جودة صوت سيئة، والدرجة 5 إلى صوت طبيعي وسريع يقترب من الصوت البشري.

يمكن التعبير عن MOS نهائيًا كالتالي:

MOS = \frac{1}{M}\sum_{i=1}^{M}s_i

حيث يُمثل $M$ عدد الأشخاص المشاركين في التقييم، و$s_i$ يُمثل الدرجة التي منحها المُقيّم رقم $i$.

يعكس MOS بشكل مباشر الإحساس الحقيقي للمستخدم بالصوت المُنتَج، لكنه يعتمد على الاستماع البشري، مما يجعل تكلفته عالية نسبيًا، بالإضافة إلى أنه يحتوي على عنصر ذاتية معين.

التشابه بين المتحدثين

بالنسبة لنماذج استنساخ الصوت، وTTS متعدد المتحدثين، أو TTS بدون أمثلة، لا يكفي ضمان طبيعة الصوت فحسب، بل يجب أيضًا تقييم ما إذا كان الصوت المُنتَج يحافظ على خصائص لون الصوت للمتحدث المستهدف. الطريقة الشائعة هي استخدام نموذج التعرف على المتحدثين لاستخراج تضمين المتحدث (Speaker Embedding) لكل من الصوت المرجعي والمُنتَج بشكل منفصل، ثم حساب التشابه الزاوي بين المتجهين:

SIM =
\frac{
\mathbf{e}{ref} \cdot \mathbf{e}{gen}
}{
|\mathbf{e}{ref}| |\mathbf{e}{gen}|
}

حيث يُمثل $\mathbf{e}{ref}$ متجه المتحدث للصوت المرجعي، و$\mathbf{e}{gen}$ يُمثل متجه المتحدث للصوت المُنتَج.

كلما كان SIM أعلى، يُشير إلى أن الصوت المُنتَج أقرب في خصائص لون الصوت إلى المتحدث المرجعي. يُعد هذا المقياس مناسبًا بشكل خاص لتقييم أداء نماذج استنساخ الصوت.

العامل الزمني الحقيقي

في أداء الاستدلال، يكون TTS مشابهًا لنماذج التعرف على الصوت، ويمكن استخدام RTF لقياس كفاءة المعالجة لدى النموذج. الفرق الرئيسي هو أن RTF في التعرف على الصوت يُمثل عادةً نسبة وقت التعرف إلى مدة الصوت المُدخَل، بينما في TTS يُمثل نسبة وقت توليد الصوت إلى مدة الصوت المُنتَج. كلما كان RTF أقل، يُشير إلى كفاءة أعلى في توليد الصوت.

صيغة حساب RTF كالتالي:

RTF =
\frac{T_{infer}}{T_{audio}}

حيث يُمثل $T_{infer}$ وقت الاستدلال اللازم لتوليد الصوت، و$T_{audio}$ يُمثل مدة الصوت المُنتَج في النهاية.

بالنسبة لنماذج TTS التدريجية، يمكن أيضًا الاهتمام بتأخير الحزمة الأولى (Time to First Audio)، أي الوقت المنقضي من استلام النموذج لطلب النص إلى إخراج أول قسم يمكن تشغيله من الصوت. كلما كان تأخير الحزمة الأولى أقل، استمع المستخدم إلى الصوت المُنتَج أسرع، ولذلك يُعد هذا المقياس مهمًا بشكل خاص لسيناريوهات التفاعل الصوتي في الوقت الحقيقي.

التقييم الموضوعي لتوليد الصور

بالنسبة للمهام مثل توليد الصور من النص، وتوليد الصور من الصور، وتحرير الصور، من الصعب تقييم نتائج التوليد بشكل شامل من خلال مقياس واحد. على سبيل المثال، يتطلب توليد الصور من النص تحديد ما إذا كانت الصورة المُنتَجة تطابق الوصف النصي، كما يحتاج تحرير الصور إلى تحديد ما إذا كانت النتيجة المُنتَجة تحتفظ بال SUBJECT والهيكل في الصورة الأصلية، كما يجب عند تقييم الأداء العام لنموذج توليد الصور مراعاة جودة الصورة المُنتَجة ومصداقيتها.

التطابق بين الصورة والنص

بالنسبة لمهمة توليد الصور من النص، يجب أولًا تحديد ما إذا كانت الصورة المُنتَجة تطابق الوصف النصي المُدخَل. على سبيل المثال، إذا طلب PROMPT إنشاء SUBJECT أو مشهد أو أسلوب محدد، يجب أن تحتوي الصورة التي ينشئها النموذج على هذه المحتويات قدر الإمكان.

إحدى طرق التقييم الشائعة هي استخدام نماذج اللغة البصرية مثل CLIP لربط النص والصورة في مساحة ميزات مشتركة، ثم حساب درجة التشابه بينهما. أُطلق CLIP بواسطة Radford وآخرين في عام 2021، وعن طريق تدريب مجموعة بيانات ضخمة من "الصور-النصوص"، تعلّم النموذج العلاقة التوافقية بين محتوى الصورة واللغة الطبيعية، ويمكن التعبير عن التشابه الزاوي بين الصورة والنص كالتالي:

Similarity =
\frac{\mathbf{v}{image}\cdot\mathbf{v}{text}}
{|\mathbf{v}{image}||\mathbf{v}{text}|}

حيث,

\mathbf{v}{image} 

يُمثل متجه ميزات الصورة،

\mathbf{v}{text} 

يُمثل متجه ميزات النص. في الأحوال العادية، كلما ارتفعت درجة التشابه، يُشير إلى أن الصورة والنص أقرب من الناحية الدلالية العامة. تُقيّم هذه الطريقة بشكل أساسي ما إذا كانت الدلالات العامة متطابقة، ولا تضمن إنشاء جميع التفاصيل في النص بدقة. على سبيل المثال، تحديد ما إذا كانت الكمية والموقع والتفاصيل في الصورة دقيقة.

تشابه الصور

بالنسبة لمهام توليد الصور من الصور وتحرير الصور، عادةً ما يتم توفير صورة أصلية أو صورة مرجعية. تتطلب هذه المهام ليس فقط تحديد ما إذا كانت النتيجة المُنتَجة تلبي متطلبات النص، بل أيضًا الاهتمام بما إذا كانت المحتويات الهامة في الصورة الأصلية قد تم الاحتفاظ بها بشكل صحيح.

على سبيل المثال، في تحرير صور المنتجات، يمكن تغيير الخلفية والإضاءة أو الأسلوب العام، لكنه عادةً ما يتوقع الحفاظ على Subject الرئيسي للمنتج، والهيكل الخارجي، والشعارات وغيرها من المعلومات المهمة بشكل متسق. في هذه الحالة، يمكن تقييم نجاح التحرير عن طريق مقارنة الفروق بين الصورة المُنتَجة والصورة المرجعية.

يُعد SSIM (Structural Similarity Index، مؤشر التشابه الهيكلي) من طرق تقييم جودة الصورة المرجعية الكلاسيكية، وقد أُطلق بواسطة Wang وآخرين في عام 2004. يقارن بشكل أساسي بين صورتين من حيث السطوع والتباين والهيكل، مع التركيز بشكل خاص على ما إذا كانت معلومات هيكل الصورة قد تغيرت.

بالإضافة إلى SSIM، يمكن استخدام LPIPS (Learned Perceptual Image Patch Similarity) لقياس الفرق الإدراكي بين صورتين. يستخدم LPIPS شبكة عصبية عميقة لاستخراج ميزات الصورة، ثم يحكم على الفروقات البصرية بين الصورتين بناءً على المسافة بين الميزات. تشير الدراسات ذات الصلة إلى أن الميزات العميقة تعكس بشكل جيد إدراك الأشخاص لتشابه الصور. على الرغم من أن SSIM و LPIPS كلاهما يتطلبان صورة مرجعية، إلا أن الزاوية التي يركّز عليها لا تتطابق تمامًا: يركز SSIM بشكل أكبر على تغييرات هيكل الصورة، بينما يركز LPIPS بشكل أكبر على الفروقات على مستوى الإدراك البصري. في المهام العملية، يمكن اختيار المقياس المناسب بناءً على أهداف تحرير الصور.

بالنسبة للمهام التي تتضمن صورًا مرجعية مثل تحرير الصور وتوليد الصور من الصور، يمكن حساب درجة التشابه بين الصورة المُنتَجة والصورة المرجعية.

FID

المقياس السابق مخصص بشكل أساسي لمقارنة العلاقة بين صورة واحدة مُنتَجة والنص أو الصورة المرجعية. إذا كنت ترغب في تقييم الأداء العام لنموذج توليد الصور، عادةً ما تحتاج إلى تحليل إحصائي لمجموعة من الصور المُنتَجة.

أُطلق FID (Fréchet Inception Distance) بواسطة Heusel وآخرين في عام 2017، ويُستخدم بشكل أساسي لقياس الفرق في توزيع الميزات بين الصور المُنتَجة والصور الحقيقية، FID. يستخدم FID أولًا نموذج الصور لاستخراج ميزات الصور الحقيقية والمُنتَجة، ثم يحسب توزيع الميزات لمجموعتي البيانات بشكل منفصل، ويحسب المسافة بين التوزيعين. صيغته الأساسية كالتالي:

FID =
|\mu_r-\mu_g|_2^2
+
Tr\left(
\Sigma_r+\Sigma_g
-2(\Sigma_r\Sigma_g)^{1/2}
\right)

حيث يُمثل $\mu_r$ و $\Sigma_r$ المتوسط ومصفوفة التباين المشترك لميزات الصور الحقيقية، و$\mu_g$ و $\Sigma_g$ يُمثلان المتوسط ومصفوفة التباين المشترك لميزات الصور المُنتَجة. لا يقارن FID بين صورتين محددين، بل يقارن الفروقات في توزيع الميزات لمجموعتين من الصور. كلما كان FID أقل، يُشير إلى أن توزيع ميزات الصور المُنتَجة أقرب إلى الصور الحقيقية، مما يجعله مناسبًا بشكل خاص لمقارنة الأداء العام بين النماذج المختلفة.

الدرجة الجمالية

بالإضافة إلى تقييم ما إذا كانت الصورة تطابق الوصف النصي، يمكن أيضًا التقييم التلقائي للصورة المُنتَجة من منظور التأثيرات البصرية. عادةً ما تُستخدم الدرجة الجمالية (Aesthetic Score) لتدريب نموذج التقييم باستخدام بيانات تتضمن تقييمات جمالية أو تفضيلات بشرية، مما يتيح للنموذج تعلم تفضيلات الأشخاص لجودة الصورة البصرية، ثم تقييم الصورة المُنتَجة تلقائيًا.

تعكس هذه الطريقة عادةً بشكل شامل سمات الصورة مثل التكوين والألوان والإضاءة والوضوح والجاذبية البصرية العامة. كلما ارتفعت الدرجة، يُشير عادةً إلى أن الصورة تتمتع بأداء بصري أفضل في نموذج التقييم المستخدم. تتمتع التقييمات الجمالية بدرجة معينة من الذاتية، وقد تختلف البيانات التدريبية وتفضيلات الجمال بين نماذج التقييم المختلفة، لذلك تُعد الدرجة الجمالية أكثر ملاءمة كمساعد تقييم، ولا يمكن تمثيلها بمفردها لجودة توليد الصور.

التقييم الذاتي لتوليد الصور

يمكن للمقاييس الموضوعية تقييم نتائج التوليد من حيث التطابق بين الصورة والنص وتشابه الصور وتوزيع الميزات، لكن هذه المقاييس لا تعكس بالكامل التأثير البصري الفعلي للصورة. لذلك، في مهام توليد الصور، عادةً ما يكون من الضروري الجمع بين التقييم الذاتي وتحكيم الأشخاص ل judge جودة الصورة المُنتَجة بناءً على الإحساس البصري ومتطلبات الاستخدام الفعلية.

يركّز التقييم الذاتي بشكل أساسي على الجوانب التالية:

  • تطابق المحتوى: ما إذا كانت الصورة المُنتَجة تطابق الوصف النصي أو متطلبات التحرير المُدخَلة؛
  • الجودة البصرية: ما إذا كانت الصورة واضحة وطبيعية، وما إذا كانت هناك تشوهات أو تشويش أو أخطاء هيكلية واضحة؛
  • تطابق SUBJECT: بالنسبة لمهام توليد الصور من الصور وتحرير الصور، ما إذا كانت الشخصيات والمنتجات والكائنات الرئيسية تتطابق مع الصورة المرجعية؛
  • جودة التفاصيل: ما إذا كانت Areas مثل أيد الشخصيات والنصوص والشعارات والحواف—which يسهل حدوث أخطاء فيها—طبيعية؛
  • الصلاحية العملية: ما إذا كانت النتيجة المُنتَجة قابلة للاستخدام مباشرة في سيناريوهات العمل الفعلية مثل الملصقات وعرض المنتجات.

لتقليل الفروقات الناتجة عن الأحكام الذاتية الفردية، يمكن وضع معايير تقييم موحدة مسبقًا، وتنفيذ التقييم من قبل مقيّمين متعددين بشكل منفصل. يكشف التقييم الذاتي عن المشاكل البصرية التي يصعب على المقاييس التلقائية كشفها، لذلك في تقييم توليد الصور الفعلي، عادةً ما يكون من الضروري الجمع بين المقاييس الموضوعية والتقييم الذاتي لتقييم أداء النموذج بشكل أكثر شمولاً.

تقييم نماذج توليد الفيديو

تتطلب نماذج توليد الفيديو إنشاء محتوى فيديو متسلسل بناءً على النص أو الصور أو مدخلات أخرى. مقارنةً بتوليد الصور، يجب أن يضمن توليد الفيديو ليس فقط جودة الإطارات الفردية، بل أيضًا الاستمرارية بين الإطارات المختلفة، ومعقولية الحركة، وتطابق المحتوى المُنتَج مع شروط الإدخال. لذلك، عادةً ما تتطلب نماذج توليد الفيديو التقييم الشامل من جوانب متعددة تشمل تطابق النص والفيديو، وجودة الفيديو العامة، والاستمرارية الزمنية، وجودة الحركة، والتأثير البصري الذاتي.

تطابق النص والفيديو

بدلاً من ذلك، تمامًا مثل توليد الصور من النص، تتطلب مهمة توليد الفيديو من النص أيضًا تقييم التطابق الدلالي بين المحتوى المُنتَج والنص المُدخَل. الفرق الرئيسي هو أن الفيديو يتكون من إطارات فيديو متسلسلة، مما يعني ضرورة مراعاة مدى تطابق محتوى الفيديو الكامل مع الوصف النصي. الطريقة الرئيسية هي استخراج عدد من إطارات الفيديو من الفيديو المُنتَج، واستخدام نماذج اللغة البصرية مثل CLIP لحساب التشابه الدلالي لكل إطار مع النص المُدخَل، ثم متوسط نتائج إطارات الفيديو المتعددة (ويُعرف غالبًا بمتوسط درجة CLIP):

$\text{CLIP-Score} = \frac{1}{N} \sum_{i=1}^{N} \operatorname{Similarity}(\mathbf{v}_{\text{frame}_i}, \mathbf{v}_{\text{text}})$

حيث يُمثل $N$ عدد إطارات الفيديو المشاركة في التقييم، و$\mathbf{v}_{\text{frame}_i}$ يُمثل متجه ميزات إطار الفيديو رقم $i$، و$\mathbf{v}_{\text{text}}$ يُمثل متجه ميزات النص المُدخَل، و$\operatorname{Similarity}(\cdot, \cdot)$ يستخدم التشابه الزاوي. كلما ارتفعت الدرجة، يُشير إلى أن محتوى صورة الفيديو أكثر تطابقًا دلاليًا مع النص المُدخَل. يركز هذا المقياس بشكل أساسي على تطابق المحتوى المكاني الثابت مع النص، ولا يعكس بالكامل تماسك الأفعال في الفيديو والمنطق الزمني الفيزيائي، لذلك لا يزال من الضروري الجمع بين مقاييس الاستمرارية الزمنية وجودة الحركة ومقاييس أخرى بشكل شامل.

المسافة الفيديوية فريشيه

تُعد المسافة الفيديوية فريشيه (Fréchet Video Distance، FVD) من المقاييس الجوهرية في مهمة توليد الفيديو لقياس جودة التوزيع المُنتَج، وتُستخدم لقياس الفرق في توزيع الميزات العميقة بين مجموعة الفيديو المُنتَجة ومجموعة الفيديو الحقيقي. عند حساب FVD، يتم أولًا استخراج الميزات العميقة للفيديو الحقيقي والمُنتَج، ثم حساب معلمات التوزيع الغاوسي للميزات (المتوسط ومصفوفة التباين المشترك)، ويتم حساب المسافة فريشيه: $\mathrm{FVD} = \|\mu_r - \mu_g\|_2^2 + \operatorname{Tr}\left(\Sigma_r + \Sigma_g - 2\left(\Sigma_r^{1/2} \Sigma_g \Sigma_r^{1/2}\right)^{1/2}\right)$

حيث يُمثل $\mu_r$ و $\Sigma_r$ متجه المتوسط ومصفوفة التباين المشترك لميزات الفيديو الحقيقي، و$\mu_g$ و $\Sigma_g$ يُمثلان متجه المتوسط ومصفوفة التباين المشترك لميزات الفيديو المُنتَج، و$\operatorname{Tr}(\cdot)$ يُمثل أثر المصفوفة. كلما كان FVD أقل، يُشير إلى أن توزيع ميزات الفيديو المُنتَج أقرب إلى الفيديو الحقيقي، مما يدل على أن النموذج يتمتع بأداء شامل أفضل من حيث الدقة البصرية والتناسق الزمني والتنوع في العينات.

الاستمرارية الزمنية

تُستخدم الاستمرارية الزمنية (Temporal Consistency) بشكل أساسي لتقييم استقرار الفيديو المُنتَج في البُعد الزمني. يتكون الفيديو من إطارات متسلسلة، مما يعني ليس فقط تتطلب كل إطار جودة صورة جيدة، بل أيضًا تطلب انتقال سلس للمظهر العام والملمس واللون والأسلوب بين الإطارات المتسلسلة. على سبيل المثال، في سيناريوهات توليد الشخصيات، إذا كانت ملامح الوجه أو نسيج الملابس تتأرجح بشكل متكرر وتتشوه بين الإطارات، حتى لو كانت جودة الإطار الواحد عالية، ستتأثر المظهر العام بشكل كبير. في التقييم الفعلي، إحدى الطرق الشائعة هي استخدام شبكة استخراج ميزات الصور للحصول على تمثيل الإطارات المتسلسلة، ثم حساب متوسط التشابه الزاوي لميزات الإطارات المتجاورة. بالنسبة للفيديو الذي يحتوي على $N$ إطار فيديو، يمكن التعبير عن الاستمرارية الزمنية $TC$ كالتالي:

$TC = \frac{1}{N-1} \sum_{i=1}^{N-1} \frac{\mathbf{f}_i^{\top} \mathbf{f}_{i+1}}{\|\mathbf{f}_i\|_2 \|\mathbf{f}_{i+1}\|_2}$

حيث يُمثل $\mathbf{f}_i$ و $\mathbf{f}_{i+1}$ متجهات الميزات البصرية للإطار رقم $i$ والـ $i+1$ على التوالي، و$N$ هو العدد الإجمالي للإطارات المُ alınة. في الأحوال العادية، كلما ارتفعت درجة $TC$، يُشير إلى أن القفزات البصرية بين الإطارات المتجاورة أصغر والصورة أكثر استقرارًا. لا تكون الاستمرارية الزمنية مرتفعة دائمًا بشكل مطلق: عندما يتأثر النموذج ويُنشئ صورة شبه ثابتة بالكامل، ستكون $TC$ مرتفعة بشكل غير طبيعي أيضًا. يجب الجمع بين الاستمرارية الزمنية ومقاييس مثل درجة الديناميكية ومدى الحركة لتقييم الأداء بشكل شامل.

سلامة الحركة

يجب على نموذج توليد الفيديو ليس فقط تجنب تأرجح الصورة، بل أيضًا ضمان تماسك وطبيعية مسار حركة Subjects، وتجنب ظاهرة التغيرات المفاجئة في الأطراف المحلية أو النقل الفوري—which لا تتوافق مع المبادئ الفيزيائية الأساسية. تُستخدم سلامة الحركة (Motion Smoothness) بشكل أساسي لقياس استقرار تغيرات سرعة الحركة والتسارع على طول السلسلة الزمنية. عند الحساب الفعلي، عادةً ما يتم الاستعانة بنموذج تقدير تدفق الضوء المُدرّب مسبقًا (مثل RAFT) لاستخراج تدفق الضوء الكثيف أو متجهات الحركة بين الإطارات المتجاورة. لنفرض أن متجه الحركة (أو متوسط تدفق الضوء) من الإطار رقم $t$ إلى الإطار رقم $t+1$ هو $\mathbf{v}_t$، يمكن تعريف خطأ تغير الحركة $E_{\text{motion}}$ عن طريق الفرق بين متجهات الحركة في الأوقات المتجاورة:

$E_{\text{motion}} = \frac{1}{N-2} \sum_{t=1}^{N-2} \|\mathbf{v}_{t+1} - \mathbf{v}_t\|_2$

حيث يُمثل $\mathbf{v}_t$ حالة الحركة في المرحلة رقم $t$، و$E_{\text{motion}}$ كلما كان أقل، يُشير إلى أن التغيرات المفاجئة في تسارع الحركة أقل والانتقالات أكثر سلاسة ونعومة.

VBench

نظرًا لصعوبة مقايسة واحدة ل_phi_reflection قدرة نموذج توليد الفيديو بشكل شامل، يمكن حاليًا استخدام أطر التقييم الشاملة مثل VBench لتقييم نماذج توليد الفيديو من أبعاد متعددة. تُقسم VBench جودة توليد الفيديو إلى أبعاد تقييم متعددة، مثل تطابق Subjects، وتطابق الخلفية، وسلامة الحركة، والديناميكية، والجودة الجمالية، وجودة التصوير. مقارنةً بمقاييس الفردية مثل CLIP Score و FVD، تتميز VBench بتحليل أداء توليد الفيديو من جوانب متعددة تشمل جودة الصورة والاستقرار الزمني وأداء الحركة وتطابق الشروط، مما يجعلها أكثر ملاءمة لمقارنة القدرات الشاملة بين نماذج توليد الفيديو المختلفة.

التقييم اليدوي

تمتلك المخرجات للنماذج اللغوية الكبيرة طابع انفتاحي قوي، وغالبًا ما يكون هناك عدة طرق معقولة للإجابة على نفس السؤال. يصعب تحديد ما إذا كانت الإجابة صحيحة وتلبي احتياجات المستخدم بشكل كامل بالاعتماد فقط على المقاييس التلقائية، لذلك يظل التقييم اليدوي من طرق التقييم المهمة عند تقييم النماذج اللغوية الكبيرة بعد التموين. بالنسبة للمحتوى المفتوح الذي يصعب تقييمه بدقة من خلال المقاييس التلقائية، يمكن استخدام الاختبار الأعمى أو التقييم متعدد الأشخاص. يمكن للمقيمين judge مخرجات النموذج بشكل شامل من حيث الصحة والاكتمال والعلاقة بالسياق واتباع التعليمات وجودة التعبير والأمان.

في التقييم الفعلي، يمكن وضع معايير تقييم موحدة مسبقًا، على سبيل المثال تقييم أبعاد التقييم المختلفة باستخدام مقياس من 1 إلى 5. لتقليل التحيز المسبق للمقيمين تجاه النموذج، يمكن إخفاء اسم النموذج وإصداره، وتقليل المقيمين فقطjudge الإجابة بناءً على المحتوى. إذا كنت ترغب في مقارنة النموذج قبل وبعد التموين، يمكنك أيضًا عرض إجابات النموذجين على نفس السؤال بشكل مجهول الهوية، ويختار المقيمين الإجابة الأفضل.

نظرًا لأن التقييم الذاتي يتمتع بدرجة معينة من الذاتية، يمكن لتقييمات مهمة أيضًا استخدام التقييم متعدد الأشخاص. يتم تقييم نفس المحتوى من قبل مقيّمين متعددين بشكل منفصل، ثم تلخيص نتائج التقييم. عندما تكون الفروقات في درجات المقيمين كبيرة، يجب أيضًا التحقق مما إذا كانت معايير التقييم واضحة لتحسين اتساق وموثوقية نتائج التقييم. على الرغم من أن التقييم اليدوي يتطلب استثمار وقت وموارد أكبر، إلا أنه يكشف عن مشاكل يصعب على المقاييس التلقائية كشفها. عند تقييم أداء تموين النماذج اللغوية الكبيرة، يمكن الجمع بين التقييم التلقائي والتقييم اليدوي لتقييم ما إذا كان النموذج قد تحسن بالفعل بشكل أكثر شمولاً.