في الماضي، كان إنتاج صورة تسويقية لمنتج يتطلب مراحل متعددة مثل تجهيز المواد، تصميم الخلفية، ترتيب المنتج، إضافة النصوص وتناسب الأبعاد. إذا كان المنتج نفسه يحتاج لإنتاج في منصات مختلفة، فسيحتاج المصممون إلى إعادة تعديل الصورة حسب الأبعاد المختلفة.
الآن، من خلال تقنيات مثل إنتاج من النص إلى الصورة، وإعادة إنتاج من الصورة إلى الصورة، وتعديل جزئي للصورة ومسح الـ LoRA للنماذج، يمكننا ربط إنتاج الأفكار، تصميم المنتج، تعديل الصورة والتكيف مع الأبعاد معًا، لتشكيل تدفق إنتاج محتوى تسويقي متكامل نسبيًا.
مثالًا، إذا كان منتجًا للبيرة يحتاج إلى إنشاء ملصق تسويقي لهذا الصيف، ويأمل أن تحتوي الصورة على قطع جليد، وبرسوم الماء، وليمون وورق أخضر، يمكننا أولاً إنشاء لقطة أولية للتسويق عبر وصف نصي، ثم تعديلها باستخدام صورة المنتج لإعادة إنتاج من الصورة إلى الصورة، وإضافة شعار الشركة، ثم إجراء تعديلات أخرى حسب الاحتياجات. أخيرًا، يمكن توسيع الصورة نفسها إلى أبعاد مختلفة لاستخدامها في منصات وسائل التواصل الاجتماعي، فيديوهات قصيرة ومعلقات ويب.
يستخدم هذا الفصل مثالًا على ملصق تسويقي لمنتج "FRESH DAY" الصيفي لشرح كيفية بناء خط إنتاج محتوى AIGC التسويقي الأساسي باستخدام نماذج تصويرية مفتوحة المصدر في ModelScope. تبدأ التجربة من إنتاج من النص إلى الصورة، ثم تقدم إعادة إنتاج من الصورة إلى الصورة، وتعديل الجزء المحدد، وتكيف الأبعاد، ومسح الـ LoRA للنماذج.
يُعرف إنتاج من النص إلى الصورة (Text-to-Image) بأنه إنشاء صورة مباشرة بناءً على وصف نصي. لا يحتاج المستخدم إلى تجهيز مصادر التصميم الكاملة، بل يكفي وصف المظهر المطلوب للصورة عبر Prompt مثل الموضوع، والمكون الرئيسي، الخلفية، لون الطباعة، التصميم والأسلوب البصري. يمكن للنموذج توليد الصورة المقابلة بناءً على هذه المعلومات.
بالنسبة لإنتاج محتوى تسويقي، فإن إنتاج من النص إلى الصورة مناسب جدًا لاستكشاف الأفكار الإبداعية والخطة المرئية الأولية. على سبيل المثال، قبل تصميم ملصق البيرة الصيفي، يمكن أن نخبر النموذج "اتجاه صيفي بارد، جليد، برسوم الماء، ليمون، لون أزرق أخضر، أسلوب تصوير تجاري" وسيقوم النموذج بإنشاء لقطة تسويقية كاملة بشكل سريع. مقارنة ببدء التصميم من نقطة بيضاء، فإن هذه الطريقة يمكنها أن تجعل المستخدم يرى حلول ألغاز مختلفة بشكل أسرع.
يوفر المجتمع المفتوح حاليًا نماذج مثل Stable Diffusion و FLUX و Qwen-Image و Z-Image-Turbo وغيرها من نماذج إنتاج الصور. تختلف بين النماذج في جودة الصورة، فهم Prompt، قدرات إنتاج النص والاحتياجات المادية للنظام.
في هذه الفقرة نختار نموذج Z-Image-Turbo على ModelScope لإجراء تجربة إنتاج من النص إلى الصورة. تركز إصدار Turbo على تحسين كفاءة الإنتاج، حيث يمكن إنشاء الصورة باستخدام عدد أقل من خطوات الإجراء، لذا فهو مناسب جدًا للمطورين الأفراد والبيئات التجريبية مع احتياجات أقل للبيئة GPU.
نستخدم فرamework DiffSynth-Studio لإنتاج من النص إلى الصورة، نستورد DiffSynth-Studio:
!git clone https://github.com/modelscope/DiffSynth-Studio.git
تسجيل الدخول للانضمام إلى النقاش
%cd DiffSynth-Studio

3) التثبيت
%pip install -e .

4) في Cell Unit، أدخل الكود التالي لإنشاء من النص إلى الصورة.
import torch
from modelscope import ZImagePipeline
pipe = ZImagePipeline.from_pretrained(
"Tongyi-MAI/Z-Image-Turbo",
torch_dtype=torch.bfloat16,
low_cpu_mem_usage=False,
)
pipe.to("cuda")
print(f"الموقع الذي يوجد فيه النموذج: {pipe.device}")
prompt = """ الصيفية للبيرة التجارية،
اتجاه صيفي بارد ومشرق، الخلفية تحتوي على جليد، برسوم الماء، ليمون وورق أخضر، لون أزرق بارد ومشرق، أسلوب تصوير تجاري، منطقة مركزية مخصصة لعرض منتج البيرة، الخلفية بسيطة، الإضاءة طبيعية، عالية الجودة، واضحة في التفاصيل. """
image = pipe(
prompt=prompt,
height=1024,
width=1024,
num_inference_steps=9,
guidance_scale=0.0,
generator=torch.Generator("cuda").manual_seed(42),
).images[0]
print("88888888888888888888888")
#display(image)
image.save("summer_drink_poster.png")
بعد تنفيذ الأمر، يمكنك رؤية الصورة المحفوظة الجديدة في مساحة العمل.

تأثير الصورة المولدة هي كما يلي:

بالنسبة للمبتدئين، لا تحتاج إلى كتابة Prompt معقد جدًا في البداية. كل ما تحتاجه هو وصف احتياجاتك، ثم اضف التفاصيل تدريجيًا بناءً على نتيجة الإنتاج.
يُعتبر إنتاج من النص إلى الصورة مناسباً جدًا لإنتاج أفكار تسويقية وسطويات خلفية سريعة، ولكنه يوجد فيه مشكلة واضحة: إذا تم طلب النموذج مباشرة لإنشاء منتج معين، فقد تكون مكونات المنتج والشعار والنصوص مختلفة عن المنتج الحقيقي في سيناريوهات التسويق الرسمية، ويحتاج إلى إجراء تعديلات إضافية باستخدام صور المنتج الحقيقية.
يُعتمد إنتاج من الصورة إلى الصورة (Image-to-Image) على إدخال صورة مرجعية ووصف نصي معًا. يمكن للنموذج استعارة المكون الرئيسي والعبوة والتصميم من الصورة الأصلية، ثم تعديل الخلفية والظلال والآلات التسويقية حسب الـ Prompt.
نختار في هذه الفقرة نموذج SenseNova-U1.5-8B-MoT كنموذج لإعادة إنتاج الصورة. هذا النموذج يدعم إنتاج من النص إلى الصورة وتعديل الصورة، يمكنه فهم صورة الإدخال والتعليمات النصية معًا، وفقًا للـ Prompt تعديل الصورة الأصلية. مقارنة بإنشاء صورة فقط بناءً على النص، يمكن لمصمم SenseNova-U1.5-8B-MoT استغلال معلومات البصرية في الصورة الإدخال، بينما يُحافظ على المكون الرئيسي والبنية الكلية، وتعديل عبوات المنتج والخلفية واللون والمنحوتات، لذا فهو مناسب جدًا لإنتاج وإعادة إنتاج صور تسويقية للمنتج.
نستخدم جزء التجربة صورة البيرة الصيفية المولدة في الفقرة السابقة كإدخال، وتعديلها باستخدام نموذج إعادة إنتاج الصورة. في محاولة للحفاظ على شكل جرة البيرة والبنية العامة، نضيف شعار "FRESH DAY" على جرة البيرة، واضف قطع جليد، برسوم الماء، وليمون، لإنشاء صورة تسويقية للمنتج الكاملة، ويؤدي تحميل SenseNova-U1.5-8B-MoT الافتراضي إلى نقص في الذاكرة، وتم استخدام طريقة تحميل منخفضة الذاكرة في هذا الكود لخفض استهلاك الذاكرة.
الكود التالي:
from diffsynth.pipelines.sensenova_u1_image import (
SenseNovaU1ImagePipeline,
ModelConfig
)
from PIL import Image
import torch
import os
MODEL_ID = "SenseNova/SenseNova-U1.5-8B-MoT"
INPUT_IMAGE = "/mnt/workspace/summer_drink_poster.png"
OUTPUT_IMAGE = "/mnt/workspace/drink_fresh_day_ad.png"
vram_config = {
"offload_dtype": "disk",
"offload_device": "disk",
"onload_dtype": "disk",
"onload_device": "disk",
# تُحمّل عند الحاجة لحساب الحسابات
"preparing_dtype": torch.bfloat16,
"preparing_device": "cuda",
"computation_dtype": torch.bfloat16,
"computation_device": "cuda",
}
print("تم تحميل SenseNova-U1.5-8B-MoT...")
pipe = SenseNovaU1ImagePipeline.from_pretrained(
torch_dtype=torch.bfloat16,
device="cuda",
model_configs=[
ModelConfig(
model_id=MODEL_ID,
origin_file_pattern="model*.safetensors",
**vram_config
),
],
tokenizer_config=ModelConfig(
model_id=MODEL_ID,
origin_file_pattern="./"
),
vram_limit=(
torch.cuda.mem_get_info("cuda")[1] / (1024 ** 3)
- 0.5
),
)
print("تم تحميل النموذج.")
if not os.path.exists(INPUT_IMAGE):
raise FileNotFoundError(
f"لم يتم العثور على صورة الإدخال: {INPUT_IMAGE}"
)
edit_image = Image.open(INPUT_IMAGE).convert("RGB")
print(
f"حجم صورة الإدخال: "
f"{edit_image.width} × {edit_image.height}"
)
prompt = """
هذه مهمة تعديل صورة منتج للبيرة.
يرجى بناءً على صورة جرة البيرة، إنشاء صورة تسويقية للبيرة الصيفية الممتازة والباردة.
يرجى الحفاظ على جرة البيرة الرئيسية من الصورة الأصلية.
حاول الاحتفاظ بشكل جرة البيرة الأصلية، والغطاء، الهيكل، النسبة، الجودة الملمسية، والظاهرة العامة للمنتج، ولا يتم إعادة إنشاء أو استبدالها بجرة بيرة أخرى.
يجب أن تكون جرة البيرة واضحة ومكتملة وتكون مركزًا بصريًا للصورة.
في منطقة وصف العلامة التجارية على جرة البيرة، أضف ماركة جديدة لهذه البيرة:
"FRESH DAY".
"Fresh Day" هي اسم العلامة التجارية للبيرة.
يرجى تصميم شعار العلامة التجارية بطريقة طبيعية في جرة البيرة الأمامية، بحيث يبدو مثل علامة تجارية حقيقية مطبوعة على العبوة، وليس ككلمة عادية تطفو في الصورة.
يستخدم شعار "FRESH DAY" أسلوب بصري بسيط، حديث، ومشرق.
يستخدم الخط الكرياتي، واضح، وواضح، ويتضمن شكل ورقة أخضر بسيط، لإظهار الطبيعية، الصحة، المفعول البارد، والشبابية للعلامة التجارية.
يجب أن يكون النص "FRESH DAY" واضحًا، واضحًا، ويسهل القراءة.
لا توجد علامات تجارية أخرى، ولا تضيف نصوص غير متعلقة، ولا تظهر "FRESH DAY" في جرة البيرة.
في الحفاظ على جرة البيرة الرئيسية، قم بتحسين سيناريو التسويق المحيط.
أضف قطع جليد شفافة، برسوم الماء الباردة، قطرة ماء على جرة البيرة، وقطعة ليمون جديدة قليلة حول جرة البيرة، لتمييز شعور البيرة الباردة، الباردة، والمشروبات الطازجة.
استخدم ضوءًا تجاريًا طبيعيًا ومشرقًا، لتمييز حساسية جرة البيرة، قطرة الماء، والجودة الملمسية.
تظل الخلفية بسيطة، نظيفة، ولا تضيف عناصر معقدة.
يتبع الظاهرة لأسلوب تسويقي صيفي بسيط، مشرق، وذكي، مركزي، وسياق بسيط، ويحمل جودة تصوير المنتج التجاري الحقيقي.
النتيجة النهائية يجب أن تبدو مثل ملصق تسويقي حقيقي للبيرة التجارية، وليس رسمًا، أو رسوم متحركة، أو تصميم جديد لمنتج البيرة.
"""
print("بدأ إنشاء صورة تسويقية للبيرة الصيفية...")
image = pipe(
prompt=prompt,
# صورة المنتج الأصلية
edit_image=edit_image,
# تحديد بذرة عشوائية ثابتة، لسهولة إعادة الإنتاج
seed=42,
# تناسب 3:4 للصورة الرأسي
height=1536,
width=1152,
num_inference_steps=50,
cfg_scale=4.0,
shift=3.0,
)
image.save(OUTPUT_IMAGE)
print(
f"تم إنشاء النتيجة، تم حفظ الصورة في: {OUTPUT_IMAGE}"
)
نتيجة التنفيذ التالية:

الصورة النهائية المولدة هي:

مقارنة بإنشاء من النص إلى الصورة، يمكن لإعادة إنتاج من الصورة إلى الصورة استغلال معلومات البصرية في الصورة الأصلية، وهو مناسب جدًا لسيناريوهات حيث تمتلك مصادر المنتج أو مخطط التصميم. من الصورة المولدة أعلاه يمكن ملاحظة أن هناك فارق ما بينها والصورة المطلوبة، حتى مع تقديم صورة المنتج الحقيقية، قد يرسم النموذج جزءًا من المنتج. في سيناريوهات الاستخدام الحقيقية، يتعين التفكير في حفظ المكون الرئيسي للمنتج وتعديل الجزء المحدد.
في استخدام صورة تسويقية للمنتج، بالإضافة إلى جمالية الصورة، يتعين أيضًا ضمان دقة المعلومات. ظاهرة جرة البيرة، الهيكل، الهيكل، شعار العلامة التجارية هي عناصر بصورية أساسية للمنتج. إذا حدثت تغييرات واضحة في عملية تعديل الصورة، قد تختلف الصورة المولدة عن المنتج الحقيقي. عند استخدام نماذج إعادة إنتاج الصورة، يجب تحديد ما يجب الحفاظ عليه وما يمكن التعديل عليه. على سبيل المثال، يمكن أن نطلب من النموذج الحفاظ على جرة البيرة، وشعار العلامة التجارية، وسياق التصميم، وتعديل الخلفية، العناصر التزيينية أو الأجسام المحيطة. من خلال تحديد هذه القيود في Prompt، يمكن تقليل إعادة إنشاء المكون الرئيسي للنموذج، مما يجعل النتيجة الإدخال أكثر تحكمًا.
نستخدم في هذه الفقرة صورة FRESH DAY للبيرة التسويقية المعدلة في الفقرة السابقة لتحسين الجزء المحدد. في الحفاظ على جرة البيرة الرئيسية، وشعار العلامة التجارية، والجليد، برسوم الماء، وسياق التصميم بشكل أساسي، نغير الليمون الأصفر في الزاوية السفلية اليمنى إلى ليمون أخضر. من خلال هذا المثال، يمكن فهم كيفية استخدام Prompt لتحقيق تعديل صوري أكثر تحكمًا.
from diffsynth.pipelines.sensenova_u1_image import (
SenseNovaU1ImagePipeline,
ModelConfig
)
from PIL import Image
import torch
import os
MODEL_ID = "SenseNova/SenseNova-U1.5-8B-MoT"
INPUT_IMAGE = "/mnt/workspace/drink_fresh_day_ad.png"
OUTPUT_IMAGE = "/mnt/workspace/drink_fresh_day_lime.png"
vram_config = {
"offload_dtype": "disk",
"offload_device": "disk",
"onload_dtype": "disk",
"onload_device": "disk",
"preparing_dtype": torch.bfloat16,
"preparing_device": "cuda",
"computation_dtype": torch.bfloat16,
"computation_device": "cuda",
}
print("تم تحميل النموذج...")
pipe = SenseNovaU1ImagePipeline.from_pretrained(
torch_dtype=torch.bfloat16,
device="cuda",
model_configs=[
ModelConfig(
model_id=MODEL_ID,
origin_file_pattern="model*.safetensors",
**vram_config
),
],
tokenizer_config=ModelConfig(
model_id=MODEL_ID,
origin_file_pattern="./"
),
vram_limit=(
torch.cuda.mem_get_info("cuda")[1] / (1024 ** 3)
- 0.5
),
)
print("تم تحميل النموذج.")
if not os.path.exists(INPUT_IMAGE):
raise FileNotFoundError(
f"لم يتم العثور على صورة الإدخال: {INPUT_IMAGE}"
)
edit_image = Image.open(INPUT_IMAGE).convert("RGB")
print(
f"حجم صورة الإدخال: "
f"{edit_image.width} × {edit_image.height}"
)
prompt = """
هذه مهمة تعديل صورة جزئي.
يرجى تغيير الليمون الأصفر في الزاوية السفلية اليمنى إلى ليمون أخضر حقيقي.
حافظ على موقع، الحجم، الشكل، بنية القطع، وزاوية وضع الليمون الأصلي بشكل أساسي، وغير اللون والظاهرة فقط، بحيث يتحول البشرة واللحم الأصفر إلى ليمون أخضر.
لا تغير أي شيء آخر في الصورة.
حافظ على جرة البيرة الرئيسية، بما في ذلك شكل جرة البيرة، والغطاء، اللون، الهيكل، الهيكل، النسبة العامة.
حافظ على شعار "FRESH DAY" على جرة البيرة، الخط، الموقع، تصميم العلامة التجارية.
حافظ على قطع الجليد، برسوم الماء، قطرة الماء، ورق أخضر الخلفية، الإضاءة، اللون الخلفي، والتصميم العام.
تغير فقط ظاهرة فاكهة الليمون في الزاوية السفلية اليمنى، بحيث يتحول الليمون الأصفر إلى ليمون أخضر، مع الحفاظ على أسلوب وتقنية التصوير التجاري للصورة التسويقية الأصلية.
"""
print("بدأ تعديل صورة جزئي...")
image = pipe(
prompt=prompt,
edit_image=edit_image,
seed=42,
height=1536,
width=1152,
num_inference_steps=50,
cfg_scale=4.0,
shift=3.0,
)
image.save(OUTPUT_IMAGE)
print(
f"تم تعديل جزئي، تم حفظ الصورة في: {OUTPUT_IMAGE}"
)
نتيجة تنفيذ الكود التالي:

الصورة المولدة هي كما يلي، يمكن ملاحظة أن الليمون الأصفر تم تغييره إلى أخضر، لكن هناك تغييرات في الأجزاء الأخرى، في سيناريوهات الاستخدام الحقيقية، يمكننا من خلال تعديل Prompt أو توفير نماذج أكثر كفاءة الحصول على نتائج صور أفضل.

بعد إنشاء صورة تسويقية للمنتج، غالبًا ما يتم نشرها على منصات مختلفة. بسبب اختلافات شكل عرض المنصات المختلفة، يختلف متطلب الأبعاد والنسب المطلوب. تفضل منصات وسائل التواصل الاجتماعي استخدام نسب 1:1 أو 4:5، ومنصات الفيديوهات القصيرة تفضل نسبة 9:16 للصور الرأسية، بينما يستخدم البانر، الإعلانات الرأسية، نسبة 16:9. إذا قمت بضغط الصورة الأصلية مباشرة، قد يتم تضييق أو تمدد المكون الرئيسي. يمكن استخدام نماذج إعادة إنتاج الصورة لتمديد الصورة بحفاظًا على المكون الرئيسي، وتكيف النسب المطلوبة.
يختلف التوسيع عن التضييق البسيط. ليس فقط تغيير طول وعرض الصورة الأصلية، بل إنشاء منطقة جديدة بناءً على محتوى الصورة الأصلية والأسلوب. على سبيل المثال، عند تحويل صورة رأسية للبيرة إلى عرض رأسي 16:9، يمكننا الحفاظ على حجم جرة البيرة ونسبتها الأساسية، وتوسيع الخلفية، وبرسوم الماء، وقطع الجليد، وورق الأخضر في الجانبين، مما يجعل المنطقة الجديدة تتناسب بشكل طبيعي مع الصورة الأصلية.
نستخدم في هذه الفقرة صورة FRESH DAY للبيرة المعدلة في الفقرة السابقة، وتعديلها باستخدام أبعاد مختلفة لإنشاء نسخ مختلفة النسب (1:1، 4:5، 9:16، 16:9) بحفاظًا على جرة البيرة، وشعار العلامة التجارية، وأسلوب التصميم العام، لجعل نفس مصدر المكونات يتناسب مع منصات ومنصات عرض مختلفة، الكود التالي:
from diffsynth.pipelines.sensenova_u1_image import (
SenseNovaU1ImagePipeline,
ModelConfig
)
from PIL import Image
import torch
import os
MODEL_ID = "SenseNova/SenseNova-U1.5-8B-MoT"
INPUT_IMAGE = "/mnt/workspace/drink_fresh_day_lime.png"
OUTPUT_DIR = "/mnt/workspace/platform_images"
os.makedirs(OUTPUT_DIR, exist_ok=True)
vram_config = {
"offload_dtype": "disk",
"offload_device": "disk",
"onload_dtype": "disk",
"onload_device": "disk",
"preparing_dtype": torch.bfloat16,
"preparing_device": "cuda",
"computation_dtype": torch.bfloat16,
"computation_device": "cuda",
}
print("تم تحميل النموذج...")
pipe = SenseNovaU1ImagePipeline.from_pretrained(
torch_dtype=torch.bfloat16,
device="cuda",
model_configs=[
ModelConfig(
model_id=MODEL_ID,
origin_file_pattern="model*.safetensors",
**vram_config
),
],
tokenizer_config=ModelConfig(
model_id=MODEL_ID,
origin_file_pattern="./"
),
vram_limit=(
torch.cuda.mem_get_info("cuda")[1] / (1024 ** 3)
- 0.5
),
)
print("تم تحميل النموذج.")
edit_image = Image.open(INPUT_IMAGE).convert("RGB")
print(
f"حجم الصورة الأصلية: "
f"{edit_image.width} × {edit_image.height}"
)
platform_sizes = {
# 1:1 مربع
"square_1_1": (1024, 1024),
# 4:5 رأسي
"portrait_4_5": (1024, 1280),
# 9:16 فيديو قصير رأسي
"vertical_9_16": (1152, 2048),
# 16:9 عرض رأسي
"banner_16_9": (2048, 1152),
}
prompt = """
هذه مهمة توسيع الصورة وتكيف الأبعاد لصورة تسويقية للمنتج.
حافظ على جرة البيرة الرئيسية من الصورة الأصلية، بما في ذلك شكل جرة البيرة، والغطاء، اللون، الهيكل، العلامة التجارية "FRESH DAY"، قطرة الماء، والظاهرة العامة للمنتج.
تغيّر التصميم بناءً على نسبة الصورة الجديدة، لتبقى جرة البيرة مركزًا بصريًا للصورة.
إذا زادت العرض، أوسع الجانبين الأيمن والأيسر للخلفية بشكل طبيعي، وتضيف عناصر مثل الخلفية الفاتحة، برسوم الماء، قطع الجليد، ورق الأخضر، بحفاظًا على أسلوب التصوير التجاري المتسق.
إذا زادت الارتفاع، أوسع منطقة الأعلى والأعلى للصورة، وحافظ على نسبة جرة البيرة المكتملة، ولا تضغط أو تضيق المكون الرئيسي.
تكون العناصر الجديدة التي تم إضافتها طبيعية، وتتماشى مع الصورة الأصلية، وحافظ على الاتجاه الإضاءة، اللون، العمق البصري، والاتجاه الصيفي البارد بشكل متسق.
يكون التصميم بسيطًا، متوازنًا، و مناسبًا كملصق تسويقي للعلامة التجارية.
لا تضيف علامات تجارية جديدة، أو نصوص، أو عناصر غير متعلقة.
"""
for name, (width, height) in platform_sizes.items():
print(
f"\nتم إنشاء: {name} "
f"{width} × {height}"
)
image = pipe(
prompt=prompt,
edit_image=edit_image,
seed=42,
width=width,
height=height,
num_inference_steps=50,
cfg_scale=4.0,
shift=3.0,
)
output_path = os.path.join(
OUTPUT_DIR,
f"{name}.png"
)
image.save(output_path)
print(
f"تم حفظ: {output_path}"
)
print("\nتم إنشاء جميع أبعاد المنصات.")
نتيجة تنفيذ الكود التالي:

الصورة النهائية المولدة هي كما يلي، يمكن ملاحظة أن العلامات التجارية قد تم الحفاظ عليها، والنتيجة الإدخال جيدة بشكل عام.

يمكن استخدام نماذج إنتاج من النص إلى الصورة وإعادة إنتاج من الصورة إلى الصورة لإنشاء صور تسويقية مختلفة بسرعة، ولكن بسبب حقيقة أن كل عملية إنتاج لها طبيعة عشوائية، حتى باستخدام نفس أو مشابه للـ Prompt، قد تختلف صور مختلفة من نفس النموذج في اللون، التصميم، الإضاءة، والأسلوب العام.
بالنسبة للمشاريع التجارية، غالبًا ما يرغب في الحفاظ على أسلوب بصري متسق بين مواد التسويق المختلفة. تُستخدم في هذه الفقرة مسح LoRA لتعديل النموذج، حيث يتم تدريب النموذج على مجموعة من الصور التي تتبع أسلوب بصري متسق، مما يسمح للنموذج بتعلم ميزات اللون، التصميم، والأسلوب بشكل أكثر ثباتًا في الإنتاج المستقبلي.
نختار في هذه التجربة مسح LoRA لنموذج Z-Image-Turbo. السبب الرئيسي هو أن هذا النموذج يمكنه أن يفي بالاحتياجات من تجربة إنتاج من النص إلى الصورة، كما أن مقارنة بنموذج SenseNova-U1.5-8B-MoT المستخدم في قسم إعادة إنتاج الصورة، يتطلب مسح LoRA أقل من الذاكرة GPU، وهو مناسب جدًا للتجارب في بيئة كارت GPU واحد بسعة 24 GB. إذا كان لديك موارد GPU أكبر، يمكنك تجربة مسح LoRA لنموذج SenseNova-U1.5-8B-MoT.
!accelerate launch examples/z_image/model_training/train.py \
--dataset_base_path /mnt/workspace/train_data \
--dataset_metadata_path /mnt/workspace/train_data/metadata_training.csv \