AIUnlimited
🌳

Fondations IA

🌱
AI Seeds

Partez de zéro

🌿
AI Sprouts

Construisez les fondations

🌳
AI Branches

Mettez en pratique

🏕️
AI Canopy

Approfondissez

🌲
AI Forest

Maîtrisez l'IA

🔨

Maîtrise IA

✏️
AI Sketch

Partez de zéro

🪨
AI Chisel

Construisez les fondations

⚒️
AI Craft

Mettez en pratique

💎
AI Polish

Approfondissez

🏆
AI Masterpiece

Maîtrisez l'IA

📘

Pratique IA

📖
Comprendre les modèles open-source

Fondamentaux et ressources pour les modèles open-source

🎯
Du problème à la tâche modèles

Transformer les problèmes métier en tâches modèles

⚡
Exécuter votre premier modèle

Voyez vos premiers résultats en 30 minutes

🔧
Fine-tuning et évaluation

Affinez les modèles et évaluez les performances

🚀
Systèmes d'application

Construisez des applications IA réelles

🎨
IA générative

Explorez les modèles AIGC open-source

🤖
Agents

Apprenez les frameworks Agent et outils MCP

📐
Fondamentaux supplémentaires

Bases LLM et évaluation

🎓

Claude Académie

🤖
Claude 101

Learn AI basics with Claude

💻
Claude Code 101

Code with Claude as your pair programmer

🤝
Introduction to Claude Cowork

Collaborate with Claude on complex projects

⚙️
Claude Platform 101

Build apps with the Claude API

Labo

7 expériences chargées
🧬Bac à sable neuronal🤖IA ou Humain ?🥋Dojo d'ingénierie de prompts🏁Course d'algorithmes🧠Quiz IA🏗️Canevas de conception système
🎯Entretien simuléEntrer dans le labo→
🚀

Développement de carrière

🚀
Rampe de lancement entretien

Commencez votre parcours

🌟
Maîtrise comportementale

Maîtrisez les compétences relationnelles

💻
Entretiens techniques

Réussissez l'épreuve de code

🤖
Entretiens IA et ML

Maîtrisez l'entretien ML

🏆
Offre et au-delà

Décrochez la meilleure offre

Commencer
AIUnlimited

Licence MIT

沪ICP备18025655号-11

Apprendre

  • Bases de l'IA
  • Pratique IA
  • Claude Académie
  • Labo
  • Développement de carrière

Communauté

  • À propos
  • FAQ

Soutien

  • Conditions d'utilisation
  • Politique de confidentialité
  • Contact
Programmes d'IA et d'ingénierie›🎨 IA générative›Leçons›Image LoRA with DiffSynth
🖼️
IA générative • Débutant⏱️ 25 min de lecture

Image LoRA with DiffSynth

Personnalisation ? Entraîner une LoRA d'image avec DiffSynth

Dans les applications réelles, un modèle de génération d'images générique n'est pas toujours capable de générer avec précision des personnages, des produits ou des styles d'image spécifiques. Si l'on souhaite que le modèle génère des caractéristiques visuelles spécifiques, telles que des personnages, des produits ou des styles, on peut utiliser LoRA pour le entraîner. Ce chapitre présente d'abord les concepts fondamentaux des modèles de génération d'images et de LoRA, puis utilise DiffSynth pour effectuer un entraînement de LoRA d'image.

Un seul prompt, comment il devient une image ?

Actuellement, les modèles de génération d'images courants sont composés principalement d'un encodeur de texte, d'un modèle de diffusion et d'un VAE. Après que l'utilisateur entre un prompt, le modèle comprend d'abord le contenu du texte, génère ensuite progressivement des caractéristiques d'image, puis convertit ces caractéristiques en images directement visibles.

L'encodeur de texte est responsable de comprendre le prompt, en transformant le texte en des caractéristiques textuelles que le modèle peut traiter. Par exemple, pour l'entrée "un chat orange portant des lunettes assis sur une plage", l'encodeur de texte codera "chat orange", "lunettes", "plage" et autres éléments, fournissant des conditions pour la génération d'image ultérieure.

Le modèle de diffusion est le composant central de la génération d'image. Il commence avec du bruit aléatoire, en se basant sur les caractéristiques textuelles pour supprimer progressivement le bruit par plusieurs calculs, formant ainsi les objets, les couleurs et les structures de l'image. Par exemple, lors de la génération de l'image précédente, la scène initiale est juste du bruit aléatoire, et après plusieurs itérations, le chat orange, les lunettes et la plage se formeront progressivement.

Le VAE (Variational Autoencoder, autoencodeur variational) est responsable de la conversion entre l'espace d'images et l'espace de caractéristiques. Pour réduire le coût de calcul, le modèle de diffusion ne calcule généralement pas directement sur des images de haute résolution, mais dans un espace de caractéristiques compressées. Après la génération, le VAE convertit les caractéristiques d'image en l'image finale.

En combinant ces composants, un processus de génération de texte vers image de base est le suivant :

Image de texte

Après que l'utilisateur entre un prompt, le modèle passe par des étapes de codage de texte, génération de caractéristiques d'image et réduction d'image, pour finalement obtenir l'image. Les modèles de génération d'images différents peuvent avoir des structures spécifiques, mais le processus global doit convertir l'entrée de texte en sortie d'image.

Pour que le modèle dessine mieux, qu'est-ce que la LoRA d'image peut faire ?

Les modèles de génération d'images génériques sont généralement entraînés avec un grand nombre d'images, ce qui leur permet de générer divers types de contenu, mais les résultats de génération pour des personnages, des produits ou des styles d'image spécifiques peuvent ne pas être assez précis.

Par exemple, si l'on souhaite que le modèle génère un produit spécifique, même si le prompt contient une description détaillée de la couleur, de la forme et de l'apparence du produit, les résultats de génération peuvent différer considérablement du produit réel.

On peut entraîner le modèle pour qu'il apprenne ces nouvelles caractéristiques visuelles, mais réentraîner tout le modèle nécessite de grandes quantités de données d'entraînement et de ressources de calcul. Pour l'apprentissage de ces caractéristiques spécifiques, on peut utiliser la méthode d'entraînement paramétrique efficace LoRA, son principe est expliqué dans la section 9.2 de cet article. Pendant l'entraînement, la plupart des paramètres du modèle original sont gelés, seuls les nouveaux paramètres sont entraînés, ce qui permet au modèle d'apprendre de nouvelles caractéristiques.

Pour entraîner une LoRA d'image, il suffit de préparer un petit nombre d'images cibles pour que le modèle apprenne des caractéristiques visuelles spécifiques, telles que des personnages, des produits, des styles ou d'autres éléments. Après l'entraînement, le fichier LoRA obtenu est beaucoup plus petit que le modèle complet. Lors de l'utilisation, on charge le modèle original, puis le LoRA correspondant, et on peut utiliser les caractéristiques visuelles nouvellement appris.

Avant l'entraînement, il faut clarifier ce que le modèle doit apprendre

En fonction des objectifs d'apprentissage, la LoRA d'image peut être classée en LoRA de style, LoRA de personnage, LoRA de produit et LoRA de concept, etc.

LoRA de style

La LoRA de style apprend le style visuel global de l'image : la couleur, les lignes, la composition, la manière de présenter. Pour l'entraînement, il faut préparer un groupe d'images de style similaire, les contenus des images peuvent être différents, mais le style global doit rester cohérent.

Par exemple : en utilisant un groupe d'images dans le style de l'encre et du papier (xuěshuǐhuà), on peut entraîner une LoRA de style

Leçon 2 sur 50% terminé
←10 AIGC Use Cases

Discussion

Se connecter pour rejoindre la discussion