వాస్తవ అనువర్తనాలలో, జనరల్ ఇమేజ్ నిర్మాణ మోడల్స్ కుడా ప్రత్యేక వ్యక్తి, ఉత్పత్తి లేదా చిత్ర శైలిని ఖచ్చితంగా నిర్మించలేని సమయం ఉంటుంది. మోడల్ను ప్రత్యేక వ్యక్తి, ఉత్పత్తి లేదా శైలి ఫీచర్లను నిర్మించాలనుకుంటే, LoRA ని శిక్షణపరచవచ్చు. ఈ చాప్టర్లో మొదటగా ఇమేజ్ నిర్మాణ మోడల్స్ మరియు LoRA యొక్క ప్రాథమిక ఆధార సంకేతాలను ప్రస్తావించడమే కాకుండా, DiffSynth ని ఉపయోగించి ఒక ఇమేజ్ LoRA శిక్షణను పూర్తి చేస్తుంది.
ప్రస్తుతం సాధారణ ఇమేజ్ నిర్మాణ మోడల్స్ టెక్స్ట్ ఎండోర్, డిఫ్యూజన్ మోడల్ మరియు VAE ల వంటి కామ్పోనెంట్లతో కూడి ఉంటాయి. వాడు ప్రత్యేకత పదబంధం నిర్దేశించిన తర్వాత, మోడల్ మొదట వచన సామాన్యతను అర్థం చేసుకుంటుంది, అంతర్భాగంగా ఇమేజ్ ఫీచర్లను పైగా పైగా నిర్మిస్తుంది, తర్వాత వాటిని ముఖ్యమైన చిత్రాలను మార్చడానికి ప్రత్యక్షంగా చూడగల చిత్రాలుగా మార్చడం జరుగుతుంది.
టెక్స్ట్ కోడింగ్ ఎండియోర్ ప్రత్యేకత పదబంధాన్ని అర్థం చేయడంలో ప్రధాన పాత్ర వహిస్తుంది. అది వచనాన్ని మోడల్ అందించే టెక్స్ట్ ఫీచర్లుగా మార్చడం. ఉదాహరణకు, "ఒక కాలేర్ ముక్కు ధరించిన కొరియా పిల్లి ఉండగా తున్నాను" అనే పదబంధాన్ని ఇన్పుట్ చేస్తే, టెక్స్ట్ కోడింగ్ ఎండియోర్ "కొరియా పిల్లి", "కాలేర్ ముక్కు", "తున్నాను" వంటి సామాన్యతలను కోడ్ చేస్తుంది, ఇది తర్వాతి ఇమేజ్ నిర్మాణానికి పూర్వావస్థను అందిస్తుంది.
డిఫ్యూజన్ మోడల్ ఇమేజ్ నిర్మాణం యొక్క కేంద్ర కామ్పోనెంట్. అది రాండమ్ శబ్దం నుండి ప్రారంభమవుతుంది, టెక్స్ట్ ఫీచర్లతో ప్రతి కాల్చి మీద కాల్చి నిర్వర్తించి శబ్దాన్ని తొలగించడం ద్వారా చిత్రంలోని వస్తువులు, రంగులు మరియు స్థాయిలను రూపొందిస్తుంది. ఉదాహరణకు, ఈ చిత్రాన్ని నిర్మించడంలో, మొదట చిత్రం రాండమ్ శబ్దంగా ఉంటుంది, మొదటి కాల్చి మీద కాల్చి తర్వాత కొరియా పిల్లి, కాలేర్ ముక్కు మరియు తున్నాను వంటి సామాన్యతలు తర్వాత ప్రారంభించబడతాయి.
VAE (Variational Autoencoder, వేరియేషనల్ ఆటోఎండియోయేకర్) ఇమేజ్ మరియు ఫీచర్ స్పేస్ ల మధ్య మార్పిడి చేస్తుంది. కాల్కులేషన్ సంఖ్యను తగ్గించడానికి, డిఫ్యూజన్ మోడల్ సాధారణంగా అధిక రిజల్యూషన్ చిత్రాలపై నిర్వర్తించడం కాదు, కానీ కమ్ప్రెస్చేసిన ఫీచర్ స్పేస్లో ఇమేజ్ నిర్మిస్తుంది. నిర్మాణం పూర్తి అయిన తర్వాత, VAE ఫీచర్లను చివరి చిత్రానికి మార్చడానికి వాడుతుంది.
ఈ కామ్పోనెంట్లను కలపడం ద్వారా, ఒక ప్రాథమిక విజ్ఞాన విజ్ఞాన ప్రక్రియ ఈ విధంగా కనిపిస్తుంది:
వాడు ప్రత్యేకత నిర్దేశించిన తర్వాత, మోడల్ టెక్స్ట్ కోడింగ్, ఇమేజ్ ఫీచర్ల నిర్మాణం మరియు ఇమేజ్ రీవర్సల్ అయినప్పుడు చిత్రాన్ని పొందుతుంది. వివిధ ఇమేజ్ నిర్మాణ మోడల్స్ స్పెసిఫిక్ స్ట్రక్చర్లలో వ్యత్యాసాలు ఉంటాయి, కానీ ప్రతి ఒక్కటి టెక్స్ట్ ఇన్పుట్ నుండి ఇమేజ్ అవుట్పుట్ కు మార్పును పూర్తి చేయడానికి అవసరం.
జనరల్ ఇమేజ్ నిర్మాణ మోడల్స్ సాధారణంగా పెద్ద మొత్తం ఇమేజ్లతో శిక్షణపరచబడతాయి, వాటికి అనేక రకాల సామాన్య ప్రతిస్పత్తులను నిర్మించగలవు, కానీ ప్రత్యేక వ్యక్తి, ఉత్పత్తి లేదా చిత్ర శైలికి విజ్ఞాన ప్రభావం తక్కువగా ఉండవచ్చు.
ఉదాహరణకు, ప్రత్యేక ఉత్పత్తిని నిర్మించాలనుకుంటే, ప్రత్యేకత పదబంధంలో ఉత్పత్తి యొక్క రంగు, ఆకారం మరియు ఆవరణను వివరించినప్పటికీ, నిర్మిత ఫలితం నిజమైన ఉత్పత్తితో చాలా తేడా ఉండవచ్చు.
సైన్ ఇన్ చర్చలో చేరండి
ఈ కొత్త దృశ్య ఫీచర్లను నేర్చుకోవడానికి మోడల్ను శిక్షణపరచడం అవసరం, కానీ పూర్తి మోడల్ను మళ్ళీ శిక్షణపరచడం చాలా మొత్తం శిక్షణ దత్తాంశాలు మరియు కాల్కులేషన్ వసతులను అవసరం. ఈ కొత్త ఫీచర్ల నేర్చుకోవడంలో, పారామీటర్ సార్వత్రిక శిక్షణ పద్ధతి లోపల ప్రత్యేక పద్ధతి LoRA ఉపయోగించవచ్చు, సంభవించే ప్రాథమిక ప్రాథమికత ఇక్కడ ఉన్నాయి. 9.2 నెంబర్ ప్రాంతంలో ఇది కనిపిస్తుంది. శిక్షణ సమయంలో మూల మోడల్ను చాలా పారామీటర్లను ఫ్రీజ్ చేసి, కొన్ని కొత్త పారామీటర్లను మాత్రమే శిక్షణపరచడం ద్వారా మోడల్ కొత్త ఫీచర్లను నేర్చుకోవడానికి అనుమతిస్తుంది.
ఇమేజ్ LoRA శిక్షణ కోసం కొన్ని లక్ష్య ఇమేజ్లను సిద్ధం చేయడం మాత్రమే అవసరం. ఇది మోడల్ను ప్రత్యేక వ్యక్తి, ఉత్పత్తి, శైలి లేదా ఇతర దృశ్య ఫీచర్లను నేర్చుకోవడానికి అనుమతిస్తుంది. శిక్షణ పూర్తి అయిన తర్వాత సంపాదించబడిన LoRA ఫైల్ పూర్తి మోడల్ కంటే చాలా తక్కువ సైజులో ఉంటుంది. ఉపయోగంలో మూల మోడల్ను లోడ్ చేసి, సంపాదించిన LoRA ను కూడా లోడ్ చేసి, నేర్చుకున్న దృశ్య ఫీచర్లను ఉపయోగించవచ్చు.
శిక్షణ లక్ష్యాల మార్పుల మేరకు, ఇమేజ్ LoRA శైలి LoRA, వ్యక్తి LoRA, ఉత్పత్తి LoRA మరియు కాన్సెప్ట్ LoRA వంటి రకాలు ఉంటాయి.
శైలి LoRA చిత్ర యొక్క సమ్మర్ధాల శైలి నిర్ధారిస్తుంది: రంగు, రేఖలు, కామ్పోజిషన్, ప్రదర్శన విధానం. శిక్షణ సమయంలో ఒక సమాన శైలి యొక్క ఇమేజ్ల సమూహాన్ని సిద్ధం చేయాలి, ఇమేజ్ల లోని సామాన్యతలు భిన్నంగా ఉండవచ్చు, క�