FluxGym / Flux1D Scene-LoRA Captioning Method Cél: Nem egyes objektumok vagy stíluselemek betanítása, hanem egy teljes helyszín, világ vagy környezet identitásának megtanítása úgy, hogy a LoRA több nézőpontból is ugyanazt a helyet rekonstruálja. Alapelv: A caption ne tárgylista legyen, hanem természetes nyelvű jelenetleírás. A Flux modellek a koherens környezeti leírásokat általában jobban tanulják, mint a rövid, címkeszerű felsorolásokat. Terjedelem: max 150 token Leírandó elemek: 1. Világ és környezet - Milyen helyszín látható. - Milyen civilizáció, korszak vagy világépítés jellemzi. - Mi a jelenet általános identitása. 2. Térszerkezet - Mi található az előtérben. - Mi található a középtérben. - Mi található a háttérben. - Hogyan kapcsolódnak egymáshoz a fő szerkezeti elemek. 3. Anyagok és építészeti nyelv - Fő anyagok. - Felületek. - Konstrukciós jellegzetességek. - Visszatérő formai elemek. 4. Fény és atmoszféra - Napszak. - Megvilágítás. - Reflekciók. - Hangulat. 5. Stabil térbeli referenciák A caption minden képnél természetes módon nevezze meg azokat az elemeket, amelyek a helyszín identitását adják. Példák: - center canal - left foreground planter - right tower - background glass dome - elevated walkway - central plaza - curved stairway Fontos: Nem szabad meta-szavakat használni. Kerülendő: - anchor - persistent anchor - structural anchor - scene distribution - multiple viewpoints - same location - scene identity A modell ezekből semmilyen speciális jelentést nem tanul. Anchor-hatás létrehozása: Az anchor-hatás nem a szóhasználatból, hanem az ismétlődésből keletkezik. Ha ugyanazok a térbeli elemek sok captionben újra megjelennek, a LoRA ezeket a helyszín stabil szerkezeti elemeiként kezdi kezelni. Jó példa: "The central water canal divides the plaza while large glass domes rise above the surrounding brass buildings." Rossz példa: "persistent structural anchor, scene identity, multi-view scene representation" Caption stílus: - természetes angol nyelv - folyó szöveg - koherens jelenetleírás - minimális felsorolás - helyszínközpontú szemlélet - rekonstruálható térszerkezet Végeredmény: A LoRA nem objektumokat tanul meg külön-külön, hanem egy teljes helyszín valószínűségi eloszlását, amelyből később új nézőpontok, új kompozíciók és új jelenetek generálhatók ugyanazon világon belül. A caption így kezdődjön: (ide írd a main triggert), (ide írd a többi triggert, ha van), .......