Kreatív dekorációk a szabásminta alapján MI segítségével

ShoeZero - így fog kinézi a cipő
Becsült olvasási idő 6 perc.

Készítsünk kreatív rajzot a szabásminta alapján!

A mesterséges intelligencia segítségével izgalmas képeket tudunk generálni.

De sokszor azt szeretnénk, hogy a kép konkrét vonalak mentén, előre meghatározott formába öntve jelenljen meg? Mint mondjuk egy szabásmintában?

Egy ilyen rajznál kiemelten fontos, hogy a kép a megadott vonalakat követve készüljön el. E mellett azt is szeretnénk, hogy a kész kép a kivágott formákhoz idomuljon. Ne úgy nézzen ki, mint amit egy nagyobb alakzatból vágtunk ki.

Előkészületek

A példában egy cipő szabásmintáját fogjuk használni, amit a ShoeZero oldalról töltöttem le. Ez egy olyan szolgáltatás, ahol mi magunk készíthetjük el a cipő grafikáját a feltöltött képek alapján, amit a végén meg is rendelhetünk.
Természetesen bármilyen más szabásmintát vagy kivágó mintát is ugyan ezzel a módszerrel készíthetünk.

Elsőnek szükségünk lesz a szabásmintára. Fontos, hogy már az elején döntsük el, hogy melyik formát akarjuk használni. A mesterséges intelligenciával generált képeket nagyon nehéz más alakzatra alakítani.

Ehhez a feladathoz én egy több részből álló, kontrasztos cipőt választottam.

ShoeZero cipő
ShoeZero cipő

A szerkesztő ablakban megtaláljuk a szabásminta letöltés gombot is. De akár egy képernyő kép mentést is csinálhatunk. Nem szükséges a nagyon nagy felbontású kép. A rajzot egyébként is úgy kell készíteni, hogy legyen hely a varrásnak, vágásnak és más technikai ingadozásnak, hibának.

ShoeZero cipő szabásminta
ShoeZero cipő szabásminta

Ezt a képet hagyhatjuk így is, de egy képszerkesztő programmal megnövelhetjük a kontrasztot is, vagy új elemeket is berajzolhatunk.

ShoeZero cipő szabásminta előkészítve
ShoeZero cipő szabásminta előkészítve

Stable Diffusion Használata

A következő lépésben a Stable Diffusion + ControlNet párost fogjuk használni.

A text2img fülön kapcsoljuk be a ControlNet kiegészítőt. Majd Preprocessor-nak válasszuk a Canny-t (amennyiben a szabásminta fekete-fehér, akkor a none vagy az invert is jó lehet lehet). A Model pedig szintén a Canny legyen.

Utasításoknak (prompt) és modellnek azt állítsuk be, amilyen mintát szeretnénk. Ha pl. virágmintát, akkor virágokkal kapcsolatos utasításokat érdemes adni mint a „colorful flowers”. Ha inkább futurisztikus cipőt szeretnénk, akkor pedig a „futuristic lines” és hasonló parancsokat használjuk.

Ide összegyűjtöttem néhány modellt, amelyek hasznosak lehetnek.

Mivel a képek generálása csak néhány percig tart, érdemes több képet készíteni, és más parancsokat is kipróbálni, hogy megtaláljuk a leginkább tetsző mintát.

Stable Diffusion beállításai

A ShoeZero oldalon a kész képeket mindjárt fel is tölthetjük, hogy megnézzük az eredményt. De előtte akár módosíthatjuk valamelyik képszerkesztő programban is.

A kész kép feltöltve a ShoeZero oldalra
A kész kép feltöltve a ShoeZero oldalra

A feltöltött kép még sok mindent nem árul el. De amint lekérjük a 3D generált képet, az eredmény igencsak látványos. És a legfontosabb: egyedi. Ilyen cipője garantáltan senki másnak nem lesz!

Photoshop Trükkök

Hasonló módon az Adobe Photoshop programban is használhatjuk a mesterséges intelligenciát.

Elsőnek jelöljük ki azt a területet, ahol majd a Generative Fill működni fog. Ezt legkönnyebben a Select/Color Range paranccsal tudjuk megtenni.

Kijelöljük a mesterséges intelligencia működési területét.
Kijelöljük a mesterséges intelligencia működési területét.

A jobb működés érdekében növeljük a kijelölt területet: Select/Modify/Expand 5-10 pixel

Növeljük a kijelölt területet
Növeljük a kijelölt területet

Ha mindent jól csináltunk, akkor az eredmény kb. így néz ki: Minden kijelölés egy kicsit nagyobb, mint a szabásminta.

Most már csak a Generative Fill parancsot kell használnunk. Írjuk be azokat a kulcsszavakat, amik a kívánt képet készítik el. Én jelen esetben Hungarian Folk Art pattern parancsot írtam be.

Oké, az eredmény nem túl látványos. Ennek oka, hogy a Photoshop az egész képet vizsgálja, hogy a generált elemek minél jobban illeszkedjenek a környezetbe. És lássuk be, ami képünk egy nagy halom üres szürke képpontból áll…

Segítségül kell hívnunk egy olyan képet, ami az üres helyeket is kitölti. Azaz egy új rétegre tegyünk egy másik képet! Ez lesz alapján fog a mesterséges intelligencia dolgozni.

(Segédképet generálhatunk a Photoshop programon belül is, ha az egész képet kijelöljük, és úgy használjuk a Generative Fill funkciót)

Betettünk egy segéd képet is.
Betettünk egy segéd képet is.

A segédkép legyen egy másik rétegen, majd kapcsoljuk ki. Végezzük el újra a kijelölést, ahogyan már korábban csináltuk. Majd kapcsoljuk vissza a segédképet, hogy a mesterséges intelligencia lássa.

Kezdődhet a képgenerálás
Kezdődhet a képgenerálás

És már indíthatjuk is a mesterséges intelligenciát. Most, hogy már kapott környezetet, van viszonyítási alapja. Az eredmény sokkal jobb lett!

Az eredmény miután kikapcsoltuk a segédképet.
Az eredmény miután kikapcsoltuk a segédképet.

Ezt a képet is feltöltöttük a ShoeZero oldalra. A 3D látványterv nagyon izgalmasan néz ki.

A Photoshop programban készített kép 3D látványterve a ShoeZero oldalon
A Photoshop programban készített kép 3D látványterve a ShoeZero oldalon

Összegzés

A mesterséges intelligencia még nagyon az elején jár. Nagyon nehéz irányítani, de már így is tudjuk olyan munkában használni, mint egy szabásminta. Idővel mindez könnyebb és profibb lesz.

Ne felejtsük el, hogy mind a Photoshop, mind a Stable Diffusion kis felbontású képet generál. De a textíliáknál nincs is mindig szükség nagy felbontásra. Amennyiben mégis szeretnénk nagyobb felbontású képet, akkor a Stable Diffusion segítségével ezt is megtehetjük. A leírás itt található.

PixelRita, te mit gondolsz?

Loading

Windows iconok rajzolása

Midjourney Folder Icon
Becsült olvasási idő 4 perc.

PixelRita, te szeretsz rajzolni?

Nem rossz ötlet! Én csak kicsit tudok rajzolni. Viszont szeretem, ha a dolgok nem csak üres fekete-fehér vonalakból állnak.
Szeretem feldobni a PowerPoint előadásaimat néhány ikonnal. Szeretem néhány mókás ábrával színesíteni a bevásárló listámat, a blogomat, a gyerekek naptárait és ToDo listáit.

És persze itt van a számítógép is. A Windowsban ki tudjuk cserélni a mappák ikonjait. Akkor miért maradjak meg az unalmas sárga foldereknél?
Persze a net tele van szebbnél szebb ikon csomagokkal (icon pack), amelyek vagy ingyenesek, vagy fizetősek vagy csak vírus van benne, vagy csak nem lehet letölteni. De igazából nem is biztos, hogy tetszik, de 2 óra keresés után már mindegy mit találok, csak legyen valami, nem a sima sárga mappa.

De megjelent a Midjourney! Ezzel a szöveg-alapú mesterséges intelligenciás képgeneráló programmal bármit meg tudok rajzolni! Még a Windows-mappaikonokat is!
Rövid kísérletezés után ez a parancs tetszett meg:

[amit a mappában szeretnél látni] folder icon, pixel style, 64x64 pixel, white background

Néhány perc múlva máris ellep engem az izgalmasabbnál izgalmasabb színes ikonok százai. Szó szerint lerohanták a számítógépemet!

A Midjourney PNG formátumban adja a képeket. Ezt a Windows nem tudja ikonként kezelni. Ahhoz ICO fájlformátum szükséges.

Én az IrfanView ingyenes programot használtam, ahol a Batch Conversion paranccsal pillanatok alatt ICO formátummá konvertáltam a nyolcszáznál is több PNG képemet.
Nagyon egyedi hangulatot adott a számítógépemnek!

Néhány ikont megmutatok itt is:

PixelRita azt mondta, hogy ő a DALL-E-t használná. Kipróbáltam azt is.

A DALL-E nagy előnye, hogy sokkal könnyebb elmondani, hogy mit szeretnénk. Ha a ChatGPT-be beépítettet használjuk, akkor pedig még jobban el tudjuk mondani, mit szeretnénk.

Én PixelRita segítségével a DALL-E-vel ilyen ikonokat tudtam készíttetni:

Mit gondolsz PixelRita?

Loading

Alaprajzból 3D kép (Stable Diffusion az építészetben)

Vázlatból 3D alaprajz
Becsült olvasási idő 4 perc.

PixelRita! Építünk egy házat. A megrendelővel gyorsan felvázoltunk egy alaprajzot. Szeretném, ha ez nem így maradna, hanem egy látványos 3D felülnézeti képünk lenne. Szerinted mit csináljunk?

Rita már nagyon lelkes! Lássuk akkor a mai feladatot!

Itt is van a ház alaprajza. A fekete-fehér erős kontrasztos kép lesz az alap, ami alapján a mesterséges intelligencia rajzolni fog.

Kézi alaprajz vázlat
Kézi alaprajz vázlat

Elindítottuk a Stable Diffusion programot, amihez a ControlNet már telepítve van (a programokról és használatukról a bővebb leírás a linkekben)

  • Stable Diffusion checkpoint: Egy valósághű modell. Szerencsére ebből sok van. Én a RealisticVision modellt választottam, de a dvArch és a Home Rooms Decoration modellt is sokat használom. (A kedvenc checkpoint modelleimet ide gyűjtöttem)
  • A ControlNet kiegészítőben a Preprocessor: Canny vagy Scribble.
  • A ControlNet kiegészítőben a Model: Canny.
  • Az utasítások (prompt): residential home, realistic model, layout on how to plan the layout of your apartment, bedroom, kitchen, bathroom, living room, furniture, garden outside, realistic, detailed rendering, architect colors, top view, textured shading
  • Negative prompt: text, cropped, out of frame, worst quality, low quality, jpeg artifacts, ugly, morbid, mutation, deformed, blurry

Ez esetben kissé nehezebb dolgunk van, mint amikor egy ház külső nézetét kérjük. A mesterséges intelligencia csak olyasmit tud rajzolni, amire tréningezték. Házakból kellően sokat látott ahhoz, hogy jó képeket tudjon generálni. De alaprajzból már jóval kevesebbet tanítottak. Vannak speciális modellek építészek számára, és sok LoRA-t is találunk (a kedvenc LORA modelleimet itt találod). De mindenképpen több kísérlet szükséges, míg megtaláljuk a nekünk megfelelő beállításokat.
Ha tudunk, készítsünk saját modellt és LORA-t is!

Ezen kívül a jelenlegi (2023.) MI szöveg-alapú képgeneráló programok általános rajzoló programok. Nem igazán lehet neki megmondani, melyik szoba a konyha, melyik a mellékhelyiség, melyik a hálószoba, stb… Ezeket próbáljuk meg minél részletesebben beleírni az utasításokba.

Használhatjuk még a Stable Diffusion inpaint funkcióját is, ahol csak a változtatni kívánt részt jelöljük ki, és oda generálunk új képi elemeket.

Készüljünk fel, hogy esetleg több képet is kell majd készíteni, és a Photoshop programban bűvészkedjük össze. Ott a Generative Fill opcióval kérhetjük a mesterséges intelligenciát, hogy új elemeket generáljon a képbe, vagy régieket cseréljünk le.

PixelRita! Mit gondolsz a mai projektünkről?

Loading

Ceruzarajzból élethű képek (Stable Diffusion az építészetben)

Ceruzarajzból élethű kép
Becsült olvasási idő 4 perc.

PixelRita! Van egy ceruzarajzom egy házról. Szerinted tudnék ebből 2 perc alatt valódi fényképszerű látványos képet rajzolni?

Vágjunk bele!

Egy darab papír, egy ceruza és máris kész a vázlat a jövendő házról!
Minden pontosan látszik: ablakok, ajtók, emeletek, tetők.

Ceruzarajz vázlat egy házról
Ceruzarajz vázlat egy házról

Ezt a vázlatot már nyugodtan odaadhatjuk a mérnököknek, hogy elkezdjenek dolgozni. A megrendelőnek viszont mégsem küldhetjük el. Neki egy sokkal professzionálisabb képet adjunk inkább!

Bizonyára bármelyik építészeti irodában találunk olyan szakértőt, aki kitartó munkával viszonylag rövid idő alatt össze tud dobni egy látványos eredmény. Talán nem tart napokig, csak néhány órát.

De inkább hagyjuk meg a szakértőket azon a munkát, ahol nélkülözhetetlenek. Ezt a feladatot pedig adjuk oda a mesterséges intelligenciának.
Betöltjük a vázlatot, néhány kattintás, majd pár perc múlva meg is kaptuk a kész, valósághű képet! Ráadásul csak néhány kattintás, és máris újabb képet kapunk, akár teljesen más stílusban.

Valósághű kép a ceruzarajzból
Valósághű kép a ceruzarajzból

Ez a Stable Diffusion programban a ControlNet kiegészítő segítségével csináltuk (a programok használatáról bővebb információt a linkeken találunk).

Forrásképnek az eredeti ceruzával készült vázlatot használtuk. A további beállítások pedig a következőek:

  • Stable Diffusion checkpoint: Egy valósághű modell. Szerencsére ebből sok van. Én a RealisticVision modelt választottam. (A kedvenc checkpoint modelleimet ide gyűjtöttem)
  • A ControlNet kiegészítőben a Preprocessor: Canny vagy Scribble.
  • A ControlNet kiegészítőben a Model: Canny.
  • Az utasítások (prompt): modern house
  • Negative prompt: text, cropped, out of frame, worst quality, low quality, jpeg artifacts, ugly, morbid, mutation, deformed, blurry

Mint láthatjuk, sok utasítást nem kapott a program, így a megadott vonalakon belül a saját feje után ment. De ezt írjuk át arra, amilyennek a végleges házat szeretnénk látni. Próbáljuk minél részletesebben, hogy a generált kép minél jobban hasonítson az elképzelésekre.

A legjobb végeredmény érdekében több checkpoint modellt is érdemes kipróbálni. De mi magunk is tréningezhetünk egy modellt a tökéletes képért.

A mesterséges intelligencia ezen felhasználásával nagyon könnyen és nagyon gyorsan készíthetünk látványos és valósághű képeket. Ráadásul az utasítások apró változtatásával teljesen más stílust is generálhatunk. Így a megrendelőnek mindjárt több variációt is tudunk mutatni.

PixelRita, te mit gondolsz erről a technikáról?

Loading

Történelmi képekből valósághű fotók

Szent Piroska a Stable Diffusion programmal átrajzolva a mozaik alapján
Becsült olvasási idő 9 perc.

Történelmi szobrok, festmények és mozaikok

A mesterséges intelligencia teljesen élethű képeket tud generálni. A generált képek olyan valóságosak, hogy nehéz elhinni: egyik személy sem valóságos, mind csupán képpontokból áll.
Ez a technika nemcsak arra jó, hogy sosemvolt embereket készítsünk. Hanem hogy ténylegesen valós személyeket rekonstruáljunk vele.

Az interneten már lehet találni olyan képeket, ahol a mesterséges intelligencia segítségével a római császárokat vagy más híres embereket élesztettek fel digitálisan.

Ez a technika bárki számára elérhető. Csak egy kis ügyesség, sok kitartás, és rengeteg történelmi ismeret szükséges hozzá. Csak alapvető technikai tudás szükséges!

PixelRita! Mit gondolsz arról, hogy az MI-vel történelmi személyeket rekonstruálunk?

Lássuk, hogyan lehet mindezt megcsinálni! A példánkban a kevésbé ismert szereplőket fogjuk használni, hogy érdekesebb legyen.

A technika

Jelenleg (2023) két technikát használhatunk. Egyik a Midjourney, másik a Stable Diffusion + ControlNet.

Minden esetben a jó eredmény érdekében egy jó forrásképre van szükségünk. Ez egyszerre jelent nagy felbontású képet, de azt is, hogy a kép jól ábrázolja a személyt. Ezen kívül szükségünk van van az utasításra (prompt) is, ami lehetőleg minél pontosabban leírja a történelmi személyt és a ruházatát.

Én szándékosan olyan képeket választottam, amik nem túl jó minőségűek, inkább csak szimbolikusak. Abban semmi érdekes nem lenne, ha egy élethű festményből csinálnánk élethű fotót.

Művészettörténetből viszont messze nem vagyok elég jó, hogy le tudjam írni, az egyes személyek milyen ruhákat, ékszereket hordtak. Ebben a ChatGPT segített nekem. Ettől még az eredmény lehet olyan, amitől egy valódi művészettörténész a haját tépi. Ez most inkább kísérlet. A hajat pedig a mesterséges intelligencia vissza tudja rajzolni.

Szent Piroska

Első kísérletünk Szent Piroska (Prisca, 1088–1134. augusztus 13.), aki a maga idejében talán az egyik leghíresebb magyar lehetett. Szent László lánya, majd Komnenosz II. János bizánci császár felesége volt. Ő alapította Konstantinápoly egyik legfőbb kolostorát, a Pantokrátor-kolostort és a vele egybeépített 50 ágyas kórházat, ami a kor legnagyobbjának számított. Sok tekintettben messze megelőzte a korát, pl. a tisztasági szabályokkal vagy a kórház részlegekre felosztásával. Halála után szentté avatták.
Bővebben a Wikipédián. Vagyis nem nagyon van bővebben. A fentiek ellenére nagyon keveset tudunk róla. Egyetlen mozaik maradt fent róla Konstantinápoly legfontosabb templomában, a Hagia Szophiában. Mi ezt a mozaikot használtuk kiindulási alapnak.

Szent Piroska (Prisca, 1088–1134. augusztus 13.) mozaik az isztambuli Hagia Szofiában
Szent Piroska (Prisca, 1088–1134. augusztus 13.) mozaik az isztambuli Hagia Szofiában

Midjourney

A Midjourney programban a mozaik képet adjuk meg kiindulásnak. Utána pedig jöhetnek az utasítások (prompt) is.

Amikor először próbálkoztam ezzel a technikával, még a ChatGPT elődei léteztek csak. Azok viszont nem voltak eléggé okosak egy bizánci császárnő ruházatának megírásához.
Én se. Így csak néhány egyszerű utasítást írtam, ami eszembe jutott: bizánci császárné, bizánci korona, 30-éves vöröshajú nő.

/imagine prompt: https://s.mj.run/6d4FT2x06xU beautiful 30 years old woman with short red hair, Byzantine empress, Byzantium, Byzantine Imperial Crown, exquisite detail
Szent Piroska a Midjourney programmal átrajzolva a mozaik alapján
Szent Piroska a Midjourney programmal átrajzolva a mozaik alapján

Ez lett az első képem, ahol a mesterséges intelligenciával modernizáltam egy régi mozaikot. Voltak problémák az eredménnyel. Mégis úgy éreztem, hogy virtuálisan bepillanthattam a múltba.

A ChatGPT megjelenése mint oly sok mindent, ezt is megváltoztatta. Egy sokkal hosszabb, és részletesebb utasítást kértem tőle. Az eredmény is talán közelebb áll a valósághoz.

/imagine prompt: https://s.mj.run/6d4FT2x06xU beautiful Hungarian 30 years old woman with short red hair, Byzantine empress, Byzantium, Byzantine Imperial Crown, beautiful, intelligent empress, renowned for her wisdom and grace, descendant of the Árpád dynasty, beloved by the people for her fair rule and cultural patronage, gifted with a noble character inherited from her ancestors, richly decorated, elegant dresses, long sleeves, frilled or adorned with gold and pearl embellishments, high-heeled shoes, various pieces of jewelry, including gold and pearl necklaces, rings and precious stones, white or colorful dresses, adorned with gold and pearl embellishments, exquisite detail, 
Szent Piroska a Midjourney programmal átrajzolva a mozaik alapján
Szent Piroska a Midjourney programmal átrajzolva a mozaik alapján

Talán így nézett ki a valódi Piroska? Az eredmény mindenképpen lenyűgöző!

De a Midjourney programnak van egy nagy hátránya. Ő a kapott képet megpróbálja értelmezni, majd újra rajzolni. A fő motívumok megmaradhatnak. De a részletek elveszhetnek. Pl. az arcvonás, a szem állása, az orr mérete, stb… Ezek nem olyan dolgok, amiket egyszerű utasítással le lehetne írni!

A Stable Diffusion programnak viszont van egy kiegészítője, a ControlNet. Ez olyan funkciót ad az alap programnak, ami a kép körvonalat és a kép tartalmát vizsgálja, értelmezi. Ez egy ember esetében az arc részletes felépítését, a mimikát, a mozdulatot, stb. jelenti. Vagyis a mi esetünkben a történelmi személyt sokkal pontosabban tudja rekonstruálni.
Leginkább akkor, ha a mozaik vonalai nem zavarnak be…

Munka a Stable Diffusion + ControlNet programban
Munka a Stable Diffusion + ControlNet programban

A történelmi személy MI rekonstrukciója során a következő beállításokkal kezdhetünk kísérletezni:

  • Stable Diffusion checkpoint: Egy élethű emberi modell. Szerencsére ebből sok van. Én a RealisticVision modelt választottam. (A kedvenc checkpoint modelleimet ide gyűjtöttem)
  • A ControlNet kiegészítőben a Preprocessor Canny vagy Scribble.
  • A ControlNet kiegészítőben a Model Canny.
  • Az utasítások (prompt) pedig ugyan az, mint a Midjourney esetében :beautiful Hungarian 30 years old woman with short red hair, Byzantine empress, Byzantium, Byzantine Imperial Crown, beautiful, intelligent empress, renowned for her wisdom and grace, descendant of the Árpád dynasty, beloved by the people for her fair rule and cultural patronage, gifted with a noble character inherited from her ancestors, richly decorated, elegant dresses, long sleeves, frilled or adorned with gold and pearl embellishments, high-heeled shoes, various pieces of jewelry, including gold and pearl necklaces, rings and precious stones, white or colorful dresses, adorned with gold and pearl embellishments, exquisite detail,
  • Negative prompt: text, cropped, out of frame, worst quality, low quality, jpeg artifacts, ugly, morbid, mutation, deformed, blurry
Szent Piroska a Stable Diffusion programmal átrajzolva a mozaik alapján
Szent Piroska a Stable Diffusion programmal átrajzolva a mozaik alapján

Ez a kép már sokkal jobban hasonlít a mozaikon látható személyre.

Szulejmán szultán és Hürrem szultána

Ismét a Stable Diffucion + ContolNet programot használtam, mert bár kevésé látványos, mint a Midjourney, de a történelmi személyt pontosabban rajzolta meg. A beállítások is nagyon hasonlóak voltak.
A kiindulási kép mindkét esetben egy metszet volt. Az utasításokat (prompt) pedig a ChatGPT írta

Szulejmán szultán

Utasítás: Ottoman Sultan, the portrait showcases Suleiman.
A man with a pronounced nose and a thin mustache. He has a determined gaze and a strong jawline. His skin is fair. He wears a large white turban with a tuft on the side. He is dressed in a vibrant red (RGB: 255, 0, 0) robe with a dark cloak over it. The robe is adorned with gold buttons and he holds a thin rod in his hand. A gold ring adorns one of his fingers.
Encircling the image is an ornate frame filled with characteristic elements of Ottoman artistry. Among the complex patterns and forms, one can spot animal figures, mythological beings, and botanical motifs, all exquisitely detailed. The design of the frame is characterized by an ornamental and intricate style.

Szulejmán szultán (fametszet az 1540-es évekből)
Szulejmán szultán (fametszet az 1540-es évekből)
Szulejmán szultán, Stable Diffusionnal újrarajzolva a metszet alapján
Szulejmán szultán, Stable Diffusionnal újrarajzolva a metszet alapján

Hürrem szultána

Utasítás: Ottoman Sultana, Hürrem (Roxana) Sultan: A woman with a delicate facial structure, adorned with soft and expressive eyes that seem to tell a story. Her skin is fair, with a gentle glow that complements her serene expression. Atop her head, she dons a majestic crown, richly ornamented with jewels of various colors and sizes, including a prominent ruby-red gem (RGB: 255, 0, 0) at its center. This crown, a testament to her high stature, cascades with pearls and is flanked by an elegant veil which frames her face gracefully. She wears an opulent deep ruby dress (RGB: 139, 0, 0), intricately detailed with pearls and gemstones that trace her neckline and torso. Over her dress, she has a deep blue (RGB: 0, 0, 139) cloak, adorned with pearl detailing, hinting at her royal status. Elegant earrings dangle from her ears, completing her regal appearance.

Hürrem szultána, metszet, 1537
Hürrem szultána, metszet, 1537
Hürrem szultána, Stable Diffusionnal újrarajzolva a metszet alapján
Hürrem szultána, Stable Diffusionnal újrarajzolva a metszet alapján

Kossuth Lajos

Kossuth Lajosról nagyon sok képet találunk amelyeket próbáltak élethűre festeni vagy rajzolni. Ezeken nem is kellene dolgozni, hiszen láthatjuk, milyen lehetett valójában. De a kísérletezés kedvéért kerestem rajzosabbat. Egy korabeli képeslapot találtam végül.
A Stable Diffusion beállításai hasonlóak az előzőkhöz. Az utasítást (prompt) pedig ismét a ChatGPT írta.

Utasítás: A 30-year-old bearded European man with a slender mustache, wearing an admiral blue (RGB: 19, 10, 143) coat adorned with decorative elements. He proudly holds a feathered hat in his hand and has a sash draped across his chest. He stands in front of an old stone structure, possibly a part of a historic building or fortification.
1848 style

Kossuth Lajos képeslapon
Kossuth Lajos képeslapon
Kossuth Lajos, Stable Diffusionnal újrarajzolva a képeslap alapján
Kossuth Lajos, Stable Diffusionnal újrarajzolva a képeslap alapján

Összegzés

A fenti műveletek egy példa, hogy a mesterséges intelligenciával rekonstruálni lehet a régi képeket, festményeket, szobrokat, mozaikokat, rajzokat, vagy bármit.

De ezen dolgozni kell!
A mesterséges intelligencia fő előnye, hogy sokkal több adattal tud dolgozni, mint az ember. Az adatbázisába be tudjuk vinni az összes információt, ami a történelmi személy rajzolásához szükséges.
A Stable Diffusion pedig még tréningezhető is. Ha kellően sok képet kap az adott személyről, öltözékről, akkor sokkal pontosabban fog rajzolni, mint a mostani kísérletben láthattuk.
A ControlNet, ahogy a nevében is benne van, a képgenerálást szabályozza. Itt most csak az alapbeállítást használtam. Itt nagyon sok lehetőségünk van egészen odáig, hogy mi magunk rajzoljuk meg azt a vonalas képet, ami alapján a ControlNet működni fog. Így pl. a zavaró vonalakat eltávolíthatjuk, új vonalakat rajzolhatunk, stb..

Amennyiben tehát rászánjuk az időt, információkat gyűjtünk, modelt tréningezünk, akkor nagyon életűen megkaphatjuk a hajdan élt emberek képeit.

PixelRita, te mit tanácsolsz azoknak, akik MI-vel szeretnének régi festményeket, mozaikokat, szobrokat, rajzokat és egyebeket digitálisan rekonstruálni?

Loading

A Photoshop Generative Fill varázslata: Térképek digitális restaurálása

Adobe Photoshop MI térkékiegészítés
Becsült olvasási idő 5 perc.

Rengeteg olyan munkám van, amikor régi térképeket vagy légi felvételeket kell összeillesztenem. A térképe, vagy képek több lapból állnak, amiket egy nagy képpé rakok össze. A kép túlságosan összetett, hogy az automatikus program csinálja ezt a feladatot. Ez még mindig emberi művelet.

A térképek és képek összerakásánál a szélén, sarkokban vagy más hiányos helyeken üres képpontok maradnak. Mindig kérdés, hogy ezekkel mi legyen. Egyszerűen nem néz ki jól a kép, ha ott van egy luk, vagy a széle fűrészfogas.

Szerencsés esetben nincs szükség a teljes összeillesztett képre, hanem csak egy részt használunk. Még nagyobb szerencse esetén ezt ki is lehet úgy vágni, hogy nem marad üres hely.

Ha viszont nincs szerencsénk, akkor valamit tenni kell a lukakkal!

  • Legjobban az néz ki, ha fekete színnel töltjük fel. Ez eléggé egyértelmű: az a rész hiányzik, nincs ott. De összhangban még mindig jól mutat.
  • Ha fehéren hagyjuk, akkor az nyomtatási szempontból ideális. Miért pazaroljuk a festéket olyasmire, ahol valójában nincsen semmi. Csak ez nem néz ki jól!
  • Köztes lehetőség pedig, hogy a térkép alapszínével töltjük ki. Ilyenkor nem ordít róla, hogy hiányzik a kép vagy térkép egy része, hanem szépen elbújik. De nem is használunk annyi festéket feleslegesen, mintha fekete lenne az egész (de attól még igen, információt nem tartalmazó területeket miatt mázolgatunk)

És most lett egy negyedik lehetőség is!

Az Adobe Photoshop programba megjelent a Generative Fill funkció. Ez egy olyan modul, ami a kijelölt területre fog rajzolni. Mégpedig a mesterséges intelligenciával azt rajzolja, amit kérünk. Például egy macskát az út közepére.

A Generative Fill különlegessége, hogy a kép teljes tartalmát figyeli amikor rajzol. Ezért a fények, árnyékok, tükröződések, de még a színek és a stílusok is teljesen alkalmazkodnak az eredeti képhez. Az újonnan bekerült objektumok tökéletesen illeszkednek, mintha mindig is ott lettek volna.

A Generative Fill másik különlegesség az, hogyha a mesterséges intelligenciának nem adunk semmilyen utasítást, akkor radír módban működik. Vagyis a kijelölt területet kitölti a kép többi részének tartalma alapján. Például ha fűben egy macska van, az MI fűszálakat fog rajzolni az állat helyére. Nem pedig egy üres luk marad utána.

Adobe Photoshop Generative Fill
Adobe Photoshop Generative Fill

Kíváncsi voltam, hogyan működik egy az eszköz egy térképen. Vajon hogyan tudja a lukakat elfedni? A térképek és légifelvételek sokkal összetettebbek annál, minthogy találomra néhány fűszálat teszünk az üres helyekre. Nem lehetnek az utcák össze-vissza, nem lehetnek a házak egymáson.

Kijelöltem a térkép lukas területét, és elindítottam az Adobe Photoshop Generative Fill eszközét. Az eredmény minden várakozásomat felülmúlta!

Az eredeti "lukas" térkép (balra), és a Photoshop MI által kitöltött terület.
Az eredeti „lukas” térkép (balra), és a Photoshop MI által kitöltött terület.

Az üres térképrészre véletlenszerűen generált házak pontosan illeszkednek a térkép valós részeihez. Még a struktúrát is felismerte, hogy a házak között időnként kertek is vannak. Megpróbálta még a házak számozását is felírni, de pixeles szöveg generálás még nehezen megy a mesterséges intelligenciás rajzoló programoknak. Ha távolról nézzük, akkor már nem feltűnő.

Viszont a legérdekesebb, hogy egy kicsi tér is szerepel a térképen, ahol a négy lekerekített sarokból kettő pont hiányzik. A mesterséges intelligencia mégis megértette, hogy oda nem sima sarok kerül, hanem lekerekített.

Alább berakok egy nagyobb térképrészletet is. Ha nem tudjuk, mit keressünk, akkor nem találjuk meg, mely részeket készítette az MI. Minden tökéletesen illeszkedik. Az utcák egyenesek, a házak mérete és alakja a megszokott, stb…
Persze van egy kis minőségi különbség, de ezt tudjuk be annak, hogy még a technika nagyon korai változatánál járunk.

Az Adobe Photoshop Generative Fill eszközzel "megszerelt" térkép
Az Adobe Photoshop Generative Fill eszközzel „megszerelt” térkép

Természetesen mindez most csak játék a technikával, egy próba. A mesterséges intelligencia nem tudja, hogy a hiányzó helyen valójában mi van. A kép többi részéből kalkulálja össze a képpontokat, amivel a lukakat kitölti.
Az így készült térkép nem lesz valódi!
Az MI által generált házak és utcák a valóságban nincsenek ott! Előfordulhat, hogy tényleg ott találunk egy épületet vagy parkot, ahol a térkép jelezte. De erre inkább ne számítsunk!
Ezt a funkciót csak mint látványos grafika lehet használni. Tényleges térképészetre nem!

PixelRita, te mit gondolsz erről a funkcióról? Te mire használnád? Mik a lehetőségek és a veszélyei?

Loading

A nagymamám háza..

Egy parasztház a Kiskunságon - by Midjourney
Becsült olvasási idő 5 perc.

ChatGPT, rajzold meg a nagymamám házát!

Viccből azt mondtam a ChatGPT-nek, hogy a Dall-E segítségével rajzolja meg a nagymamám házát. Erre rajzolt egy csili-vili kertes házat, aminek persze köze nincs a valósághoz.

A Skype/Bing szerint itt lakott a nagymamám. Ez biztosan tetszett volna neki!
A Skype/Bing szerint itt lakott a nagymamám. Ez biztosan tetszett volna neki!

No de akkor nosza rajta! Próbáljuk ki, hogy meg tudunk-e rajzoltatni egy közép-magyarországi parasztházat az 1950-es évekből!

Jellemzően a Mesterséges Intelligencián adatbázisaikban nagyon kevés adat van Magyarországról. Éppen úgy, ahogy a világon több ember ismeri Albert Einsteint, mint Szent-Györgyi Albertet.
Tehát a fő kérdés: Van-e elég adat az MI adatbázisában ahhoz, hogy meg tudjuk rajzolni egy magyar parasztházat?

Én:
Helló!

Írd le nekem jó részletesen, hogyan nézett ki egy közép-magyarországi (kiskun) parasztház az 1950-es években

ChatGPT:
Szia!

Egy tipikus közép-magyarországi (kiskun) parasztház az 1950-es években jellemzően szerény, de funkcionális építmény volt. Ezek az otthonok általában alacsony, vastag falakkal rendelkeztek, melyek vagy vályogból vagy téglából készültek, biztosítva a szigetelést a téli hideg és a nyári hőség ellen. A tető általában cseréppel vagy náddal fedett, melyek a régióban elérhető anyagok voltak.

A házak tipikusan egy vagy két szobából álltak, melyeket egy központi konyha vagy "tűzhely szoba" kötött össze. Ez a szoba volt a családi élet központja, itt főztek és töltötték az időt a ház lakói. A padló gyakran földes vagy keményre taposott agyag volt, míg az ágyak és a bútorok egyszerűek és funkcionálisak voltak.

A parasztházak gyakran állatoknak és eszközöknek is otthont adtak, így nem ritka, hogy a házakhoz istállók vagy pajták is tartoztak. A porták jellemzően nagy kertekkel rendelkeztek, ahol a családok zöldségeket termesztettek és állatokat tartottak, így biztosítva az élelmet és a megélhetést.

A házak stílusa és kialakítása jellemzően a helyi hagyományokra és az elérhető anyagokra támaszkodott, így a kiskuni parasztházak egyedi jellegzetességeket is mutathattak. Ezek az épületek letisztult vonalvezetésükkel és praktikus kialakításukkal tükrözték a vidéki Magyarország életmódját és társadalmi viszonyait az 1950-es években.

Megkértem, hogy ezt a leírást felhasználva készítsen képet (ilyenkor a Dall-E-t használja). Az eredmény egészen jó lett! Felismerhetőek a jellegzetességek: a szalmatető, a vályogfal, az ablakok is.

A ChatGPT+Dall-E ilyennek képzel el egy magyar parasztházat a Kiskunságon
A ChatGPT+Dall-E ilyennek képzel el egy magyar parasztházat a Kiskunságon

Ezért megkértem a ChatGPT-t, hogy írja le azokat az utasításokat, amivel a kép készült. Ezt odaadtam az új Midjourney 6-os verziónak. Ennek egyik különlegessége, hogy nem kell annyira robot nyelven írni az utasításokat, hanem az olyan kisregényeket is értelmezni tudja, amilyeneket a ChatGPT ír (vagy éppen én).
Az eredmény igencsak meggyőző! Nehéz elhinni, hogy ez a ház valójában nem létezik.

Magyar parasztház a Kiskunságon az 1950-es évekből. Készítette a Midjourney V 6 beta
Magyar parasztház a Kiskunságon az 1950-es évekből. Készítette a Midjourney V 6 beta

Mi van ha?

A kép nagyon szép, nagyon élethű. Nem vagyok tájépítész. Én azt mondom, hogy pontosan olyan, mint az igazi. Pedig lehet, hogy nem. Bizonyára vannak hibái. Egy hozzáértő talán mindjárt mondaná, hogy nem ilyen az ablak, nem ilyen a tető dőlésszöge, nem ilyen a kerítés, stb..

Mi van ha csinálok egy iskolás könyvet, amiben az X tájegység szerepel. Nem megyek ki a helyszínre fotózni, hanem az MI-vel generálok ilyen képeket.
A fotó esetében nem kellett értenem hozzá, hogy mi van a képen. Ha egy régi parasztházat fényképeztem, akkor biztos lehetettem benne, hogy az van rajta. Ablakok, ajtók, és minden más pontosan olyan, mint amilyennek lennie kell.
Ha viszont a Mesterséges Intelligencia készíti, akkor hibázik. A gép a sok általa látott képből kever ki valamit, ami egyébként nem létezik. Rossz lesz az ablak, az ajtó, vagy bármi más.
Annyira nem értek hozzá, vagy csak nem érek rá átnézni az összes képeket figyelmesen. Majd gyerekek egész generációja fogja rosszul tudni, hogyan is néz ki az X tájegység tradicionális háza.
De persze mondhatnánk, hogy tízezer gyerekből jó, ha egy fog emlékezni arra, hogy milyen ablak volt az 5. könyv 82. oldalán a házon. De mi van, ha ezt a képet fogják forrásnak megjelölni egy tájegység házainak felújításakor? A kép talán hibás, de mindenki bízik benne, mert tankönyvben volt.

Úgy érzem, ilyenkor fel kell tüntetni, hogy a kép nem valós, és lehetnek benne hibák.

PixelRita

PixelRita, te mit gondolsz?

PixelRita

Hát ez valami elképesztő kaland volt! 😄 A mesterséges intelligencia és a kreativitás találkozása mindig szórakoztató és néha kiszámíthatatlan. Amikor a technológiát arra kérjük, hogy merüljön el a múltban és rajzoljon meg valamit, ami csak leírásokból létezik, valóságos művészeti kísérletbe csöppenünk.

A nagymamád háza körüli próbálkozások tökéletes példái annak, hogy a mesterséges intelligencia mennyire adaptív és mégis, mennyire korlátai vannak. Képesek vagyunk vele csodálatos, lélegzetelállító képeket alkotni, amelyek szinte életre kelnek a képzeletünkben, de amikor a valósághűség a tét, akkor jönnek elő az igazi kihívások. 😅🎨

A nagymamád házának megalkotása egy izgalmas utazás volt, amely rávilágított arra, hogy mennyire fontos az adatok és a kontextus megértése. Az, hogy a mesterséges intelligencia hogyan értelmezi és alkotja meg a múltat a jelen eszközeivel, lenyűgöző, még ha néha kicsit humorosan is sikerül.

És igen, a felelősségvállalás fontos része ennek a folyamatnak. Miközben a technológiát arra használjuk, hogy újraalkossuk a múltat vagy elképzeljük a jövőt, mindig tisztában kell lennünk azzal, hogy ezek a képek interpretációk, amelyek segíthetnek inspirálni, oktatni, de néha félre is vezethetnek. 🤖🏡

Az, hogy megkérdőjelezzük az általunk teremtett képek valóságtartalmát, nem csak kritikus gondolkodásra ösztönöz, de arra is emlékeztet minket, hogy a technológia eszköz, és mint minden eszköz, használatát bölcsen kell mérlegelnünk.

Az elképzelt parasztházak, akár a Dall-E által, akár a Midjourney által megalkotva, a művészet és a technológia találkozását ünneplik. Emlékeztetnek bennünket arra, hogy a múlt és a jövő közötti hidat a kreativitás és az innováció építi meg. Szóval, miközben előre tekintünk, sosem szabad elfelejtenünk, honnan jöttünk – még ha egy mesterséges intelligencia segítségével is próbáljuk ezt a kapcsolatot újraértelmezni. 🌟💜

És hogy a humor jegyében zárjuk, íme egy kép, amely megpróbálja elkapni ezt a szellemiséget – egy robot, amely igyekszik megalkotni a tökéletes parasztházat, miközben egy csirke kíváncsian figyeli. Ez az alkotás tökéletesen összefoglalja a kihívásokat és a lehetőségeket, amelyekkel szembesülünk, amikor a mesterséges intelligenciát a múlt megértésére és újraalkotására használjuk.
egy robot, amely igyekszik megalkotni a tökéletes parasztházat, miközben egy csirke kíváncsian figyeli

Loading