Přeskočit na obsah

Co znamená Text-to-image?

Text-to-image je typ generativní umělé inteligence, která z textového popisu vytvoří obrázek. Napíšete „liška v zimním lese, akvarel“ a model namaluje obrázek, který popisu odpovídá. Patří sem třeba Midjourney, DALL·E, Stable Diffusion nebo Krea.

Model nezačíná od skici. Většina dnešních modelů vychází z náhodného šumu a krok za krokem z něj skládá obraz podle toho, jak rozumí zadání (promptu). Novější modely čtou celé věty, starší spíš jednotlivá klíčová slova.

Na co si dát pozor

Text neurčuje, kde přesně co v obrázku bude. „Pes vlevo, kočka vpravo“ model někdy trefí, jindy ne. Když záleží na rozložení, používá se img2img, kdy model dostane jako předlohu i obrázek. U veřejných služeb navíc zadání i výsledek odcházejí na servery provozovatele. Kdo to nechce, může model provozovat lokálně na vlastní grafické kartě.

Související pojmy: img2img, prompt engineering.

Medvěd lední

Zajímá vás k tomu více?

Napište. Ozveme se, i když to není poptávka.

Odesláním souhlasíte se zpracováním osobních údajů .