AI genererade bilder

monroe ai

AI, eller Artificiell Intelligens, erbjuder otaliga möjligheter för mänskligheten. Samtidigt innebär det en förändring av arbetsmarknaden där vissa yrkesroller riskerar att minska i betydelse. Som formgivare kan jag till exempel undra om våra designkunskaper alltid kommer att vara lika efterfrågade i en AI-driven framtid.

Skapa bilder med AI

En av de mest imponerande användningsområdena för AI inom design är möjligheten att skapa bilder baserat på textbeskrivningar. Jag testade detta med Pixlr AI Image Generator och gav följande beskrivning: ”Marilyn Monroe sitter i röd klänning på ett kontor framför en laptop.” Resultatet var överraskande, men långt ifrån naturtroget. Pixlr.com är enligt Googles egen AI Gemini ”ett mycket bra och kapabelt verktyg för fotoredigering och grafisk design direkt i webbläsaren.” Det är ett av de mest populära alternativen för användare som vill ha kraftfulla funktioner utan att behöva installera tunga program som Adobe Photoshop eller betala för dyra licenser. Tyvärr har Pixlr bara fått meelmåttigt betyg av Trustpilot. Det finns många fler alternativ som Photopea, Canva och Gimp. Det bör också nämnas att det var flera år sedan den här artikeln skrevs och mycket har förbättrats. Dagens bilder är generellt mycket mer naturtrogna.

För att förstå hur detta med bilder fungerar konsulterade jag också ”Chat” (min personliga benämning på ChatGPT), och som vanligt fick jag ett snabbt och detaljerat svar.


Min fråga till ChatGPT:

Hej ”Chat”! Jag testade att skapa bilder med AI och undrar hur tekniken fungerar. Kan du också förklara vad som ligger bakom denna förmåga?


Hur fungerar AI-baserat bildskapande?

Svar från ChatGPT:

AI som skapar bilder utifrån textbeskrivningar använder generativa modeller. Dessa är en typ av artificiell intelligens som tränas på stora mängder data för att producera nya, liknande data. Här är de två huvudsakliga teknikerna:

1. Generative Adversarial Networks (GANs):
GANs består av två neurala nätverk – en generator och en diskriminator. Generatorn skapar bilder som försöker efterlikna riktiga bilder, medan diskriminatorn avgör om en bild är genererad eller autentisk. Genom denna dynamiska träning förbättras generatorn för att skapa allt mer realistiska bilder.

2. Transformer-modeller:
Dessa modeller är designade för att hantera sekvenser av data, såsom text. GPT-3.5 (som ChatGPT bygger på) är en transformer-modell som kan generera bilder genom att analysera textbeskrivningar och använda tidigare inlärd kunskap för att skapa en visuell representation.

Hur AI steg för steg genererar bilder:

1. Datainsamling:
Modellen tränas på ett omfattande dataset som kopplar textbeskrivningar till matchande bilder. Till exempel kan texten ”en brun hund som springer i en park” kopplas till flera bilder som matchar beskrivningen.

2. Modellträning:
Under träningen lär sig modellen att identifiera mönster och samband mellan text och bild. Den justerar sin förmåga att generera bilder som stämmer överens med givna textbeskrivningar.

3. Bildgenerering:
När modellen är färdigtränad kan den skapa nya bilder baserat på textbeskrivningar. Resultatet beror på modellens träning och på hur detaljerad textbeskrivningen är.

Begränsningar och möjligheter

Det är viktigt att notera att AI-genererade bilder inte alltid blir perfekta. Kvaliteten kan variera beroende på träningsdatan och beskrivningens komplexitet. I vissa fall kan bilderna vara mer fantasifulla än realistiska, vilket kan vara både en styrka och en begränsning.

Testa gärna vad ChatGPT kan!

Källa: https://openai.com/chatgpt

Rulla till toppen