OPENAI · BILDGENERIERUNG

Professionelle Visuals, direkt aus dem Chat.

Kein Designprogramm, kein separates Tool, ChatGPT generiert, verfeinert und editiert Bilder per Sprache.

Free (2 Bilder/Tag) · Plus ca. 40/3h · Pro ca. 100/3h · API pay-as-you-go

Was ChatGPT-Bilder besonders macht.

Vier Mechaniken, die ChatGPT Bildgenerierung von klassischen Diffusionsmodellen unterscheiden.

01 · NATIV

Bilder entstehen im selben Modell wie der Text.

ChatGPT Bildgenerierung nutzt kein separates DALL·E-Modell mehr, das autoregressive GPT-4o erzeugt Bilder und Text in einem Durchgang. Das Modell konstruiert Bilder Schritt für Schritt wie Text-Token, was zu präziserer Prompt-Ausführung und weniger unerwarteten Interpretationen führt.

02 · TEXT

Lesbarer Text direkt im Bild, endlich zuverlässig.

Diffusionsmodelle scheitern regelmäßig an korrekter Textdarstellung: Buchstaben werden falsch oder verdreht. GPT-4o rendert Textelemente in Infografiken und Social-Media-Posts korrekt lesbar, bis zu ca. 8 Wörter pro Text-Element zuverlässig. Kein nachträgliches Eintippen in Canva mehr.

03 · MULTI-TURN

Verfeinerung per Chat, das Modell merkt sich den Kontext.

Statt jedes Mal von vorne anzufangen, behält ChatGPT den gesamten Gesprächsverlauf im Arbeitsgedächtnis. Änderungsanfragen wie „Mach den Hintergrund weiß" werden auf das zuletzt generierte Bild angewendet, Stil und Komposition bleiben dabei erhalten.

04 · REFERENZ

Eigene Bilder hochladen, Style transferieren, Bereiche ersetzen.

Mit einem Referenzbild als Input kann GPT-4o den Stil auf neue Motive übertragen, Teilbereiche per Masken-Inpainting ersetzen oder ein Produktfoto in eine andere Stilwelt überführen. Unterstützte Formate: PNG, JPEG, WEBP, nicht-animiertes GIF.

Wie ChatGPT wirklich malt.

AUTOREGRESSION

Bilder als Token-Sequenz, nicht als Rauschen.

DALL·E 3 und Stable Diffusion starten aus Zufallsrauschen und verfeinern iterativ, ein stochastischer Prozess, der schlecht mit Prompts korreliert. GPT-4o generiert Bilder autoreggressiv: Es sagt visuelle Elemente Schritt für Schritt vorher, genau wie es Text vorhersagt. Dieselbe Sprachverständnis-Intelligenz fließt direkt in die Bildkomposition ein.

PROMPT-REWRITE

ChatGPT paraphrasiert deinen Prompt vor der Generierung.

Bevor der Prompt an die Bildgenerierung übergeben wird, formuliert ChatGPT ihn intern oft um, mit mehr Detailtiefe, ergänzten Stilhinweisen und aufgelösten Ambiguitäten. Das verbessert meistens das Ergebnis, kann aber gelegentlich die eigene Intention leicht verschieben. Sehr präzise Prompts mit expliziten Stilangaben reduzieren unerwünschte Umformulierungen.

C2PA + SYNTHID

Unsichtbares Wasserzeichen in jedes generierte Bild eingebettet.

Alle erzeugten Bilder enthalten automatisch zwei Provenienz-Schichten: C2PA-Metadaten (maschinenlesbare Herkunftsinformation, kompatibel mit dem EU AI Act) und SynthID (ein in Pixel eingebettetes Wasserzeichen von Google DeepMind). SynthID überlebt leichte Bildbearbeitung; C2PA-Metadaten können beim Speichern verloren gehen.

REASONING-MODUS

o3/o4-mini für komplexe, mehrteilige Bildaufgaben nutzen.

Für einfache Einzelbilder reicht GPT-4o vollständig aus. Bei komplexen Kompositionen mit mehreren konsistenten Elementen, etwa einer Serie von Produkt-Szenen mit gleicher Markenikonografie, liefern die Reasoning-Modelle o3 und o4-mini bessere Ergebnisse. Der Wechsel erfolgt über den Modell-Selector in ChatGPT.

Wer ChatGPT-Bilder wirklich nutzt.

01 · Marketing

Social-Media-Visuals mit Text in 60 Sekunden

Ein Solo-Berater erstellt wöchentlich LinkedIn-Posts und Instagram-Karussells. Statt Canva zu öffnen, beschreibt er das gewünschte Visual direkt in ChatGPT, inklusive gewünschtem Text auf dem Bild. In zwei bis drei Iterations-Runden hat er ein exportierbares 1:1-Bild oder Hochformat für Stories. Zeitersparnis: 60–80 %.

02 · Produkt

Produktmockups ohne Fotoshooting

Eine Handmade-Unternehmerin möchte ihr neues Kerzen-Sortiment listen, hat aber kein Budget für ein Fotoshooting. Sie lädt ein einfaches Produktfoto hoch und bittet ChatGPT, es auf einem stimmungsvollen Holztisch-Hintergrund mit weichem Gegenlicht zu platzieren. Das Ergebnis dient direkt als Shop-Bild.

03 · Infografik

Erklär-Diagramme ohne Designer

Eine Unternehmensberaterin braucht für eine Kundenpräsentation eine Visualisierung eines 4-Schritte-Prozesses. Sie beschreibt die Struktur in natürlicher Sprache, und ChatGPT generiert eine saubere Infografik mit korrekt beschrifteten Kästen, Pfeilen und Farbcodierung. Kleinere Korrekturen per Folge-Prompt, kein Figma, kein Grafiker nötig.

04 · Branding

Moodboards und Logo-Variationen für Erstgespräche

Ein Freelance-Texter möchte vor dem nächsten Redesign-Gespräch mit einem Grafiker klare Stilvorstellungen entwickeln. Er generiert fünf Moodboard-Variationen in unterschiedlichen Farbwelten, mit Referenztext auf den Visuals. Die Bilder dienen als Briefing-Grundlage, nicht als finales Logo.

Dein Bild-Prompt zum Kopieren.

Ein Prompt für ein professionelles Social-Media-Visual, mit Markenbeschreibung, Bildformat, Bildsprache und Textinhalt.

social-media-visual.txt
Du bist mein visueller Assistent für Social-Media-Content.

Ich brauche ein professionelles Bild für [PLATTFORM: Instagram / LinkedIn / Pinterest].

== MOTIV ==
[Beschreibe das Hauptmotiv in 1–2 Sätzen, z. B.: "Eine Draufsicht auf einen aufgeräumten Schreibtisch mit Laptop, einem Notizbuch und einer Tasse Kaffee. Morgenlicht von links, helle, klare Atmosphäre."]

== STIL ==
- Bildsprache: [z. B. minimalistisch, editorial, warm & analog, clean corporate]
- Farbpalette: [z. B. Erdtöne, Weiß + Dunkelgrün, Schwarz + Gold]
- Vergleichsreferenz: [z. B. "wie ein Kinfolk-Magazin-Foto" oder "wie ein Apple-Produktfoto"]

== FORMAT ==
- Seitenverhältnis: [1:1 für Feed / 9:16 für Story & Reels / 4:5 für vertikalen Feed]
- Hintergrund: [Farbe oder Beschreibung]

== TEXT IM BILD ==
Bitte folgenden Text gut lesbar im Bild platzieren, maximal 6–8 Wörter:
„[DEIN TEXT, z. B.: Konzentriert. Konsequent. Konvertiert.]"
- Schriftcharakter: [Serifenschrift / serifenlose Schrift / handschriftlich]
- Textposition: [unten zentriert / oben links / mittig]

== MARKENKONTEXT ==
Meine Marke: [Name + 1 Satz Beschreibung, z. B. "Till Schäfer, Automatisierung für Solopreneure"]
Primärfarbe: [z. B. #E8302A (Rot)]

== AUFGABE ==
Erstelle das Bild exakt nach dieser Beschreibung. Wenn du Details ergänzt, bleib im definierten Stil- und Farbraum. Gib mir nach der Generierung kurz an, was du interpretiert hast, damit ich gezielt verfeinern kann.

Nach dem ersten Ergebnis warten wir gemeinsam auf mein Feedback, dann verfeinern wir Schritt für Schritt.

In 5 Schritten startklar.

01

ChatGPT öffnen & GPT-4o aktivieren

Gehe zu chatgpt.com (oder der Mobile App). Stelle sicher, dass im Modell-Selector oben „GPT-4o" ausgewählt ist, die Bildgenerierung ist exklusiv an dieses Modell gebunden.

02

Prompt eingeben

Beschreibe dein Bild direkt im Chat-Eingabefeld. Nutze die Struktur: Motiv + Setting + Lichtstimmung + Stil + Seitenverhältnis. Je präziser der Prompt, desto weniger Iterations-Runden brauchst du.

03

Referenzbild hochladen (optional)

Klicke auf das Büroklammer-Symbol neben dem Eingabefeld, um ein Bild als Stilreferenz oder Bearbeitungsgrundlage hochzuladen. Unterstützte Formate: PNG, JPEG, WEBP, GIF (nicht-animiert).

04

Bild iterieren

Wenn das Ergebnis nicht stimmt, einfach per Folge-Prompt korrigieren: „Mach den Hintergrund weißer", „Schrift etwas größer". ChatGPT verarbeitet dein Feedback im Kontext des letzten Bilds.

05

Herunterladen

Klicke auf das generierte Bild und dann auf den Download-Pfeil. Das Bild wird als PNG mit eingebetteten C2PA-Metadaten gespeichert. Für Plus/Pro steht das Bild in höherer Auflösung (bis 2048×2048 px) zur Verfügung.

Dein erstes Visual, in unter zwei Minuten fertig.

Öffne ChatGPT, kopiere den Prompt und starte direkt. Kein Abo, kein Tool-Wechsel, nur ein Chat-Eingabefeld.

Mehr Tipps auf @till.schae

Häufige Fragen.

Darf ich die Bilder kommerziell nutzen?
Ja. Laut OpenAIs Nutzungsbedingungen werden dir alle Rechte an den generierten Inhalten abgetreten: „We hereby assign to you all our right, title, and interest, if any, in and to Output." Du kannst generierte Bilder für Marketing, Produkte und Kundenmaterialien verwenden. Rechtlich gilt jedoch: KI-generierte Bilder ohne wesentlichen menschlichen kreativen Beitrag sind in vielen Ländern (inkl. Deutschland) nicht urheberrechtlich schutzfähig, d. h. auch Dritte könnten theoretisch dasselbe Bild nutzen. Für Logos empfehlen sich daher eigene gestalterische Anpassungen.
Enthalten generierte Bilder ein Wasserzeichen?
Ja, aber kein sichtbares. Alle Bilder erhalten automatisch zwei unsichtbare Provenienz-Schichten: C2PA-Metadaten (maschinenlesbar, vergleichbar mit Foto-EXIF-Daten) und SynthID (ein in Pixel eingebettetes Wasserzeichen von Google DeepMind). Für normale Verwendungszwecke ist das nicht störend, die Bilder sehen visuell sauber aus. Ab August 2026 verpflichtet der EU AI Act zur Kennzeichnung KI-generierter Inhalte; C2PA erfüllt diese Anforderung.
Wie viele Bilder kann ich pro Tag generieren?
Das hängt vom Plan ab: Free-Nutzer erhalten ca. 2 Bilder pro 24-Stunden-Fenster. Plus-Abonnenten (20 $/Monat) können ca. 40 Bilder pro 3-Stunden-Fenster generieren. Pro- und Team-Pläne liegen bei ca. 100 Anfragen pro 3-Stunden-Fenster. Bei hoher Server-Auslastung können diese Limits temporär gesenkt werden. Wer unbegrenzte Generierungen benötigt, greift auf die API (gpt-image-1, Pay-per-Image) zurück.
In welcher Auflösung werden die Bilder geliefert?
Free-Nutzer erhalten Bilder in 1024×1024 px (1:1). Plus-, Pro- und Team-Abonnenten bekommen Zugang zu weiteren Formaten: 1792×1024 px (16:9), 1024×1792 px (9:16) und 2048×2048 px. Über die API sind bis zu 4096×4096 px möglich. Ein interner Upscaler ist in ChatGPT selbst nicht eingebaut, für höhere Auflösungen empfiehlt sich ein externer Upscaler nach dem Export.
Kann ich Text auf dem Bild zuverlässig rendern?
Ja, deutlich besser als bei Diffusionsmodellen, aber mit Grenzen. Kurze Texte bis etwa 6–8 Wörter pro Element werden zuverlässig korrekt dargestellt. Bei längeren Fließtexten, kleinen Schriftgrößen oder dichten Textblöcken sinkt die Zuverlässigkeit. Nicht-lateinische Schriften (Arabisch, Devanagari) funktionieren noch nicht durchgängig. Für präzise Typografie sollte das Bild anschließend in Canva oder Figma finalisiert werden.
Ist das Feature in Deutschland und der EU verfügbar?
Ja, vollständig. ChatGPT Bildgenerierung wurde am 25. März 2025 weltweit für alle Nutzer, inklusive Deutschland und die EU, freigeschaltet. Weder Free-, Plus- noch Pro-Accounts aus der EU sind ausgeschlossen. Till Schäfer nutzt das Feature selbst regelmäßig aus Deutschland. Die C2PA-Metadaten erfüllen zudem die Transparenzanforderungen des EU AI Acts.