GOOGLE · FLOW

Drei Bilder. Ein Take, vom All bis zum Anstoß.

Ein Erdglobus-Screenshot, eine Stadion-Nahansicht und ein KI-Stilbild, und Google Flow verschmilzt alle drei zu einem einzigen, ununterbrochenen Flug vom Weltall bis auf den Rasen.

Free (eingeschränkt) · Google AI Plus (4,99 €/Monat) · Google AI Pro (21,99 €/Monat) · Google AI Ultra (ab 99,99 €/Monat)

Was Earth-Zoom besonders macht.

Vier Bausteine, die aus zwei Kartenscreenshots und einem Stilbild einen durchgehenden One-Take-Flug machen.

01 · DREI ZUTATEN

Drei Bilder, drei Rollen.

Startpunkt im All, Zielort am Boden, visueller Stil: Flows „Ingredients to Video"-Modus verschmilzt bis zu drei Referenzbilder zu einer durchgehenden Reise, nicht zu drei Einzelclips.

02 · KEIN SCHNITT

Ein ununterbrochener Take.

Der komplette Weg von der Erdkugel im All bis in den Innenraum des Stadions entsteht als EIN durchgehender Take, ohne Szenenwechsel, ohne Compositing.

03 · AUDIO INKLUSIVE

Ton entsteht automatisch mit.

Veo 3.1 generiert den Ton nativ mit: Stille im All, Wind beim Sinkflug, Stadt-Ambience, Stadion-Jubel, synchron zur Bildbewegung, ohne separates Sounddesign.

04 · REALER ORT, ERFUNDENE DETAILS

Glaubwürdig, nicht vermessen.

Stadt und Stadion sind erkennbar echt: Lage, Form, Umgebung. Details wie Fassaden, Zuschauer und Spielzüge sind KI-generiert: genug für einen glaubwürdigen Reveal, nicht für eine Vermessung.

Wie Earth-Zoom wirklich arbeitet.

01 · Bild-Rollen statt Bild-Kopie

Jedes Bild bekommt eine feste Rolle.

Flow interpretiert jedes der drei Ingredients funktional (Startort, Zielort, Stil), nicht pixelgenau. Der Prompt muss explizit sagen, welches Bild wofür steht, sonst mischt das Modell die Rollen.

02 · Kontinuität per Sprache

Regieanweisungen, keine Stimmung.

„Continuous single take", „no cuts", „no time skips" im Prompt sind harte Regieanweisungen, keine Stimmungsbeschreibung, ohne sie neigt das Modell zu Schnitten zwischen den Ingredient-Szenen.

03 · Modellwahl entscheidet

Länge und Audio hängen vom Modell ab.

Nur Veo 3.1 Fast und Gemini Omni Flash liefern 10-Sekunden-Clips; die Standard-/Quality-Variante deckelt bei 8s. Für die volle Space-to-Stadium-Reise in einem Take muss die Modellwahl bewusst getroffen werden.

04 · Ton aus Text

Audio entsteht aus der Beschreibung.

Die vier Audio-Phasen im Prompt (Stille, Wind, Stadt, Stadion) sind Text, das Modell leitet daraus Klanglandschaft und Timing ab, synchron zur visuellen Handlung, ohne separate Tonspur.

Wer Earth-Zoom wirklich nutzt.

01 · Agentur-Inhaber

Eventlocation-Ankündigung

Eine Marketing-Agentur kündigt eine neue Konferenz-Location an: Space-Zoom auf die Stadt, dann Reveal des Veranstaltungsorts, als Teaser-Reel für Social Media, ohne Kamerateam vor Ort.

02 · Solo-Makler:in

Immobilien-Exposé

Der Zoom von „irgendwo auf der Welt" direkt auf das zu verkaufende Objekt funktioniert als emotionaler Opener für ein Instagram-Reel oder YouTube-Shorts-Exposé, Aufmerksamkeit in den ersten Sekunden, bevor Grundriss/Preis folgen.

03 · Content-Creator

Stadtmarketing & Tourismus

Städte- oder Regionsmarketing nutzt den Effekt, um eine Sehenswürdigkeit, ein Hotel oder ein Festivalgelände zu bewerben, der Space-Zoom liefert einen wiedererkennbaren, hochwertig wirkenden Opener ohne Drohnenflug-Genehmigung.

04 · Sportverein

Vereins- & Sponsoring-Content

Ein Verein erzeugt einen Hype-Clip vor dem Heimspiel: Zoom aus dem All direkt ins volle Stadion, Einsatz für Social Media, LED-Wand im Stadion oder Sponsoren-Präsentation.

Dein Earth-Zoom-Prompt zum Kopieren.

Tills Original-Prompt für den kompletten Space-to-Ground-One-Take, kopieren und [CITY]/[COUNTRY]/[LANDMARK] durch deinen eigenen Ort ersetzen.

earth-zoom-prompt.txt
Create a continuous cinematic single-take video in 9:16 vertical format, with absolutely no cuts, no jumps, no scene transitions, and no time skips. The entire shot must feel like one uninterrupted realistic drone journey.

Begin in outer space with a view of the Earth as a full globe suspended in deep space, similar to Google Earth. The camera starts far away and rapidly flies toward the planet in a smooth, realistic, physically believable motion. The destination is [LANDMARK], [CITY], [COUNTRY]. The movement should feel immersive and seamless, as if the viewer is being pulled from space directly toward the location.

As the camera approaches Earth, it locks onto the region and zooms smoothly toward [CITY]. The descent continues through the upper atmosphere with intense cinematic motion blur, subtle light streaks, and a strong sensation of speed. The camera passes naturally through layers of clouds and reveals the city of [CITY] below, with realistic geography, waterways or streets, urban structure, and lighting.

The camera keeps descending in one continuous move, transitioning naturally from a steep vertical drop into a controlled drone-like flight path over the city. The motion should feel like an expertly piloted FPV drone: fast, smooth, dynamic, but always grounded in reality. The route leads directly toward [LANDMARK], which becomes clearly recognizable from above, matching its real-world shape and surroundings.

The camera flies closer toward [LANDMARK] and continues seamlessly into the location. [DESCRIBE WHAT IS HAPPENING AT THE DESTINATION, e.g. a live event, a crowd, an activity, or a calm establishing scene, replace this line with your own scene description].

Once at the destination, the drone performs one smooth circular orbit around the location, flying around it in a clean and cinematic motion, capturing it from multiple angles while remaining part of the same uninterrupted shot. The drone movement should include subtle banking and natural aerial maneuvering, but remain elegant and realistic.

The final result must feel like a breathtaking, realistic journey from the globe in space all the way into [LANDMARK], all in one single continuous shot.

Style: ultra-realistic, cinematic realism, photographic quality, depth of field, atmospheric haze, natural lighting, detailed city textures, realistic architecture, high-end drone cinematography.

Audio: begin with near-silence in space, then transition into rushing atmospheric wind during descent, subtle city ambience over [CITY], and finally [DESCRIBE DESTINATION SOUND, e.g. crowd cheering, calm ambient sound, event atmosphere], a natural soundscape matching the final scene.
Wichtig: Die drei Bild-Uploads (Globus mit Pin, Ziel-3D-Ansicht, Stil-Referenzbild) müssen VOR dem Prompt in Google Flow als Ingredients hochgeladen werden, der Prompt allein reicht ohne die drei Bilder nicht für dieses Ergebnis.

In 5 Schritten startklar.

01

Startbild besorgen

In Google Earth (Web oder App) auf den Zielort zoomen, dann herauszoomen bis zur vollen Erdkugel im All, roten Pin auf dem Zielort setzen, Screenshot speichern.

02

Zielbild besorgen

In Google Earth zur 3D-Schrägansicht (Tilt/45°-Ansicht) des exakten Zielorts wechseln (z. B. Stadion, Gebäude, Platz) und einen zweiten Screenshot aus der Luftperspektive speichern.

03

Stil-Referenzbild erzeugen

Mit ChatGPT (oder einem anderen Bildmodell) ein fotorealistisches 9:16-Bild generieren lassen: Blick aus dem Orbit auf eine nächtliche Stadt mit Erdkrümmung und Sternenhimmel, dient als Look-Referenz für den Space-Übergang.

04

In Flow hochladen

In Google Flow „Ingredients to Video" wählen, alle drei Bilder in die drei Ingredient-Slots hochladen, Seitenverhältnis auf 9:16 stellen, Modell Veo 3.1 Fast oder Gemini Omni Flash wählen (für 10 Sekunden + Audio).

05

Prompt einfügen & generieren

Den One-Take-Prompt (oben, mit eigenem [CITY]/[LANDMARK]) einfügen, Dauer auf 10s stellen, Generierung starten, Ergebnis nach ca. 1–2 Minuten prüfen, bei Bedarf Prompt-Details nachschärfen und neu generieren.

Dein eigener Space-to-Ground-Flug, ein Take, kein Schnitt.

Drei Bilder, ein Prompt, zehn Sekunden, probier den Earth-Zoom-Workflow für deinen eigenen Ort aus.

Mehr Tipps auf @till.schae

Häufige Fragen.

Brauche ich für den Earth-Zoom-Effekt eine echte Drohne oder Vermessungsdaten?
Nein. Alle drei Eingabebilder kommen aus Google Earth (frei zugänglich) und einem KI-Bildgenerator, es fliegt kein echtes Fluggerät, es wird nichts vermessen. Der komplette Flug entsteht als reine KI-Videogenerierung aus Google Flow.
Warum braucht dieser Workflow drei Bilder statt nur eines wie beim einfachen Flythrough?
Flythrough-Workflow nutzt dagegen nur ein Referenzbild plus rote Route." data-en="Because a continuous journey across two entirely different locations (outer space and the destination) with a specific visual style is meant to emerge here. Flow's 'Ingredients to Video' mode is built exactly for that: up to three reference images are fused into a single coherent clip, instead of just animating one starting image. The simpler flythrough workflow, by contrast, uses only one reference image plus a red route.">Weil hier eine durchgehende Reise über zwei völlig unterschiedliche Orte (Weltall und Zielort) mit einem bestimmten visuellen Stil entstehen soll. Flows „Ingredients to Video"-Modus ist genau dafür gebaut: bis zu drei Referenzbilder werden zu einem einzigen kohärenten Clip verschmolzen, statt nur ein Startbild zu animieren. Der einfachere Flythrough-Workflow nutzt dagegen nur ein Referenzbild plus rote Route.
Folgt die Kamera exakt der Route zwischen den Bildern, die ich hochlade?
Nur ungefähr. Die drei Bilder liefern Komposition, Ort und Stil als Referenz, das Modell rendert die gesamte Szene neu und interpretiert sie, statt sie pixelgenau zu übernehmen. Lage und grobe Form von Stadt und Zielort stimmen erkennbar, feine Details (Fassaden, Personen, exakte Texturen) sind generiert.
Wie lang und in welcher Auflösung ist der fertige Clip, und ist Ton dabei?
Mit Veo 3.1 Fast oder Gemini Omni Flash entstehen bis zu 10-Sekunden-Clips in 9:16 (Standard-Preview 720×1280, Upscale auf 1080p/4K je nach Modell möglich), inklusive nativ generiertem, zur Bildbewegung synchronem Audio (z. B. Weltraum-Stille, Wind, Stadt-Ambience, Stadion-Jubel). Veo 3.1 Lite/Quality sind auf 8 Sekunden begrenzt.
Was kostet der Workflow, und geht das auch kostenlos?
Google AI Pro (21,99 €/Monat, 1.000 Flow-Credits) reicht für regelmäßige Generierungen mit Modellzugang zu Veo 3.1. Google AI Ultra (ab 99,99 €/Monat, 10.000 Credits, höhere Stufe 219,99 €/Monat mit 25.000 Credits) entfernt zusätzlich das sichtbare „Veo"-Logo. Der kostenlose Zugang funktioniert im Ansatz, liefert aber niedrigere Qualität und ein sichtbares Wasserzeichen.
Ist im fertigen Video ein Wasserzeichen zu sehen?
Jeder Veo-Output trägt ein unsichtbares SynthID-Wasserzeichen zur KI-Kennzeichnung, das bleibt immer erhalten, unabhängig vom Abo. Ein zusätzliches sichtbares „Veo"-Logo erscheint im Free-Tier und bei Google AI Pro; nur Google-AI-Ultra-Abonnenten bekommen es innerhalb von Flow nicht angezeigt.