AI VIDEO
Teile fallen, die Luft friert, das Auto steht.
Auf dieser Bergstraße hat nie ein Auto gestanden, und gefilmt habe ich sie auch nicht. Vier Referenzbilder aus ChatGPT, ein Prompt mit Sekundenstempeln, zehn Sekunden Seedance 2.5 — und das Auto baut sich mitten in der Luft zusammen.
- ChatGPT
- Artlist
- 40 Min
- Fortgeschritten
ERGEBNIS
Das ist dabei rausgekommen.
- 4Referenzbilder
- 1Prompt mit Sekundenstempeln
- 10sein Take, kein Schnitt
- 9:161080 × 1920 aus Seedance 2.5
-
Der Himmel wirft ab0:00 – 0:02
-
Aufschlag auf dem Asphalt0:02 – 0:03
-
Fäuste zu, Schwerkraft aus0:03 – 0:05
-
Alles auf einmal nach innen0:05 – 0:06
-
Schnipsen, Licht an, weg0:07 – 0:10
DAS BRAUCHST DU
Womit das gebaut ist.
ChatGPT
Artlist
-
@image1 · die leere BühneStraße, Licht, Bodenmarke
-
@image2 · der FreezeBildaufbau und Hände
-
@image3 · das ZielSollte die Ausrichtung setzen
-
@image4 · die Identität des AutosForm, Farbe, Felgen, Linien
ANLEITUNG
So baust du es nach.
-
Die leere Bühne bauen
Zuerst entsteht in ChatGPT die Straße, auf der später alles passiert — hochkant, freier Vordergrund, Licht von hinten. Zwei Dinge müssen drin sein: eine klar erkennbare Bodenmarke, bei mir der reparierte Riss im Asphalt, und ein Vordergrund, in dem nichts steht. Die Marke ist der Anker, an dem das Auto später landet, und ohne freien Vordergrund ist kein Platz für die Teile. Genau dieses Bild wird @image1 und setzt Straße, Kameraposition, Licht und Schattenrichtung für den ganzen Clip.
-
Das Auto einmal sauber fotografieren lassen
Das zweite Bild ist ein reines Katalogfoto: der Wagen von schräg vorn, schlichter Hintergrund, sonst nichts. Es wird @image4 und ist die einzige Quelle für Form, Farbe, Felgen und Karosserielinien. Alles, was auf diesem Bild zu sehen ist, bekommst du im Video — und alles, was fehlt, erfindet das Modell. Deshalb lieber ein langweiliges, scharfes Studiofoto als eine stimmungsvolle Aufnahme mit halb verdeckten Rädern.
-
Den Freeze und das Ziel vorzeichnen
Jetzt kommen die beiden Bilder, die den Clip eigentlich regieren: einmal der Moment, in dem die Teile in der Luft stehen und die Hände von unten ins Bild kommen (@image2), und einmal das fertige Auto an seinem Platz (@image3). Beide entstehen wieder in ChatGPT, beide in derselben Perspektive wie @image1. Das erste legt Bildaufbau und Handhaltung fest, das zweite die Endposition. Lies dazu unbedingt die erste Lektion weiter unten — @image3 hat bei mir eine Anweisung im Prompt schlicht überstimmt.
-
In Artlist die Referenzen laden und die Slots vergeben
Im AI-Bereich von Artlist das Videomodell auf Seedance 2.5 stellen, Format 9:16, Dauer zehn Sekunden. Dann die Bilder hochladen. Die Reihenfolge im Referenz-Bereich entscheidet, welches Bild @image1, @image2 und so weiter ist — der REFERENCES-Block ganz oben im Prompt muss exakt dazu passen. Vier Bilder, vier Slots — jedes hat im Prompt eine Aufgabe.
-
Den Prompt einsetzen und die Uhr anpassen
Der Prompt unten ist für zehn Sekunden geschrieben. Bei anderer Cliplänge verschiebst du die Zeiten im ACTION-Block und hältst die Abstände proportional — die Reihenfolge der Beats ist wichtiger als die exakte Sekunde. Was du inhaltlich anfasst, sind nur zwei Stellen: die Bodenmarke, an der das Auto landet, und das Auto selbst. Der Rest, vor allem der LOCKS-Block, bleibt wortgetreu stehen.
-
Rendern und zuerst die Ausrichtung prüfen
Nach dem Rendern nicht auf die Physik schauen, die sitzt meistens. Schau auf das fertige Auto: Steht es so herum, wie du es geschrieben hast? Wenn nicht, liegt es fast nie am Text, sondern am Zielbild — und dann tauschst du das Bild aus, statt den Satz noch einmal zu verschärfen.
CREATOR KIT
Alles, was du brauchst.
Create a single continuous photorealistic 9:16 image-to-video shot on a narrow alpine mountain road at golden hour. REFERENCES @image1 is the empty location reference. It defines the environment, road layout, camera position, lighting, road texture, repaired crack in the asphalt, rocky cliff on the left, guardrail and valley on the right, distant lake, mountains and sunset light. @image2 is the freeze moment reference. It defines the first-person POV framing with bare hands entering from the bottom of frame and the car parts suspended in mid air. Use it as the key reference for the stopped floating-parts moment. @image3 is the completed-car staging reference. It defines the correct final orientation of the car: the Nissan Skyline GT-R R34 is fully assembled with its REAR facing the POV camera and its FRONT facing away down the road, so it can drive naturally away into the distance. @image4 is the identity reference for the car. From the moment the car is fully assembled, it must match this image exactly in shape, colour, proportions, wheels, body lines and overall design. SCENE First-person POV on a mountain pass road at sunset. The shot feels like a real handheld action camera at eye level. Only bare forearms and hands may enter frame from the bottom edge. The environment must remain consistent with @image1 the whole time. The car is a blue Nissan Skyline GT-R R34. The fixed ground mark is the repaired crack in the asphalt. The car assembles beside that crack. IMPORTANT STORY BEATS There are THREE distinct hand gestures: 1. first hand gesture stops the parts in mid air 2. second hand gesture pulls the parts together and assembles the car 3. final finger snap turns on the lights, starts the engine, and the car drives away ACTION 0.0s to 1.8s — the shot begins on the mountain road environment. Car parts are already present in motion and then settle into the scene as if they have just been falling. The camera tilts naturally and feels alive, but the operator stays on the same spot. 1.8s to 2.2s — both hands rise into frame from the bottom edge and close into fists in front of the lens. 2.2s — on that exact frame, gravity switches off and every single car part STOPS in mid air. 2.2s to 4.0s — true freeze moment. The separate parts remain suspended in mid air around the build point, clearly separated, solid, readable, and floating in three-dimensional space. This moment should look like @image2. The car is NOT assembled yet. The rear-side components are closest to the camera, because the completed car will end up with its rear facing the POV. 4.0s — second distinct hand gesture. One fist snaps shut / pulls inward. 4.0s to 5.4s — the parts are pulled in and assemble progressively, piece by piece, not as an instant morph. The assembly order should be readable: first chassis and structural core, then drivetrain and suspension, then rear section, then side panels and doors, then front section, then wheels, then glass, then wing and final trim. All parts fly inward toward one build point on the road beside the repaired crack. The car must assemble in the correct orientation shown by @image3: REAR toward the camera, FRONT away from the camera, aligned with the road so it can drive forward away from camera. 5.4s — final part clicks into place. The completed Nissan Skyline GT-R R34 stands fully assembled on all four wheels. Suspension compresses slightly and rebounds once. Small burst of dust at tyre contact. 5.4s to 6.8s — the car stands still in completed form, rear toward camera, engine still off, lights still off. 6.8s to 7.0s — one hand comes slightly up again, preparing for the snap. 7.0s — final finger snap. On that exact frame the headlights turn on bright white and the engine fires instantly with a sharp aggressive bark. 7.0s to 7.4s — the engine settles for a very short beat, headlights remain on, the car loads up naturally as if gear is engaged. 7.4s to last frame — the car pulls away smoothly and powerfully, driving FORWARD away from the POV camera down the mountain road, following the curve naturally into the distance. No drifting, no sliding toward camera, no warping, no deformation. LOOK Ultra photorealistic, real action-camera feel, real lens behaviour, natural motion blur, subtle sensor grain, realistic golden-hour lighting, realistic shadows, realistic reflections on blue paint, realistic asphalt contact, cinematic but believable. LOCKS - keep the same environment and framing language as @image1 - keep the freeze composition and hands feeling of @image2 - keep the completed car orientation of @image3 - keep the exact car identity of @image4 - true mid-air stop before assembly - assembly must be progressive and readable - car must finish rear-first to camera - only after the final finger snap do lights and engine activate - only after that does the car drive away - no extra people - no extra vehicles - no text - no unnatural morphing - no geometry warping - no car driving toward camera
========================================
ARTLIST - SEEDANCE 2.5 - AUTO AUS DER LUFT
4 Referenzbilder, 4 Slots, 1 Prompt
========================================
DIE SLOTS
---------
@image1 -> die leere Strasse: Umgebung, Kamera,
Licht, Bodenmarke (bei mir der Riss)
@image2 -> der Freeze: Bildaufbau, Haende von
unten, Teile reglos in der Luft
@image3 -> das Ziel: wo und wie das fertige Auto
am Ende steht
@image4 -> die Identitaet: Form, Farbe, Felgen,
Karosserielinien
REIHENFOLGE
-----------
Die Nummer kommt aus der Upload-Reihenfolge, nicht
aus dem Dateinamen. Erst hochladen, dann den
REFERENCES-Block oben im Prompt darauf anpassen.
Was du zusaetzlich hochlaedst, liest das Modell
mit - auch ohne @-Verweis. Also nichts hochladen,
was im Prompt keine Aufgabe hat.
DIE DREI GESTEN
---------------
1. Faeuste schliessen -> Schwerkraft aus
2. Faust einziehen -> Teile fliegen zusammen
3. Fingerschnipsen -> Licht an, Motor an, weg
Eine Geste, ein Schalter. Zwei Aenderungen auf einer
Geste lassen die Geste wirkungslos.
SETTINGS
Die Einstellungen im Überblick.
| Plattform | Artlist, AI-Bereich |
|---|---|
| Modell | Seedance 2.5 |
| Referenzen | 4 Bilder, jedes im Prompt adressiert |
| Format | 9:16 |
| Auflösung | 1080 × 1920 |
| Dauer | 10 Sekunden |
| Ton | aus dem Modell: Aufschläge, Motor, Wind |
| Bildquelle | alle vier Referenzen aus ChatGPT |
WORAUF ES ANKOMMT
Darauf musst du achten.
Das Zielbild schlägt den Prompt-Text
In meinem Prompt steht bei @image3 ausdrücklich, das fertige Auto stehe mit dem Heck zur Kamera und der Front die Straße hinunter, und im LOCKS-Block steht es gleich noch zweimal. Das Bild, das ich als @image3 hochgeladen habe, zeigt den Wagen aber mit der Front zur Kamera. Herausgekommen ist die Front. Das Modell hat sich für das Bild entschieden und den Satz ignoriert — und die Anweisung „fährt vom Betrachter weg" dann so gelöst, dass das Auto mit der Front zur Kamera rückwärts die Straße hinunterrollt. Wenn Bild und Text sich widersprechen, gewinnt das Bild. Also das Bild ändern, nicht den Satz.
Die Reihenfolge hält, die Uhrzeit nicht
Jeder Beat aus dem ACTION-Block kommt, und zwar in genau der Reihenfolge, in der er dasteht: Fall, Aufschlag, Freeze, Einzug, Stand, Schnipsen, Abfahrt. Nur die Sekunden stimmen nicht. Der Freeze soll bei 2,2 s einsetzen und setzt bei rund 3,5 s ein, das Licht soll bei 7,0 s angehen und geht bei 7,3 s an, die Abfahrt soll bei 7,4 s beginnen und beginnt bei rund 9,0 s. Die Stempel sind eine Partitur, kein Timecode — sie sortieren, sie takten nicht.
Eine Geste, ein Schalter
Der Prompt nennt die drei Handbewegungen ganz oben unter IMPORTANT STORY BEATS noch einmal einzeln durch, bevor sie im ACTION-Block ihre Zeit bekommen: Fäuste schließen hält die Teile an, die Faust einziehen holt sie zusammen, das Schnipsen macht Licht und Motor an. Jede Geste schaltet genau eine Sache. Hängt man zwei Änderungen an dieselbe Bewegung, wirkt keine von beiden richtig — und ein Adverb an der Hand („langsam", „sanft") bremst nicht die Hand, sondern den ganzen Clip.
Der LOCKS-Block ist die eigentliche Arbeit
Alles, was unten unter LOCKS steht, sind keine Wünsche, sondern Gegengewichte zu bekannten Fehlleistungen: kein ganzes Auto, das vom Himmel fällt, ein echter Stillstand vor dem Zusammenbau, ein lesbarer Aufbau Stück für Stück, kein Morphen, kein verzerrtes Blech, kein Auto, das auf die Kamera zufährt. Diese Zeilen sind der Teil des Prompts, den du beim Anpassen nicht anfassen solltest — die Szene beschreibst du neu, die Sperren bleiben stehen.
Eine Straße, die nie ein Auto gesehen hat.
Vier Bilder, ein Prompt, zehn Sekunden. Die Bodenmarke und das Auto tauschst du aus, alles andere bleibt stehen.
FAQ


