ELEVENLABS · AVATARS

Stimme und Lippen entstehen gleichzeitig.

ElevenLabs Avatars kombiniert Text-to-Speech und lippensynchrones Video in einem einzigen Rendering-Schritt, kein Audio-Export, kein Tool-Wechsel, kein Kamera-Setup.

Ab ElevenLabs Starter-Plan (6 $/Monat) · verfügbar in Deutschland & der EU

Was Avatars besonders macht.

Vier Mechaniken, die ElevenLabs Avatars von klassischen Lip-Sync-Tools unterscheiden.

01 · EIN-SCHRITT-WORKFLOW

Stimme und Lippen-Sync entstehen gleichzeitig, nicht nacheinander.

Klassische Lip-Sync-Tools brauchen ein fertiges Audio-File als Input. Bei Avatars tippst du nur den Text, ElevenLabs generiert Sprache und synchrones Video in einem Rendering-Durchlauf. Kein Export, kein Re-Upload, kein Tool-Wechsel.

02 · MULTI-MODELL-ROUTING

Vier Lip-Sync-Engines, eine Oberfläche.

Statt sich für ein Modell entscheiden zu müssen, wählt Avatars automatisch zwischen OmniHuman 1.5, HeyGen, Sync und Veed LipSync, je nachdem, ob du ein Bild oder ein Video als Referenz nutzt und welche Auflösung du brauchst. Manuelle Auswahl bleibt möglich.

03 · PERSISTENTE IDENTITÄT

Ein Avatar, unendlich viele Videos, immer derselbe Look.

Nach dem einmaligen Hochladen von 3–5 Referenzbildern speichert ElevenLabs die Avatar-Identität dauerhaft. Jedes neue Skript, jede neue Sprache, jede neue Kampagne nutzt exakt dasselbe Gesicht, ideal für wiedererkennbare Marken- oder Kursfiguren.

04 · BATCH-SKALIERUNG ÜBER FLOWS

Ein Skript, zig Varianten, automatisiert statt manuell.

Der neue Avatar-Node in ElevenLabs Flows erlaubt es, ein Basis-Skript automatisch in mehrere Sprach-, Produkt- oder Zielgruppen-Varianten zu vervielfältigen, ohne jede Version einzeln anzustoßen.

Wie Avatars wirklich arbeitet.

01 · Referenzbild-Fusion

Aus 3–5 Fotos wird ein winkelstabiles Identitäts-Modell.

Das System verlangt Referenzbilder aus unterschiedlichen Perspektiven und generiert daraus „Styles", also zusätzliche Blickwinkel-Varianten derselben Person oder Figur. Diese Fusion ist die Grundlage dafür, dass der Avatar in späteren Videos aus verschiedenen Kamerawinkeln konsistent wirkt.

02 · Modell-Selektionslogik

Der Input entscheidet, welches Lip-Sync-Modell rendert.

Liegt ein einzelnes Referenzbild vor, kommen bildbasierte Modelle wie OmniHuman 1.5 oder HeyGen zum Einsatz. Liegt ein bestehendes Video vor, greifen video-basierte Modelle wie Sync oder Veed LipSync, die den vorhandenen Take neu synchronisieren statt ihn komplett neu zu generieren.

03 · Audio-getriebene Animation

Die Stimm-Waveform steuert Mund, Mimik und Körpersprache direkt.

Modelle wie OmniHuman 1.5 werten nicht nur Phoneme für die Lippenform aus, sondern auch Tonhöhe und Betonung, daraus werden kontextbewusstes Blinzeln, Atmen und synchrone Hand-/Körperbewegungen abgeleitet. Das Ergebnis wirkt weniger wie ein starrer „Talking Head" und mehr wie eine reagierende Person.

04 · Credit-Abrechnung

Kosten skalieren mit Modellwahl, Auflösung und Videolänge.

Alle ElevenCreative-Tools teilen sich denselben Credit-Pool. Ein kurzes 720p-Video mit dem günstigeren OmniHuman-Lite-Modell verbraucht deutlich weniger Credits als ein längeres 4K-Sync-Rendering, die Plattform gibt keine Pauschalpreise, sondern rechnet dynamisch nach tatsächlichem Rechenaufwand ab.

Wer Avatars wirklich nutzt.

01 · Online-Coach

Der digitale Zwilling fürs Kursmodul

Statt für jedes neue Kursmodul eine Kamera-Session anzusetzen, erstellt ein Coach einmal seinen digitalen Zwilling als Avatar. Jedes neue Lernvideo entsteht dann aus reinem Skript-Text, Mimik, Stimme und Optik bleiben über alle Module hinweg identisch, ganz ohne Studio-Termin.

02 · Agentur

Mehrsprachige Erklärvideos ohne Synchronsprecher

Eine Agentur produziert Erklärvideos für Kunden in mehreren Ländern. Statt Synchronsprecher pro Sprache zu buchen, wird derselbe Avatar mit unterschiedlichen geklonten oder Bibliotheks-Stimmen kombiniert: DE-, EN- und FR-Version aus demselben Skript-Grundgerüst, per Flows in einem Rutsch generiert.

03 · Solo-SaaS-Gründer

Onboarding-Videos ohne Kamera-Setup

Onboarding- und FAQ-Videos für die eigene App werden oft aus Zeitgründen nie produziert. Mit einem einmal erstellten Avatar reicht ein kurzes Skript pro Feature-Erklärung, kein Kamera-Setup, kein Schnitt, direkt aus dem Dashboard exportierbar.

04 · Berater

Personalisierte Kampagnen in Serie

Ein Berater will Leads mit individuell angesprochenen Videos erreichen (Name, Branche, konkretes Angebot). Über den Avatar-Node in Flows wird ein Basis-Skript automatisiert in dutzende personalisierte Varianten vervielfältigt, statt jedes Video manuell neu aufzunehmen.

Dein Erklärvideo-Skript zum Kopieren.

Dieses Skript-Template fügst du direkt in das Prompt-Feld von ElevenLabs Avatars ein, es ist auf natürliche Sprechpausen und klare Kapitel-Struktur optimiert, damit Stimme und Lippen-Sync sauber zusammenpassen.

avatar-erklaervideo-skript.txt
[AVATAR-VIDEO-SKRIPT: 60-90 Sekunden Erklärvideo]

(Hinweis: Satzzeichen bewusst gesetzt lassen, Punkte und Kommas
steuern die natürlichen Sprechpausen der Stimm-Engine. In eckigen
Klammern stehen Platzhalter, die du vor dem Einfügen ersetzt.)

Hallo, ich bin [DEIN NAME] von [DEINE FIRMA/MARKE].

Wenn du [KONKRETES PROBLEM DER ZIELGRUPPE], dann kennst du wahrscheinlich
dieses Gefühl: [KURZE PROBLEMBESCHREIBUNG IN EINEM SATZ]. Genau dafür
gibt es [DEIN PRODUKT/ANGEBOT].

Und so funktioniert es. Erstens, [SCHRITT 1 IN WENIGEN WORTEN]. Zweitens,
[SCHRITT 2 IN WENIGEN WORTEN]. Und drittens, [SCHRITT 3 IN WENIGEN WORTEN].

Das Ergebnis: [KONKRETER NUTZEN, IDEALERWEISE MIT ZAHL ODER ZEITRAUM],
ohne dass du dafür [TYPISCHER AUFWAND, DEN MAN SICH SPART] machen musst.

[OPTIONAL: EIN SATZ MIT SOZIALEM BEWEIS, Z. B. "Über 200 Kunden nutzen
das bereits" ODER EIN KONKRETES BEISPIEL AUS DEINER PRAXIS.]

Wenn du das ausprobieren willst, findest du den Link direkt unter diesem
Video. Ich freue mich, wenn wir uns dort sehen.

Bis gleich, [DEIN NAME].

[ENDE SKRIPT: ca. 130-160 Wörter, entspricht etwa 60-75 Sekunden
Sprechzeit bei normalem Tempo]

---
EINSTELLUNGEN FÜR DIE GENERIERUNG:
- Avatar: [dein zuvor erstellter Avatar-Name]
- Stimme: [Bibliotheks-Stimme oder eigene geklonte Stimme]
- Lip-Sync-Modell: Auto (oder manuell "Sync" wählen für 4K-Qualität
  bei Kundenpräsentationen)
- Variationen: 2-4 gleichzeitig generieren lassen, dann beste Version
  auswählen

In 5 Schritten startklar.

01

Account & Plan

Auf elevenlabs.io registrieren und mindestens den Starter-Plan (6 $/Monat) aktivieren, der Free-Plan schaltet nur Bildgenerierung frei, keine Videos/Avatare.

02

Avatar erstellen

Unter elevenlabs.io/app/image-video auf „Create Avatar" gehen, 3–5 Referenzbilder aus unterschiedlichen Winkeln hochladen, System-Styles generieren lassen und den Avatar mit einem Namen speichern.

03

Skript & Stimme koppeln

Im Prompt-Feld das Sprechskript eintippen oder einfügen, dann im Voice-Selector eine Stimme aus der Bibliothek wählen, inklusive eigener geklonter Stimmen.

04

Lip-Sync-Modell wählen

Auf „Auto" lassen (System wählt passend zu Bild/Video-Input) oder manuell zwischen OmniHuman 1.5, HeyGen, Sync und Veed LipSync umschalten, je nach gewünschter Qualitätsstufe.

05

Generieren & weiterverwenden

Auf „Generate" klicken (bis zu 4 Varianten parallel möglich), Ergebnis herunterladen oder für Batch-Produktion in einen Flows Avatar-Node einbinden.

Dein erster Avatar wartet nur auf ein Skript.

Kopiere das Erklärvideo-Skript, tausch die Platzhalter aus, und in wenigen Minuten steht dein erstes lippensynchrones Video.

Mehr Tipps auf @till.schae

Häufige Fragen.

Ist ElevenLabs Avatars in Deutschland nutzbar?
Ja. ElevenLabs sperrt den Dienst nur für sanktionierte Länder (Belarus, Kuba, Iran, Nordkorea, Russland, Syrien, Krim/Donezk/Luhansk). Deutschland und die EU sind vollständig zugänglich, inklusive optionalem DPA für Business-Kunden.
Welchen Plan brauche ich mindestens?
Den Starter-Plan ab 6 $/Monat. Der kostenlose Plan erlaubt nur Bildgenerierung, Video- und Avatar-Funktionen sind erst ab dem ersten bezahlten Tier freigeschaltet.
Welche Lip-Sync-Modelle stehen mir zur Auswahl?
Vier Engines: OmniHuman 1.5 (reaktive Mimik, bis 720p, nicht in den USA), HeyGen Avatar (natürliche Kopfbewegung), Sync (Studio-Qualität bis 4K) und Veed LipSync (Dubbing bestehender Videos). ElevenLabs wählt automatisch das passende Modell, manuelle Auswahl ist möglich.
Kann ich meine eigene, geklonte Stimme mit einem Avatar kombinieren?
Ja. Jede Stimme aus deiner ElevenLabs-Bibliothek, einschließlich selbst geklonter Stimmen, lässt sich mit jedem gespeicherten Avatar koppeln.
Gibt es eine API, um Avatars automatisiert anzusteuern?
Noch nicht. Zum Launch im Juni 2026 ist Avatars ausschließlich über das Web-Dashboard nutzbar; API-Zugriff ist laut ElevenLabs für eine spätere Version geplant.
Wie viel kostet ein einzelnes Avatar-Video?
Es gibt keinen Festpreis. Kosten werden in Credits abgerechnet und hängen vom gewählten Lip-Sync-Modell, der Auflösung und der Videolänge ab, alle ElevenCreative-Tools teilen sich denselben Credit-Pool aus deinem Plan.