Skip to main content
Die LipSync-API erstellt ein lippensynchronisiertes Video oder ein Sprechendes Foto, indem sie die Gesichtsbewegungen in einem Referenzvideo oder -bild mit dem steuernden Audio synchronisiert. Wählen Sie den Standardmodus für eine schnellere Verarbeitung oder den Präzisionsmodus für Ergebnisse in höherer Qualität.

Eingaben

Ausgaben

  • URL des lippensynchronisierten Videos

Wie es funktioniert

1

Hosten Sie Ihre Dateien unter einer öffentlich zugänglichen URL

Laden Sie Video-, Sprechendes-Foto- und Audiodateien hoch, damit unsere Server sie abrufen können.
2

Senden Sie eine API-Anfrage

Geben Sie die erforderlichen Eingaben und alle optionalen Einstellungen für den Job an.
3

Warten Sie oder fragen Sie den Status ab

Verwenden Sie den Webhook-Callback oder fragen Sie die API mit Ihrer Job-ID ab, bis die Verarbeitung abgeschlossen ist.
4

Laden Sie das Video herunter

Rufen Sie das fertige Sprechende Foto oder lippensynchronisierte Video über die angegebene URL ab.

Nutzungseinschränkungen:

  • Das standardmäßige Limit für die gleichzeitige Ausführung beträgt 10 Jobs. Dieses Limit wird von allen Mitgliedern eines Teams gemeinsam genutzt. Weitere Informationen finden Sie unter Gleichzeitige Ausführungslimits.
  • Es werden nur Videos oder Fotos mit einem Gesicht unterstützt.
  • Geschätzte Wartezeit: 1–120 Minuten, abhängig von der Systemauslastung.
  • Verarbeitungszeit im Standard-Modus: ~10 Minuten.
  • Verarbeitungszeit im Precision-Modus: ~20 Minuten.
Wenn ein Video oder Foto mehrere Gesichter enthält, wird nur das größte erkannte Gesicht lippensynchronisiert.

API-Fehlercodes

Job-Fehlercodes

Zuletzt geändert am 22. September 2026