> ## Documentation Index
> Fetch the complete documentation index at: https://www.vozo.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Loslegen

> Erfahren Sie, wie Sie ein Porträt in ein sprechendes Video verwandeln, indem Sie Ihr Foto und Audioeingaben verwenden.

## Projekt erstellen

Um loszulegen, navigieren Sie zu Ihrem **Dashboard** und klicken Sie auf **Talking Video Generator - Mit Foto beginnen**.

Dies öffnet den Upload-Dialog, in dem Sie Ihre Bilddateien per Drag & Drop hinzufügen oder klicken können, um sie hochzuladen.

Sie können Audio auf mehrere Arten eingeben:

### Text-zu-Sprache

Wenn Sie ein Skript haben und Sprache aus Text erzeugen möchten, wählen Sie diese Option.

<Steps>
  <Step title="Sprache und Stimme wählen">
    Wählen Sie Ihre gewünschte Sprache und Stimme aus dem Dropdown-Menü. Wenn Sie mit den aufgeführten Stimmen nicht zufrieden sind, klicken Sie auf *"Weitere aus der Bibliothek auswählen"*, um weitere Optionen zu erkunden.

    <Tip>
      **Verwenden Sie eine geklonte Stimme:**

      Klicken Sie auf *"Weitere aus der Bibliothek auswählen > Geklonte Stimme > Neue Stimme klonen"* und folgen Sie den Anweisungen, um Audio hochzuladen oder aufzunehmen, um Ihre benutzerdefinierte Stimme zu erstellen.
    </Tip>
  </Step>

  <Step title="Skript eingeben">
    Geben Sie Ihr Skript ein und klicken Sie auf die Wiedergabetaste, um eine Vorschau anzuzeigen.
  </Step>
</Steps>

### Audio hochladen

Wenn Sie bereits eine Audiodatei haben, wählen Sie diese Option, um sie direkt hochzuladen.

## Vorschau und Download

Nachdem das Video erstellt wurde, können Sie die Ergebnisse direkt auf der Projektseite in der Vorschau anzeigen.

Um das Video herunterzuladen, klicken Sie auf die Schaltfläche **Herunterladen/Exportieren** in der oberen rechten Ecke.

## FAQ

<AccordionGroup>
  <Accordion title="Welche Auflösung und Kodierung hat das exportierte Video?">
    * **Auflösung**: Exportiert als **720p**. Das System wählt automatisch das geeignetste Seitenverhältnis basierend auf dem Eingabebild und gibt in einer festen Auflösung aus. Mögliche Auflösungen sind:
      * **16:9** → 1248×704
      * **4:3** → 1120×832
      * **1:1** → 960×960
      * **3:4** → 832×1120
      * **9:16** → 704×1248
      * **21:9** → 1504×640
    * **Bildrate**: Festgelegt auf **25fps**
    * **Kodierung**: **H.264**
    * **Bitrate**: Typischerweise um **1100 kb/s**, variiert dynamisch zwischen **1000–2000 kb/s** je nach Inhalt
  </Accordion>

  <Accordion title="Wie viel kostet Sprechendes Foto?">
    Bitte besuchen Sie die Seite [Punkteverwendung für KI-Tools](/docs/de/common/tools-points-rules#talking-photo) für detaillierte Preisinformationen.
  </Accordion>
</AccordionGroup>
