Skip to main content
Lip Sync API は、参照動画または画像内の顔の動きを駆動音声と同期させることで、リップシンクされた動画またはおしゃべり写真を作成します。より高速に処理するには Standard モードを、より高品質な結果を得るには Precision モードを選択してください。

入力

出力

  • リップシンクされた動画の URL

動作方式

1

一般公開されている URL で素材をホストする

サーバーが取得できるように、動画、写真、音声ファイルをアップロードします。
2

API リクエストを送信する

ジョブに必要な必須入力と任意の設定を指定します。
3

完了を待つ、またはステータスを照会する

webhook コールバックを使用するか、ジョブ ID で API をポーリングし、処理の完了を待ちます。
4

動画をダウンロードする

返された URL から完成したおしゃべり写真またはリップシンク動画を取得します。

使用制限:

  • デフォルトの同時実行数の上限は 10 ジョブです。この上限はチームの全メンバーで共有されます。詳しくは同時実行数の上限をご覧ください。
  • 顔が 1 つだけ映っている動画または写真に対応しています。
  • 推定キュー時間:システム負荷に応じて 1~120 分。
  • Standard モードの処理時間:約 10 分。
  • Precision モードの処理時間:約 20 分。
動画または写真に複数の顔が含まれている場合、検出された最大の顔だけがリップシンクされます。

APIエラーコード

ジョブエラーコード

最終更新日 2026年8月26日