Skip to main content
LipSync API 通过将参考视频或图片中的面部动作与驱动音频进行同步,生成口型同步视频或图片说话。选择 Standard 模式可获得更快的处理速度,选择 Precision 模式可获得更高质量的结果。

输入

输出

  • 口型同步视频 URL

工作原理

1

将素材托管在可公开访问的 URL

上传视频、图片和音频文件,以便我们的服务器获取。
2

发送 API 请求

提供任务所需的必填输入和选填配置。
3

等待或查询状态

使用 webhook 回调,或通过任务 ID 轮询 API,直到处理完成。
4

下载视频结果

从返回的 URL 获取生成的图片说话或口型同步视频。

使用限制:

  • 默认并发上限为 10 个任务。团队中的所有成员共享该上限。详情请参阅并发限制
  • 仅支持单人脸的视频或图片。
  • 预计排队时间:1–120 分钟,具体取决于系统负载。
  • Standard 模式处理时间:约 10 分钟。
  • Precision 模式处理时间:约 20 分钟。
如果视频或图片包含多张人脸,仅对检测到的最大人脸进行口型同步。

API 错误代码

作业错误代码

最后修改于 2026年8月26日