Kling: Kling Lip Sync API
可灵对口型:把一段音频配到已有视频里的一个人身上,驱动口型、两颊与下颌自然同步。视频 2–60 秒,一次对一个人,多人画面可用 face_id 指定说话人。统一接口只需传视频和音频,网关自动识别人脸并对齐时间。
- 输入模态: audio, video
- 输出模态: video
- 发布日期: 2025-12-04
常见问题
视频里有多个人,怎么指定说话的人?
不传 `face_id` 时默认选出现时间最长的人。要指定其他人,先调用 `POST /kling/v1/videos/identify-face` 查看每个人的 `face_id` 和缩略图,再在 input 里传 `face_id`。一次任务只能驱动一个人。
音频比人物出现的时间长怎么办?
不传时间参数时,音频从人物出现时开始播放,超出人物出现时段的部分会被截掉。只想用其中一段时,用 `sound_start_time` / `sound_end_time`(毫秒)截取。