HeyGen: Avatar IV — это модель преобразования изображения в видео, которая оживляет одну фотографию, превращая ее в выразительное видео с говорящей головой, синхронизированное с губами. Вместо того, чтобы просто подгонять форму рта под слова, модель интерпретирует тональность, ритм и эмоции аудио для управления движением головы, выражением лица и жестами, производя результат с разрешением до 1080p. Произносимый звук поступает из одного из двух источников: текстового сценария, который модель озвучивает с помощью технологии преобразования текста в речь HeyGen, или предоставленного аудиофайла, к которому изображение синхронизируется непосредственно по губам. Параметры прохождения позволяют выбрать голос, настроить параметры голоса, установить выразительность, указать конкретные движения, заменить или удалить фон, добавить подписи и название видео.
import requests
r = requests.post(
"https://infergate.ru/api/v1/videos",
headers={"Authorization": "Bearer sk-•••"},
json={
"model": "heygen/avatar-iv",
"prompt": "Кот на волне на закате",
"duration": 8,
},
)
job = r.json()
# опрашивайте polling_url, пока status != "completed"
print(job["id"], job["polling_url"])modelstringобязательныйpromptstringобязательныйГенерация медиа (аудио/изображения) тарифицируется по фактической стоимости провайдера — итоговая цена хода видна в чате сразу после ответа.