OmniHuman 1.5: как превратить изображение и аудио в видео с говорящим аватаром

Для работы OmniHuman нужны два исходных материала: одно изображение и одна звуковая дорожка. Изображение определяет, кто появится в кадре, а аудио задаёт слова, ритм, паузы и эмоциональные акценты будущего выступления.

ByteDance разработала OmniHuman 1.5 как модель для создания говорящих аватаров по аудио, способную оживлять не только лицо. Она генерирует жесты, изменения позы и движения тела, а также выбирает движение камеры с учётом содержания звуковой дорожки. Необязательный текстовый промпт позволяет точнее задать мимику, действие и композицию кадра.

Модель подходит для роликов с ведущими и объяснениями, презентаций продуктов, локализованных видео, музыкальных выступлений, вымышленных персонажей и контента для соцсетей с утверждённым визуальным образом.

В этом руководстве разберём различия между OmniHuman-1 и 1.5, выбор изображения и звуковой дорожки, работу необязательных промптов и практические примеры, а также покажем, как собрать воспроизводимый рабочий процесс в Phygital+.

Сравнение OmniHuman-1 и OmniHuman 1.5

В первой работе об OmniHuman-1 была представлена архитектура Diffusion Transformer, обученная на сочетании разных условий движения. Её главным достижением стала гибкая анимация людей на крупных, поясных и ростовых планах — с речью, пением, сложными позами и изображениями разных стилей.

OmniHuman 1.5 получила более точное семантическое управление. Чтобы выстроить нужную подачу, модель учитывает смысл, ритм, просодику и эмоциональную окраску аудио вместе с изображением и текстовыми указаниями.

ВерсияГлавное преимуществоДля каких задач подходит
OmniHuman-1Гибкая анимация человека по аудио при разных планах и стилях изображенияГоворящие и поющие портреты, анимация поясных и ростовых изображений
OmniHuman 1.5Понимание смысла аудио, необязательное текстовое управление, более выразительные жесты, эмоции и движение камерыРолики с ведущими, постановочные выступления, видео с персонажами и материалы для рекламных кампаний
OmniHuman 1.5 в Phygital+Изображение и аудио на входе; необязательные Prompt, Mask, Seed и Fast ModeВоспроизводимые рабочие процессы на основе узлов, связанные с инструментами изображения, голоса и видео
Практическое правило: выбирайте OmniHuman 1.5, когда подача должна учитывать содержание речи. Добавляйте необязательный промпт, если нужно задать конкретный жест, позу, движение камеры или событие в кадре.

Возможности OmniHuman 1.5

Синхронизация губ и мимика по аудио

Аудио управляет генерацией, а не накладывается как готовая дорожка после анимации. Движения губ, мимика, паузы и язык тела создаются с учётом подключённого голоса или музыки.

Портретный, поясной и ростовой планы

Крупный портрет даёт модели больше деталей лица. На поясном плане остаётся место для жестов руками и движений верхней части тела. Ростовое изображение позволяет создавать более амплитудные движения, но для него важны хорошо читаемый силуэт и свободное пространство вокруг персонажа.

Речь, пение и движения в ритм

В официальных материалах ByteDance показаны диалоги, эмоциональная актёрская игра и музыкальные выступления. Для пения лучше использовать чистую вокальную дорожку и изображение, которое уже соответствует задуманной сцене.

Реальные люди, иллюстрации и персонажи

Исходное изображение может быть фотографическим или стилизованным. Модель также справляется с героями мультфильмов, маскотами, игровыми персонажами и некоторыми животными, если лицо и тело хорошо различимы.

Управление действием и камерой с помощью текста

Необязательный текстовый промпт может задавать движения, эмоции, позу, работу камеры, взаимодействие с окружением или появление элемента, которого нет на исходном изображении.

Как подготовить изображение и аудио

Выберите понятное исходное изображение

  • Используйте резкое изображение, на котором хорошо видно лицо.
  • Если в промпте указаны жесты, руки и конечности должны быть видны.
  • Избегайте крупных объектов на переднем плане, которые закрывают рот или тело.
  • Оставьте вокруг персонажа место для движения камеры.
  • Выбирайте изображение с освещением и обстановкой, подходящими для итогового видео.

Подготовьте чистое аудио

  • Используйте разборчивую запись голоса с минимальным фоновым шумом.
  • Удалите длинные паузы в начале и конце.
  • Сохраняйте естественный темп: при слишком быстрой речи сложнее синхронизировать губы и жесты.
  • Задавайте для каждого фрагмента одно чёткое эмоциональное направление.
  • Делите длинный сценарий на сцены, которые можно проверять отдельно.

В официальных реализациях API обычно доступно разрешение 720p для аудио длительностью до 60 секунд и 1080p — до 30 секунд. В конкретном интерфейсе ограничения могут быть строже, поэтому актуальные требования к файлам и длительности всегда проверяйте в узле Phygital+.

Используйте маску для изображений с несколькими людьми

Если на изображении несколько людей, необязательный вход Mask в Phygital+ позволяет указать, кого нужно анимировать. На уровне модели поддерживаются сцены с несколькими персонажами, но для каждого нужны отдельная привязка персонажа и аудио. Одна смешанная звуковая дорожка не обеспечивает надёжного распределения реплик.

Как составить промпт для OmniHuman 1.5

Изображение задаёт внешний образ, а аудио — темп и синхронизацию. В необязательном текстовом промпте стоит описывать только те детали подачи, которые нельзя однозначно определить по этим исходным материалам.

Часть промптаЧто описатьПример
МимикаЭмоциональное состояние и его изменениеBegins calmly, then smiles with quiet confidence
ЖестыПоложение рук, поза или движения телаUses small open-hand gestures while explaining
КамераПлан и движениеSlow push-in from a medium shot to a close portrait
ВзаимодействиеКак персонаж взаимодействует с окружениемTurns toward the product and points to its label
СтильОбщая манера исполнения и визуальная подачаNatural UGC delivery with subtle handheld movement
Постоянство деталейДетали, которые не должны менятьсяKeep the face, outfit, background, and lighting unchanged
Формула промпта: [Framing and camera]. The subject delivers the connected audio with [expression and energy]. They use [specific gestures or action]. Keep [identity and scene details] unchanged.

Часто достаточно короткого промпта. Темп и эмоции уже заложены в аудио, а несколько противоречивых указаний могут сделать результат менее цельным.

Примеры промптов для OmniHuman 1.5

Презентация продукта

Medium shot. The presenter speaks with calm confidence, uses small open-hand gestures, then turns slightly toward the product and points to its label. Slow camera push-in. Preserve the face, outfit, product, and studio lighting.

UGC-обзор

Natural vertical UGC delivery. The creator speaks directly to the camera, smiles briefly after the opening line, and lifts the product into view at the key benefit. Subtle handheld camera feel and realistic pauses.

Преподаватель курса

Half-body educational presenter. Clear, measured delivery with restrained gestures. The teacher turns toward the diagram on the right during the explanation, then returns attention to the camera.

Новости компании

Professional spokesperson in a bright office. Upright posture, steady eye contact, and concise hand gestures timed to the main points. Fixed medium camera and clean corporate presentation.

Обращение основателя

Intimate founder message filmed at a desk. Warm, direct delivery with natural breathing and subtle head movement. Slow push-in during the final sentence. Keep the workspace and daylight stable.

Ведущий новостей

Centered news-style presenter. Neutral expression at the opening, more urgency in the middle, then a calm conclusion. Minimal gestures and stable eye-level camera.

Певец или певица

Emotional live vocal performance. The singer follows the rhythm with natural upper-body movement, closes their eyes during the sustained note, then looks back toward the camera. Gentle cinematic arc movement.

Фрагмент подкаста

Seated podcast guest in a three-quarter view. Conversational delivery with occasional eyebrow movement and one small hand gesture during the strongest point. Static camera and realistic studio ambience.

Исторический портрет

Animate the historical portrait as a restrained first-person monologue. Formal posture, subtle facial motion, and period-appropriate composure. Keep the painted texture and original background intact.

Маскот бренда

The illustrated mascot delivers the audio with upbeat energy, nods at the main claim, and points toward the logo at the end. Preserve the original illustration style, colors, proportions, and face.

Фэнтезийный персонаж

Cinematic fantasy monologue. The character begins in profile, turns toward the camera during the warning, and tightens one hand around the pendant. Slow orbiting camera and flickering firelight.

Говорящий питомец

Playful talking pet video. The dog tilts its head between phrases, looks toward the treat on the table, and reacts with excited but physically believable movement. Keep the fur pattern and room unchanged.

Ведущий в полный рост

Full-body presenter in a gallery. The host walks slowly toward the first display while speaking, stops beside it, and uses one clear presenting gesture. Smooth side tracking camera.

Демонстрация товара

The presenter demonstrates the bag while delivering the connected voice-over. They open the main compartment, show the interior, and return the product to a centered position. Preserve the bag shape, material, and logo.

Эмоциональная сцена

Close cinematic performance. The actor begins guarded and quiet, becomes visibly emotional during the middle line, then regains composure before the final sentence. Very slow push-in and soft window light.

Рабочий процесс с OmniHuman в Phygital+

OmniHuman удобнее использовать, когда изображение и аудио готовятся на одном холсте. Текстовая модель поможет написать и сократить сценарий. Модель для изображений создаст ведущего, маскота или персонажа рекламной кампании. Voice Creation или Voice Clone подготовит аудио. OmniHuman объединит утверждённое изображение с голосом, а инструмент повышения разрешения видео подготовит выбранный вариант к публикации.

  1. Подготовьте сценарий и разделите его на сцены, которые удобно проверять.
  2. Создайте или выберите изображение персонажа.
  3. Создайте или загрузите голосовую дорожку.
  4. Подключите изображение и аудио к OmniHuman.
  5. При необходимости добавьте промпт с описанием движений и маску.
  6. Создайте несколько дублей, меняя по одному параметру.
  7. Выберите лучший вариант и переходите к повышению разрешения или монтажу.

Когда все этапы остаются на виду, вносить правки проще. На основе утверждённых материалов можно создать ветку с новым голосом, языком, жестом или ведущим, не собирая проект заново.

Стоимость OmniHuman в Phygital+

Для работы OmniHuman используются кредиты Phygital+. Точная стоимость генерации отображается в узле до запуска, поэтому её можно проверить без отдельной учётной записи BytePlus.

Перед генерацией всех сцен длинного сценария проверьте изображение, качество аудио, композицию кадра и необязательный промпт на коротком фрагменте.

Распространённые проблемы с OmniHuman

Губы плохо синхронизируются с речью

Используйте чистую запись речи, уберите музыку, заглушающую голос, и избегайте слишком быстрого темпа. Рот на исходном изображении должен быть хорошо виден.

Руки или тело двигаются неестественно

Выберите исходное изображение с понятной анатомией и задавайте по одному сдержанному жесту за раз.

Внешность персонажа меняется

Начните с резкого изображения и не просите в промпте сильно менять лицо, причёску, одежду или ракурс.

Результат выглядит статичным

Используйте поясной или ростовой план и опишите одно движение камеры либо одно действие с окружением.

Двигается не тот человек

Добавьте маску, выделяющую нужного персонажа, или обрежьте исходное изображение, чтобы убрать неоднозначность.

Подача не соответствует содержанию

Простыми словами опишите развитие эмоции и используйте аудио с выразительной просодикой. Модель учитывает смысл и манеру речи.

Текущие ограничения

При генерации по аудио могут возникать сложности с сильными поворотами головы, закрытым ртом, перегруженной композицией, быстрыми движениями, сложным взаимодействием рук с предметами и противоречивыми текстовыми указаниями. В сценах с несколькими людьми нужно явно распределять говорящих: одна звуковая дорожка не может надёжно назначить разные реплики нескольким персонажам.

Учитывайте права и согласие. Используйте изображения и голоса, которые принадлежат вам или на анимацию которых у вас есть разрешение, особенно если в кадре реальный человек.

Частые вопросы

Что такое OmniHuman 1.5?

OmniHuman 1.5 — модель ByteDance для создания видео с говорящими аватарами по аудио. Она использует изображение, аудио и необязательные текстовые указания, чтобы сгенерировать синхронизированную анимацию персонажа.

Какие исходные материалы нужны OmniHuman?

Для узла Phygital+ нужны изображение персонажа и звуковая дорожка. Text Prompt и Mask — необязательные параметры.

Может ли OmniHuman анимировать человека в полный рост?

Да. Модель поддерживает портретные, поясные и ростовые исходные изображения. Чёткая анатомия и хорошо читаемый силуэт улучшают качество амплитудных движений.

Можно ли анимировать иллюстрации и маскотов?

Да. В официальных материалах представлены стилизованные и мультяшные персонажи, фантастические существа и животные, а также реальные люди.

Поддерживает ли OmniHuman разрешение 1080p?

Да. BytePlus заявляет о выводе видео сразу в разрешении 1080p. Стандартные ограничения API обычно составляют до 30 секунд для 1080p и до 60 секунд для 720p, однако ограничения интерфейса могут отличаться.

Чем управляет необязательный текстовый промпт?

С его помощью можно задать мимику, жесты, позу, действие, движение камеры, стиль и взаимодействие с окружением.

Можно ли создавать с OmniHuman видео с пением?

Да. Модель поддерживает пение и движения в ритм, которыми управляет звуковая дорожка.

Могут ли в одном видео говорить несколько людей?

На уровне модели OmniHuman 1.5 поддерживает сцены с несколькими людьми, но для каждого говорящего нужна явная привязка персонажа и аудио. Если интерфейс рассчитан на одного основного говорящего, используйте маску или создавайте персонажей отдельно.

Как сохранить одного и того же персонажа в нескольких фрагментах?

Используйте одно и то же утверждённое изображение, сохраняйте описание одежды и сцены и меняйте за один раз только один параметр подачи.

Зачем использовать OmniHuman в Phygital+?

Phygital+ объединяет написание сценария, генерацию изображений, создание голоса, анимацию в OmniHuman, ветвление и повышение разрешения на одном визуальном холсте.

Explore more