Чтобы сделать видео из фото, сегодня необязательно разбираться в анимации или видеомонтаже. Достаточно загрузить изображение в программу, выбрать подходящий формат и при необходимости добавить промпт.
При этом возможности современных видеомоделей уже давно не ограничиваются легким оживлением фотографии. ИИ может добавить человеку естественную мимику, превратить портрет в говорящего аватара или же из одного подробного промпта создать несколько связанных кадров с разными планами и движением.
В этой статье разберемся, как можно сгенерировать видео из фото с помощью нейросети, как правильно составить промпт и выбрать изображение и чем отличаются популярные ИИ-сервисы.
Как сделать видео из фото с помощью нейросети
В большинстве сервисов процесс состоит из трех основных этапов: загрузить исходное изображение, выбрать формат будущего ролика и описать движение. Однако функционал программ часто отличается, и конкретные настройки зависят от выполняемой задачи.
При генерации ИИ-видео чаще всего используют три формата.
Добавить движение в исходный кадр. Это самый простой сценарий: фотография остается узнаваемой, а нейросеть добавляет мимику, движение волос, одежды, воды, деревьев или других объектов в сцене.
Создать ролик с речью. Если человек или персонаж должен заговорить, к изображению добавляется текст или аудиозапись. Нейросеть синхронизирует речь с движениями губ и мимикой.
Развить фотографию в новую видеосцену. Здесь исходный снимок становится отправной точкой: персонажи могут двигаться и взаимодействовать с объектами, меняется окружение и ракурс камеры. В более продвинутых генераторах можно использовать референсы, начальный и конечный кадры, чтобы точнее контролировать развитие сцены.
Далее для пошагового примера генерации ИИ-видео будем использовать русскоязычный сервис, который объединяет сразу 3 режима. Нейросеть работает без VPN, и для российских пользователей доступны привычные способы оплаты.
Шаг 1. Выбираем формат видео
Можно выбрать один из трех форматов: оживление фото, говорящий аватар или видеоклип
Сначала стоит определить, насколько сильно должен измениться исходный кадр.
Если хочется просто добавить фотографии естественное движение, подойдет режим «Оживление фото». В ReVideo.AI для такой генерации достаточно загрузить изображение, и подробный промпт необязателен.
Если человек на снимке должен заговорить, выбираем «Говорящий аватар». В этом режиме к портрету добавляется текст или голос, после чего нейросеть синхронизирует речь с движениями губ.
Для более сложных сцен подойдет «Видеоклип». Здесь уже стоит подробно описать действие: как двигаются и взаимодействуют персонажи, что происходит вокруг них, меняется ли камера и каким должен быть общий характер сцены.
Шаг 2. Загружаем фотографию
Для оживления достаточно одного изображения; в более сложных сценариях можно использовать дополнительные референсы
Для простого оживления достаточно одного исходного изображения.
Если создается говорящий аватар, лучше выбирать портрет, на котором хорошо видно лицо. Сложный ракурс, сильное размытие или перекрытые волосами и руками черты могут затруднить генерацию.
Для видеоклипа исходником может быть практически что угодно: портрет, фотография товара, интерьер, автомобиль, пейзаж или иллюстрация.
Сервис поддерживает дополнительные изображения-референсы, их имеет смысл использовать, когда нужно точнее передать определенного персонажа, объект, стиль или композицию.
Шаг 3. Добавляем промпт и озвучку
Последний этап зависит от выбранного формата.
Для оживления фото промпт необязателен: нейросеть может сама подобрать естественные движения. Если нужен конкретный результат, достаточно коротко описать действие:
Девушка слегка улыбается и отворачивает голову от камеры. Волосы двигаются от легкого ветра, деревья на фоне слегка колышутся. Камера остается неподвижной.
В промпте можно задать действия персонажа, движение камеры и окружения, а для говорящего аватара – добавить текст или аудиозапись
Для говорящего аватара нужно добавить текст или аудиозапись. В промпте можно дополнительно указать мимику, жесты и поведение персонажа.
Для видеоклипа промпт задает развитие сцены: действия персонажей, движение камеры, окружение и атмосферу ролика. Подробно разберем структуру такого промпта ниже.
Если для ролика нужен сценарий или текст для озвучки, его можно предварительно подготовить и отредактировать в ReText.AI, а затем перенести в видеогенератор.
После генерации стоит проверить, насколько хорошо сохранились лицо, предметы и фон и соответствует ли движение описанию. Если результат получился перегруженным, чаще помогает сократить промпт и оставить одно основное действие.
Как выбрать фотографию для создания видео из фото
По нашему опыту, качество исходника влияет на результат сильнее, чем кажется. Чем меньше деталей нейросети приходится восстанавливать или додумывать, тем стабильнее сохраняются лицо, предметы и фон.
Выбирайте четкую фотографию. Если лицо или важный предмет изначально размыты, после генерации модель может изменить их еще сильнее.
При необходимости сделайте апскейл. Старый или сильно сжатый снимок лучше сначала улучшить, а затем использовать для видео. При этом слишком агрессивное улучшение тоже нежелательно: апскейлер не должен полностью перерисовывать лицо.
Избегайте перегруженных сцен. Чем больше в кадре людей, пальцев, украшений, мелких предметов и пересекающихся объектов, тем сложнее сохранить их без изменений.
Обращайте внимание на руки и лицо. Эти области зритель замечает в первую очередь, поэтому исходные детали должны быть хорошо различимы.
Как написать промпт для видео из фото
При генерации изображения промпт описывает то, что должно появиться. При создании видео из готовой фотографии основная сцена уже задана, поэтому важнее объяснить нейросети, что в ней должно начать двигаться.
Удобная структура:
объект → движение → окружение → камера.
Например:
Девушка слегка улыбается и медленно поворачивает голову вправо. Волосы двигаются от легкого ветра. Листья деревьев на заднем плане слегка колышутся. Камера плавно приближается.
Не перегружайте короткий ролик действиями
Если видео длится несколько секунд, не стоит просить персонажа одновременно встать, пройти через комнату, взять предмет, повернуться и подойти к окну.
Чем больше крупных изменений должно произойти за короткое время, тем выше вероятность артефактов.
Вместо:
Девушка встает, берет чашку, идет к окну, открывает его, начинается дождь, камера облетает комнату.
Лучше:
Девушка берет чашку со стола и слегка улыбается. Камера медленно приближается.
Следующее действие рекомендуется продолжить уже в отдельном клипе.
Пишите конкретные действия
Фраза:
Красиво оживи фотографию.
оставляет нейросети практически все решения.
Более конкретный вариант:
Мужчина слегка улыбается, моргает и медленно переводит взгляд в сторону камеры.
То же относится к движению камеры. Вместо абстрактного «сделай кинематографично» полезнее написать:
Медленный dolly-in, мягкий естественный свет, небольшая глубина резкости, плавное реалистичное движение.
Не описывайте заново весь исходный кадр
Фотография уже содержит информацию о внешности человека, одежде, фоне, композиции и освещении.
Если снова подробно перечислять эти характеристики в промпте, модель иногда начинает сильнее интерпретировать изображение вместо того, чтобы сохранить его.
Для image-to-video лучше концентрироваться прежде всего на изменениях относительно исходника.
Как попросить нейросеть сохранить исходную фотографию
Если для ролика важно максимально сохранить внешность человека, одежду, фон и композицию, в конец промпта можно добавить отдельное ограничение.
На русском:
Сохрани исходную композицию, внешность и черты лица персонажа, одежду, освещение, цвета, фон и угол камеры. Сцена должна оставаться фотореалистичной и соответствовать исходному изображению. Не добавляй новые объекты и не изменяй внешность персонажа. Сохраняй четкие детали и естественные текстуры на протяжении всего видео.
На английском:
Preserve the original composition, identity, facial features, clothing, lighting, colors, background and camera angle. Keep the scene photorealistic and consistent with the source image. Do not add new objects or alter the subject's appearance. Maintain sharp details and natural textures throughout the shot.
На практике этот промпт-ограничитель сильно уменьшает количество испорченных генераций.
Нейросети для создания видео из фото: что выбрать
Сегодня сервисы для генерации видео заметно отличаются по возможностям. Одни рассчитаны на быстрое оживление фотографии, другие позволяют добавлять речь, а третьи – способны создать сложные сцены и работать с несколькими референсами.
Сравним восемь сервисов с разными сценариями работы. Начнем подборку с русскоязычных программ.
ReVideo.AI
ReVideo.AI объединяет несколько сценариев работы с видео в одном интерфейсе: позволяет оживлять фотографии, создавать говорящих аватаров и генерировать более сложные видеоклипы по изображению, референсу и промпту. В зависимости от задачи можно получить простую анимацию без подробного описания, создать разговорный ролик с озвучкой или задать более сложное развитие сцены.
Когда выбирать: если вы регулярно работаете с контентом и используете разные форматы; если нет зарубежной банковской карты.
Алиса AI
В Алисе AI есть отдельная функция оживления фотографий: нужно загрузить изображение и описать сюжет или воспользоваться готовым вариантом. Функция работает без VPN и доступна бесплатно.
Сильная сторона: минимальный порог входа. Подойдет, если нужно быстро оживить фотографию без сложных настроек и зарубежных сервисов.
Kling AI
Kling подходит для более сложных image-to-video сцен и дает дополнительные способы контроля результата. В сервисе можно использовать изображение как исходный кадр, работать со стартовым и конечным кадрами, а также использовать изображения и видео в качестве референсов.
Сильная сторона: контроль сложных сцен, работа со стартовым и конечным кадрами и референсами.
Runway
Runway – более широкая генеративная платформа для работы с изображениями и видео. Ее инструменты позволяют использовать визуальные референсы для сохранения персонажей, объектов и стиля, а также редактировать существующие видеозаписи с помощью текстовых инструкций – например, менять фон, освещение, объекты и отдельные элементы сцены.
Когда выбирать: когда одной генерации из фото уже мало и нужны более сложные инструменты для генерации и редактирования видео.
Vidu
Vidu поддерживает image-to-video и Reference to Video, а также позволяет использовать несколько изображений-референсов, стартовый и финальный кадры.
Сильная сторона: работа с референсами и сохранение персонажей и объектов между сценами.
PixVerse
PixVerse объединяет генерацию видео из текста и изображений с дополнительными инструментами, включая lip sync, работу со звуком, референсами и готовыми видеоэффектами.
Подойдет: для коротких роликов, экспериментов с эффектами и контента для социальных сетей.
Hailuo AI
Hailuo AI позволяет создавать видео как из текстового описания, так и на основе фотографии. Для image-to-video пользователь загружает исходное изображение и задает движение с помощью промпта.
Подойдет: для динамичных сцен и экспериментов с движением персонажей.
Luma
Luma – кроме генерации с нуля, в платформе есть инструменты video-to-video, позволяющие изменять уже снятые ролики, сохраняя исходное движение или персонажа.
Подойдет: для атмосферных роликов и сцен, где важна работа с камерой и визуальным стилем.
Сравнение ИИ-сервисов
Если нужен генератор видео из фото для регулярной работы, сравнивать сервисы стоит не только по качеству картинки, но и по работе с референсами, доступности бесплатного теста и ограничениям для пользователей из России.
Перед покупкой тарифа лучше сначала использовать доступные тестовые кредиты и проверить сервис именно на своих фотографиях и сценариях.
Можно ли сделать видео из фото бесплатно
Да. Сделать видео из фото бесплатно можно во многих сервисах, но бесплатный доступ устроен по-разному: где-то это отдельная бесплатная функция, где-то первая генерация, а где-то – небольшой запас кредитов для знакомства с моделью.
В Алисе AI функция оживления фотографий доступна бесплатно. ReVideo.AI позволяет бесплатно и без регистрации попробовать первое оживление фотографии.
У зарубежных генераторов бесплатный доступ чаще реализован через кредиты: их можно получить после регистрации или они периодически пополняются. Такие режимы есть у Kling AI, Runway, Vidu, PixVerse, Hailuo AI и Luma.
Частые вопросы о создании видео из фото
Какая нейросеть бесплатно делает видео из фото?
Бесплатно оживить фотографию можно, например, в ReVideo.AI и Алисе AI. У зарубежных сервисов Kling AI, Runway, Vidu и других есть тестовые кредиты, но условия бесплатного доступа периодически меняются.
Можно ли сделать видео из фото с музыкой?
Да. Если выбранный генератор не умеет добавлять музыку самостоятельно, ее можно наложить после генерации в любом видеоредакторе.
Для говорящих персонажей важнее наличие озвучки и lip sync: в этом случае сервис синхронизирует голос с движениями губ.
Как сделать видео из фото нейросетью, чтобы лицо не изменилось?
Чтобы сделать видео из фото нейросетью и максимально сохранить внешность человека, лучше использовать четкое исходное изображение, избегать слишком резких поворотов головы и сложной смены ракурса, а в промпте отдельно попросить сохранить внешность персонажа.
Если генератор поддерживает изображения-референсы, их также можно использовать для повышения визуальной последовательности.
Нужно ли писать промпт для видео из фото?
Не всегда. Для легкого оживления фотографии некоторые сервисы могут автоматически подобрать движение.
Промпт особенно полезен, если нужен конкретный результат: определенная мимика, действие персонажа, движение камеры или изменение окружения.
Что лучше: создать видео из фото или сгенерировать ролик по тексту?
Если необходимо сохранить конкретного человека, товар, интерьер или исходную композицию, удобнее создать видео из фото.
Генерация только по тексту больше подходит для ситуаций, когда исходного визуального материала нет и сцену необходимо создать с нуля.
Вывод
Сегодня сделать видео из фото можно за несколько шагов: загрузить исходник, выбрать формат и при необходимости описать движение в промпте. Для более сложных сцен дополнительно используются референсы, озвучка и управление камерой.
Главное – не пытаться решить все одним длинным промптом. Четкая фотография и одна понятная команда обычно дают более предсказуемый результат, а генератор лучше выбирать уже под конкретную задачу.