Владимир Чернявский
Незаконное потребление наркотических средств, психотропных веществ и их аналогов причиняет вред здоровью, их незаконный оборот запрещён и влечёт установленную законодательством ответственность.

«Ночной посетитель»: эксперимент с коротким AI-фильмом

0+
«Ночной посетитель»: эксперимент с коротким AI-фильмом

Интернет полон впечатляющих демонстраций ИИ, но не так много людей рассказывают о том, что происходит, когда действительно пытаешься что-то построить с помощью этих инструментов.

На практике работа быстро превращается в последовательность небольших технических компромиссов: короткие клипы, которые приходится использовать повторно, анимации, ведущие себя непредсказуемо, персонажи, которые двигаются тогда, когда им следовало бы оставаться неподвижными.

То, что со стороны выглядит как «кино, сделанное ИИ», на деле часто оказывается ближе к монтажу, маскированию, замораживанию кадров и сшиванию фрагментов до тех пор, пока из них не начинает складываться история.

Иными словами, настоящее мастерство заключается не столько в генерации изображений, сколько в том, чтобы заставить непредсказуемые инструменты вести себя как съёмочная группа.

Именно с таким подходом я и начал работу над небольшим экспериментом — попыткой превратить свой рассказ «Ночной посетитель» в короткий фильм.

Проблема голоса

Когда я начал адаптировать текст в визуальный сценарий, цель была довольно простой: убрать описательную прозу и заменить её визуальными сценами. Иначе говоря, обращаться с текстом как со сценарием — оставить только диалоги и рассказчика там, где это действительно необходимо.

Но в этом рассказе возникло неожиданное осложнение.

История написана от первого лица, и рассказчик — это внутренний голос главной героини, Дженни.

Это означало, что фильму требовались две версии одного и того же голоса:

— Дженни, которая говорит вслух с роботом
— и Дженни, которая думает про себя, комментируя происходящее.

Эти два голоса должны быть различимы для зрителя, но при этом ощущаться как принадлежащие одному и тому же человеку.

В обычном кино это довольно простая задача. Актёры делают это почти инстинктивно. Внутренний голос и произнесённая речь отличаются множеством нюансов — тембром, высотой, ритмом, степенью уверенности, эмоциональным оттенком, даже ощущением дистанции до собеседника.

Иногда режиссёр вообще использует двух разных актёров, если между ними возникает нужная «химия».

Но когда один человек делает всё в одиночку, эти вещи неожиданно оказываются очень трудными для технического описания.

Человеческое ухо распознаёт такие различия мгновенно, а вот объяснить их машине — гораздо сложнее.

Работая с голосами ИИ, я обнаружил любопытную проблему. Можно выбрать разные голоса, но они редко ощущаются родственными. Чаще всего они звучат либо как два разных человека, либо как один и тот же голос, читающий два несвязанных абзаца.

А мне было нужно нечто промежуточное — одна и та же личность, выраженная через два разных состояния сознания.

После множества экспериментов я понял, что добиться такого баланса с доступными инструментами не получается.

Поэтому пришлось принять решение.

Вместо того чтобы притворяться, будто история является полноценным сценарием, я вернул её к тому, чем она изначально и была — озвученному рассказу, сопровождаемому визуальными сценами.

Иными словами, фильм превратился в визуализированное повествование, а не в чисто кинематографический сценарий.

Парадоксально, но это ограничение даже упростило структуру фильма.

Теперь повествование выступает как непрерывная внутренняя перспектива Дженни, а визуальные сцены показывают внешние события — странного посетителя, его неисправность и постепенное осознание того, что в ту ночь в кафе вошло нечто крайне неестественное.

Похоже, современные инструменты ИИ гораздо лучше справляются с иллюстрацией повествования, чем с его полной заменой.

Во многих случаях наиболее естественный формат оказывается ближе не к кино, а к иллюстрированному рассказу или даже анимированной аудиокниге.

Проблема генерации видео

Следующая проблема появилась уже при создании самих видеосцен.

Чтобы история выглядела цельной, персонажи должны были сохранять одинаковый внешний вид во всех кадрах. Самый простой способ добиться этого — использовать статическое референс-изображение для каждой сцены.

Этот метод в целом работал: персонажи оставались узнаваемыми.

Но возникла другая проблема.

Когда генератору одновременно давали изображение и текстовый промпт, он почти полностью игнорировал текст и просто пытался «оживить» само изображение.

В результате персонажи начинали двигаться тогда, когда должны были стоять, появлялись случайные жесты, а иногда движения больше напоминали парадный марш, чем усталого человека, входящего ночью в кафе.

Неожиданная мелочь в настройках

Интересная деталь обнаружилась уже в процессе работы.

По умолчанию в настройках Grok Imagine включена опция Automatic Video Generation — генератор автоматически начинает превращать загруженное изображение в видео.

Я заметил, что при таком режиме система почти полностью игнорирует текстовый промпт и просто пытается «оживить» картинку по собственному усмотрению.

После нескольких экспериментов я отключил эту опцию и стал запускать генерацию видео вручную.

И неожиданно ситуация заметно улучшилась: генератор начал гораздо внимательнее реагировать на текстовое описание сцены.

Иногда такие мелкие настройки оказываются важнее, чем сами промпты.

Разговор с машиной

После этого рабочий процесс приобрёл довольно любопытную форму.

Вместо того чтобы пытаться получить идеальный результат с первого промпта, я начал принимать первый клип как черновик, а затем просить внести изменения.

Диалог с генератором буквально выглядел так:

Спасибо, это уже довольно хорошо.
Однако можно изменить…

И дальше следовало описание того, что именно нужно поправить в уже созданном клипе.

В какой-то момент стало понятно, что генератор ведёт себя не столько как рендер-движок, сколько как ассистент, которого приходится направлять шаг за шагом.

Первая попытка создаёт общую структуру сцены, а последующие правки постепенно приближают результат к тому, что действительно требуется.

Такой итеративный подход оказался намного надёжнее, чем попытка сразу написать идеальный промпт.

Похоже, современные генераторы видео ведут себя меньше как машины и больше как младшие соавторы. Они быстро создают что-то правдоподобное, но настоящая работа заключается в том, чтобы направлять и корректировать их, пока результат не совпадёт с замыслом.

Отдельной маленькой задачей оказалось использование звуковых эффектов.
Например, в тексте есть фраза «Дверь хлопнула». Сначала я поставил звук одновременно с этой репликой, но сцена звучала искусственно. Гораздо естественнее оказалось дать хлопок двери за мгновение до слов — сначала звук, потом осознание.

Похожая история получилась с полицейскими сиренами. В тексте они упоминаются в описании ночного города, но я пустил их немного раньше. Так звук перестаёт быть иллюстрацией текста и превращается просто в часть ночной атмосферы.

Мог бы описать ещё несколько технических деталей, но боюсь и так уже утомил читателя.

Ниже — короткий фильм, который получился в результате этого эксперимента.

Youtube:

VK


+3
21:34
128
17:33
Спасибо, интересный опыт.
Думаю, что просто инструмент будет совершенствоваться, на данном этапе у вас получилось неплохо.
Конечно, навязчивое протирание стола не идёт на пользу фильму, но всё-таки подобие жизни в кадре есть.
Я тоже мечтаю делать фильмы по своим произведениям.
19:02 (отредактировано)
Спасибо! Да, мне тоже многое не нравится. Но если не экспериментировать, то вообще ничего не будет. Надеюсь следующий ролик будет лучше. Кажется, что можно вернуться и исправить. Но к концу производства ролика чувствуешь сильный «эмоциональный» износ. Это как бежать десять кругов, пересечь финишную прямую, а потом узнать, что нужно бежать еще один круг. Занимаюсь пока только коротенькими рассказиками. И стараюсь не делать подобных ошибок в следующем ролике.

Сейчас пытаюсь овладеть программой Moho 14. Она позволяет гораздо больший контроль над выражением лица, направленным движением, и даже осуществлять синхронизацию движений губ с тектом. Но все это не так уж и просто. Я на уроке №6 из 38.

А какие из ваших произведений вы бы хотели видеть в форме фильма?
12:36 (отредактировано)
Какие произведения?
Да все.
Только вот несмотря на то, что я давно на пенсии, времени совершенно нет, поэтому давайте, совершенствуйтесь в создании фильмов, а там посмотрим. crazy
15:01
Прочел ваш рассказ про джинсы. Мы из одного поколения. Времени это, действительно, забирает кучу. Но вы могли бы начать с простой озвучки. Начитать рассказ. Сохранить его как звуковой файл. Поставить картинку, название, имя и прорендать как mp4 и вуаля. Я делаю такие файлы для сестры. Она стихи пишет. А я с помощью сайта Suno превращаю их в песни.

В общем, если хотите знать детали — обращайтесь.
08:52
Я веду канал озвучек, а также канал о жизни в Болгарии(видео на ютубе).
И ещё ведь надо писать.
Подрабатывать(пенсия то смех).
Огород, дом, сад.
Кстати, сейчас у меня озвучка ко Дню снов «Сонник, я и дядюшка Фрейд», можете послушать и почитать. К сожалению, аудиоприставка сломалась, поэтому качество не то, чего хотелось бы.
Как то так.
12:14
Дайте пожалуйста адрес вашего Youtube канала. Я там со всем и познакомлюсь.

Рекомендуем быть вежливыми и конструктивными. Выражая мнение, не переходите на личности. Это поможет избежать ненужных конфликтов.

Загрузка...