Анимация рассказа
Хочу поделиться своей работой своим развлечением по анимации рассказиков. В прошлых роликах использовал неподвижные картинки и только разбирался с несколькими голосами. Этот ролик, около четырёх минут, уже использует анимацию. Пока ещё эта анимация без синхронизации движения губ с разговором и без классных дорогостоящих визуальных эффектов. Можно сказать, я ползу «на честном слове и на одном крыле» или «пердячим паром». За исключением платных голосов, я использую бесплатный ChatGPT-генератор картинок и бесплатный же генератор видео Grok. Тем не менее этот путь, несмотря на усеянность шипами и крапивными ожогами, довольно интересен.
В этом рассказике два главных персонажа — небесные бюрократы отдела отгрузки и приёма в чистилище, и 85% ролика состоит из их разговора. Сначала, как полагается, я выбрал прообразы этих персонажей: генсека ООН Гутерреша и немецкого канцлера Шольца. Вот что вместо них мне выплюнул ИИ. Гутерреш даже немного похож.

Потом полностью ознакомил ChatGPT с содержанием рассказа и заставил его написать для меня промпты для нескольких совместных статических сцен, чтобы придать визуальное разнообразие позам и выражениям лица. Причина этого заключается в том, что видеогенератор не может сильно отступать от положения, заданного трафаретным рисунком. И так как рассказ маленький, решили ограничиться четырьмя базовыми рисунками.
Дальше ChatGPT уже написал мне промпты для генератора образов Grok. И вот на основании этих образов я сделал основную часть ролика. Но тут был один нюанс. Общая протяжённость роликов Grok — десять с половиной секунд, а протяжённость звуковой дорожки — три с половиной минуты. Так что пришлось поочерёдно менять части разных исходных анимаций для создания хоть какого-то визуального разнообразия.
И тут пришлось выучить парочку технических приёмов. Часто в исходных роликах оба персонажа говорили одновременно. Почему Grok так истолковал промпты — одному богу известно. Но дарёному коню, знаете… Поэтому ChatGPT научил меня технике замораживания одного из персонажей на одном из кадров в то время, как второй персонаж владеет нитью разговора. Делается это так: на верхнем слое куска видео вокруг одного из персонажей накладывается маска, так что вся остальная часть кадра не видна. А нижний слой того же куска фиксируется на одном из кадров. Таким образом только один из персонажей говорит. Преимущество такого метода в том, что на том же куске видео можно сделать маску вокруг другого персонажа и переиспользовать его в разговоре второго персонажа.
Ещё одним приёмом является замедление кадра, что растягивает видеокадр до нужного размера.
Сейчас расскажу о самом неприятном моменте в работе с ИИ-генераторами, в рамках финансовых ограничений, что приводит к многочисленным недоделкам и переделкам.
Очень трудно заставить генератор вести себя прилично — то есть так, как ты хочешь. Например, говоришь ему: «пусть персонаж просто стоит и отвечает». Фигу. За пять секунд видео он стоял и говорил одну секунду, потом вдруг поднял колено на девяносто градусов, развернулся и побежал. В других тестах вместо спокойного разговора персонаж внезапно начинал бешено жестикулировать, словно его вот-вот поведут на расстрел. Мы с GPT так и не поняли, в чём причина такого непредсказуемого поведения и как сделать так, чтобы его обуздать. Поэтому пришлось много резать и сшивать.
Как же разрешить эту проблему?
Во-первых, можно попробовать ИИ-генераторы других компаний. Наверное, у каждого есть свои плюсы и минусы. Но тут я упираюсь в финансовые ограничения. Каждый такой сайт — а их сейчас с десяток-полтора — не даёт нормально попробовать сервис бесплатно. Нужно покупать подписку как минимум на месяц. А это стоит где-то от десяти до тридцати долларов. В сумме набегает дополнительные двести–триста долларов. А мои ролики, дай бог, чтобы кто-то вообще смотрел бесплатно. Во всяком случае — пока.
Что же делать?
Ведь в конце концов я хочу перерасти схематичную анимацию и добраться не только до синхронизации губ со словами, но и до более точного выражения эмоций: грусти, радости, презрения — в соответствии со сценарием, а не довольствоваться случайными выбрыками ИИ-генератора.
Поэтому я начал изучать обучающие видео по двумерной анимации в программе Moho 14. Это серьёзная анимация, где можно контролировать практически всё — вплоть до движения глаз. Но, разумеется, сам процесс освоения не так-то прост. Придётся учить довольно старого пса довольно новым фокусам. Но, как говорится, «дорогу осилит идущий».
Пока буду учиться, сделаю ещё один ролик — чтобы закрепить навыки. А недели через три у меня уже намечен короткий рассказик, который я хочу выполнить в технике двумерной анимации.
Надеюсь, что в будущем смогу совмещать подходы: менее ответственную часть финального ролика делать с помощью ИИ, а более ответственную — с помощью двумерной анимации в Moho.
Разумеется, меня мучили сомнения: а не появится ли через год ИИ-генератор, который обесценит все мои усилия? Вот что GPT ответил мне по этому поводу:
• Инструменты меняются, основы — нет.
Системы генерации будут улучшаться, но тайминг, мизансцена, подготовительное движение, сдержанность и визуальная иерархия никуда не исчезнут. ИИ лишь имитирует эти правила — он их не отменяет.
• ИИ усиливает суждение, а не заменяет его.
Без понимания анимации ты не сможешь определить, почему результат ИИ плох и как его ограничить. Ты начинаешь вслепую подбирать промпты.
• Контроль важнее удобства.
Когда ты понимаешь структуру костей, поз и ограничения движения, ты можешь осознанно контролировать неподвижность, минимализм и символическое движение — именно то, что требует твой стиль. ИИ по умолчанию склонен к избыточности.
• Навык переносим.
Всё, чему ты учишься в Moho (позы, дуги, плавность движения, визуальная экономия), напрямую переносится в будущие инструменты. Это не потраченное впустую время.
• Ты изучаешь не «программу», а язык.Moho — лишь конкретный способ усвоить этот язык.
Слепая зона, которой стоит избегать:
Ожидание, что будущий инструмент устранит необходимость понимания, — это ошибка категории. Такой инструмент, наоборот, будет вознаграждать тех, кто уже понимает предмет, и огорчать тех, кто не понимает.
Пожалуй, нечего добавить.
Вот, что получилось в результате:
/https://vkvideo.ru/video420097318_456239054




Еще раз спасибо за ссылку.
Проверил качество голосов и должен сказать: понятно почему они бесплатные. Эти голоса не способны передавать интонации и сайт не предоставляет никаких тэгов контроля над выразительностью.
Тем не менее такой звуковой трак хорош для начальной разметки ролика для визуального трака, и позволяет обратить внимание на те места диалога, в которых требуют особого внимания.