Блог
Статья30 августа 2026 г.

Как писать промпты для Veo: звук, кадры, запреты

У Veo звук включён всегда, поля запретов нет, а ролик с ребёнком выйдет из текста и не выйдет из фото. Разбор синтаксиса Google Veo 3.1 по документации.

Как писать промпты для Veo: звук, кадры, запреты

Промпт для Veo — это сценарий вместе со звуковой дорожкой. Модель всегда пишет звук, читает в тексте реплики и шумы, но не принимает списка запретов: такого поля у неё нет. Соотношений сторон всего два. А ролик с ребёнком получится из текста и не получится из загруженной фотографии. Дальше — разбор каждого из этих правил.

Это блог RED AI, сервиса доступа к нейросетям за рубли. Прогонов с подсчётом брака здесь нет — есть разбор двух руководств Google и того, как устроена форма Veo в самой студии.

Страницы открыты 15 августа 2026 года через исходный код, а не через пересказ: у документации Veo половина фактуры лежит в таблицах, а конвертеры страниц в текст эти таблицы теряют.

Звук нельзя выключить — значит, его придётся написать

В таблице возможностей на странице Veo в Gemini API [1] строка Audio у Veo 3.1, 3.1 Fast, 3.1 Lite и Veo 3 заполнена одинаково: «Always on». Отметка «Silent only» стоит только у старой Veo 2. Переключателя вроде generate_audio, который есть у Kling и Seedance, в параметрах Veo просто не существует.

Отсюда следствие, которое стоит осознать до первой генерации: молчаливый промпт не даёт молчаливого ролика. Он даёт ролик со звуком, который модель сочинила сама. Восемь секунд дорожки, которую вы не выбирали, — обычный результат запроса, где про звук не сказано ни слова.

Google просит описывать звук отдельными предложениями и делит подсказки на три вида (руководство по промптам для видео [2]): шумы («the sound of a phone ringing»), эмбиент («the quiet hum of an office») и реплики.

Ровно эти три кнопки стоят под полем промпта на странице Veo в студии — они вставляют в текст SFX:, Ambient noise: и says, "...". Больше ни у одной видеомодели каталога такой группы нет; у Grok одна кнопка Sound:, у остальных — ни одной.

И отдельный вид отказа, который у молчаливых моделей невозможен по устройству. В разделе ограничений записано: «Veo 3.1 will sometimes block a video from generating because of safety filters or other processing issues with the audio» [1] — и там же обещание не списывать деньги за заблокированный ролик. То есть генерация может сорваться из-за дорожки, которую вы не заказывали.

Реплики: кто говорит, в кавычках и по-английски

Синтаксис реплик Google показывает примером, а не правилом. В демонстрационном промпте на странице Veo он выглядит так:

Man: (Hand on his hunting knife) “That’s no ordinary bear.” Woman: (Voice tight with fear, scanning the woods) “Then what is it?”

Роль, ремарка в скобках, прямая речь в кавычках. Это ближе к записи пьесы, чем к описанию кадра.

Во втором руководстве Google то же самое оформлено иначе — репликой внутри предложения: «the man in the red hat says: Where is the rabbit?». Оба варианта приведены вендором как рабочие, так что выбирать можно по удобству. Общее в них одно: говорящий назван до слов.

Длина реплик упирается в хронометраж. Собственный короткий пример Google на восьмисекундный ролик — две строки диалога, по одной на персонажа. Монолог на четыре предложения в такой клип не помещается физически, и модель его либо ускорит, либо оборвёт.

Про язык сказано прямо: «English (EN) is fully supported, but other languages have not been evaluated» [1]. Не «не поддерживается» — «не проверялось». Русская реплика может сработать, а может дать акцент или кашу; на этом месте в форме студии висит подсказка про английский, и она не из вежливости.

Ещё одна деталь для тех, кто продлевает ролики: «voice is not able to be effectively extended if it’s not present in the last 1 second of video» [1]. Продление подхватывает голос, только если он звучит в последнюю секунду исходного клипа. Замолчали за кадр до конца — во втором куске речи не будет.

Поля запретов нет, а слово «no» Google не советует

Здесь Veo расходится с тем, к чему приучают другие модели. На странице Veo в Gemini API слова «negative» нет ни разу — ни параметра, ни абзаца. Нет его и в форме RED AI: в схеме запроса к Veo поля под запреты не заведено.

Механизм при этом существует, но описан в другом руководстве Google — там, где речь про Veo в облачной платформе. И вместе с ним идёт правило, которое опрокидывает привычку:

«Not recommended: using instructive language or words such as “no” or “don’t”. For example, avoid prompts such as “no walls” or “don’t show walls”» [2]. Вместо этого предлагается перечислить сами объекты: wall, frame.

Практический вывод получается неудобным, но чётким. Приём «списком через NOT», который в шаблонах под Kling вычищает из кадра качели и припаркованные машины, для Veo — не приём. Здесь работает обратное: подробно описать то, что должно быть в кадре, и не описывать то, чего быть не должно. Каждое упоминание предмета — заявка на его появление.

Камера: словарь, который читается буквально

Список движений камеры у Google разложен по терминам, и разница между соседними описана явно. Dolly — камера физически едет к объекту; zoom — меняется фокусное расстояние, а камера стоит на месте (руководство по промптам [2]).

Дальше по списку: truck — проезд вбок, pedestal — подъём по вертикали с сохранением горизонта, whip pan — резкий смаз, arc — облёт по дуге.

Полезнее всего то, что в этот же словарь входят монтажные термины: match cut, jump cut, establishing shot sequence, montage, split diopter effect. Veo понимает их прямо в тексте промпта — отдельного поля под раскадровку, как у Kling, здесь нет и не нужно.

Кнопки движения камеры в студии собраны из того же словаря: наезд, отъезд, проводка, панорама, наклон, облёт, кран, съёмка с рук, FPV-дрон, статика. Правило их использования одно и записано прямо в коде формы — один приём движения на кадр. Два движения в восьми секундах превращаются в дёрганье.

Ребёнок в кадре: из текста можно, из фотографии нельзя

Самое дорогое ограничение Veo спрятано в одной строке таблицы параметров и звучит безобидно. Параметр personGeneration у Veo 3.1 расписан по режимам: «Text-to-video & Extension: “allow_all” only. Image-to-video, Interpolation, & Reference images: “allow_adult” only» [1].

Разверну. allow_all — люди любого возраста. allow_adult — только взрослые. В режиме с текстом доступно только первое значение. В режимах с картинкой — только второе. Выбора нет ни там, ни там. Это тот самый компромисс между генерацией из текста и из фото, где закреплённый стартовый кадр забирает не только настройки, но и доступный возраст персонажей.

Значит, самый частый бытовой запрос — «оживить фотографию ребёнка» — у Veo закрыт по построению. Ни первым кадром, ни парой «первый плюс последний», ни референсами: все три режима перечислены в одной строке с allow_adult. Ролик с ребёнком модель сделает по текстовому описанию, но лицо с вашего снимка туда не попадёт.

К этому добавляется география. В странах ЕС, Великобритании, Швейцарии и регионе MENA у Veo 3 и 3.1 разрешено только allow_adult [1] — там ограничение распространяется и на генерацию из текста.

Длительность: 4, 6, 8 — и почему почти всегда 8

Выбор длительности у Veo выглядит свободным, пока не наложить на него разрешение и режим. Собранная из таблиц параметров и возможностей картина для Veo 3.1 и 3.1 Fast:

Что выбрано 4 с 6 с 8 с
720p, из текста или из кадров да да да
1080p нет нет только 8
4K нет нет только 8
Референсы (до 3 картинок) нет нет только 8
Продление ролика только 8, и только 720p

Источник строк — таблица параметров Veo [1]: durationSeconds — «“4”, “6”, “8”. Must be “8” when using extension, reference images or with 1080p and 4k resolutions». У Lite набор чуть уже: 4K там нет вовсе, а продления не существует.

Частота кадров у всех версий одна — 24 fps [1]. Восемь секунд — это 192 кадра, и продление, по описанию Google, «finalizes the final second or 24 frames», то есть склеивает по последней секунде.

Дальше — то, чего в документации Google нет, потому что это про тарификацию сервиса, а не про модель. В RED AI цена ролика Veo считается по тарифу, типу генерации и разрешению; длительность на цену не влияет.

Четырёхсекундный клип стоит столько же, сколько восьмисекундный. Экономить секундами тут не на чем — короткий ролик берут ради монтажа, а не ради денег.

И честное замечание про свою же форму: она не блокирует комбинацию «1080p + 4 секунды», хотя документация Google такую комбинацию запрещает. Ставьте восьмёрку руками, если выбрали высокое разрешение или референсы.

Расхождение внутри одной страницы

Пример того, почему документацию стоит читать по ячейкам. Раздел «Using first and last frames» на странице Veo открывается примечанием: «This feature is available for Veo 3.1 models only».

Строкой ниже, в большой таблице параметров, поле lastFrame заполнено значением Image object во всех четырёх колонках — Veo 3.1 и Fast, Veo 3.1 Lite, Veo 3 и Fast, Veo 2.

Одно из двух утверждений неверно, и из страницы не следует, какое. В тексте и в таблице — разные ответы на один вопрос. Практический вывод простой: если работа завязана на интерполяцию между первым и последним кадром, берите Veo 3.1 — версию, которая указана в обоих местах.

Про сам параметр там же сказано важное: lastFrame — «Must be used in combination with the image parameter» [1]. Последний кадр без первого не принимается. Одна картинка — это анимация от неё; две — переход между ними.

Что не получится

Квадрат и вертикаль 4:5. Соотношений сторон у Veo ровно два: «“16:9” (default), “9:16”» [1]. Ни 1:1, ни 4:5 в списке нет. Квадрат под ленту придётся вырезать из готового ролика, теряя края кадра, за которые уже заплачено.

Два видео за один запрос. У Veo 3.1 в строке «Videos per request» стоит 1 [1]; пара вариантов на выбор была только у старой Veo 2. Перебор формулировок здесь всегда последовательный.

Работа с несколькими видео сразу. «Referencing or reasoning across multiple videos is not currently supported» [1] — попытка обещает деградацию результата, а не ошибку.

Больше трёх референсов. referenceImages — «Up to three images» [1], и речь про одного персонажа или один продукт, а не про трёх разных героев.

Хранение. Ролики лежат на сервере Google двое суток [1]. Скачивать надо сразу — и это относится к API, а не к вашей истории генераций в сервисе-посреднике.

Скорость. Заявленный разброс — от 11 секунд до 6 минут в часы пик [1]. Шестикратная разница между «сейчас» и «когда-нибудь» — нормальное поведение, а не сбой.

Маркировка. Все ролики Veo несут водяной знак SynthID [1] — невидимый, но машиночитаемый. Для площадок, которые помечают ИИ-контент, это факт, о котором лучше знать заранее.

Где посмотреть и что нажимать

Три режима Veo вынесены в студии переключателем: текст, кадры, референсы — на странице Veo. Там же выбираются уровень (Quality, Fast, Lite), разрешение, соотношение и длительность, а под полем промпта стоят те самые кнопки со звуковыми подсказками и движениями камеры.

Оговорка, которую честнее сказать вслух: готовых шаблонов под Veo в каталоге промптов пока нет — видеошаблоны там собраны под Kling. Разбирать в каталоге нечего, поэтому в статью пошли подсказки, встроенные в саму форму. Дыру в каталоге это не закрывает, и о ней мы знаем.

Вывод под конкретный сценарий. Нужен кадр с репликой и звуком — пишите сцену, потом отдельными предложениями шум и эмбиент, потом реплику с указанием говорящего, по-английски, и ставьте 8 секунд.

Нужен ролик с ребёнком — только режим из текста, фотографию приложить не выйдет. Нужен вертикальный формат для ленты — берите 9:16 и режьте потом: 4:5 у Veo нет.

Как собран материал

Правила и ограничения процитированы по двум документам Google: странице Veo в Gemini API [1] (внизу страницы стоит дата правки 30 июля 2026) и руководству по промптам для генерации видео [2] (13 августа 2026).

Обе открыты 15 августа 2026 года и разобраны по исходному коду — иначе таблицы с параметрами теряются при конвертации, а вместе с ними и половина ограничений.

Утверждений вида «эта формулировка даёт результат лучше» в тексте нет: такое проверяется серией прогонов с подсчётом брака. Числа про сроки, разрешения и длительности взяты у вендора и меняются без предупреждения — перед расчётом сверьтесь с источником по номеру сноски. Черновик готовился с языковой моделью, цитаты сверены по исходному коду страниц.

Источники

  1. Google, Gemini API — страница Veo (параметры и возможности моделей), редакция от 30 июля 2026 года.
  2. Google Cloud, Vertex AI — руководство по промптам для генерации видео, редакция от 13 августа 2026 года.