Промпты для Grok Imagine: разбор шести шаблонов
У Grok текстовый промпт сначала становится кадром и только потом движением. Разбор шаблонов каталога, посекундной цены и мест, где запрос меняется молча.

Промпты для Grok Imagine пишутся в два слоя: сначала кадр, потом движение внутри кадра. Так устроена сама модель — запрос из текста у неё проходит через картинку, и оживает уже она. Дальше — шесть живых шаблонов каталога RED AI, разобранных на повторяющиеся блоки, арифметика посекундной цены и три места, где Grok меняет запрос молча.
Это блог RED AI, сервиса доступа к нейросетям за рубли. Своих прогонов Grok для этой статьи не было: разобрано то, что написано в документации xAI, у площадки KIE (через неё запрос уходит к модели) и в шести шаблонах нашего же каталога. Единственное число из сервиса — время ожидания, и оно снято с двух заказов, о чём сказано на месте.
Текст у Grok сначала становится картинкой
Формулировка из документации xAI, дословно: «text-to-video uses text-to-image then image-to-video under the hood: the model generates a first frame from your prompt, then animates it» — модель рисует первый кадр по вашему тексту, а затем анимирует его [1]. Промежуточная картинка не возвращается, запрос остаётся один.
Отсюда практика. Половина промпта должна описывать неподвижный кадр: свет, фон, план, объектив. Вторая половина — что в этом кадре меняется. Напишете только движение — модель придумает кадр за вас и честно облетит камерой то, что придумала.
В режиме из фотографии первый кадр берётся из файла, и промпт там вообще необязателен [2]. То есть половина работы уже сделана — остаётся описать движение.
Косвенно это видно и в слепых рейтингах. В Video Arena от Artificial Analysis
классический grok-imagine-video стоит 18-м из 28 в текст-в-видео и 11-м из 29
в фото-в-видео, а grok-imagine-video-1.5 — 4-й из 29 в фото-в-видео и в текстовом
рейтинге не представлен вовсе (снято 17.08.2026: рейтинг text-to-video [3],
рейтинг image-to-video [4]).
Оговорки обязательны. Доверительный интервал ±7–8 пунктов, места площадка сама пишет диапазонами: 4–6 и 11–13. У версии 1.5 всего 5423 голоса против 13 558 у классической. Elo двух таблиц между собой не сопоставимы — сравнивать можно только порядок внутри каждой.
Шесть шаблонов каталога: что в них повторяется
В каталоге промптов RED AI под Grok лежит шесть записей — пять на классической модели и одна на Video 1.5. Все шесть про оживление готового кадра, ни одной текстовой сцены с нуля. Я разобрал их промпты на блоки и посчитал, сколько раз каждый блок встречается.
| Блок | Сколько шаблонов из шести | Как выглядит в промпте |
|---|---|---|
| Удержание личности | 6 | Keep the exact same face and identity stable — no morphing |
| Камера почти неподвижна | 6 | Camera LOCKED — no pan, no zoom, no dolly |
| Ведущее движение названо первой фразой | 6 | Primary motion: shared soft smile growing slightly, gentle blinks |
| Запрет склеек | 4 | smooth continuous motion, no sudden cuts |
| Звук одной фразой | 2 | Soft projector whir |
| Правовой запрет внутри промпта | 1 | do NOT copy any celebrity choreography or artist likeness |
Скелет читается сразу: одно движение, зафиксированная камера, лицо под замком. Ни один из шести промптов не просит героя пройти по комнате и обернуться. Автор шаблонов явно уже посмотрел, что бывает с лицом на таком движении.
Отдельно про звук. Он у Grok в ролике будет всегда, и описывается одной фразой,
а не блоком: в форме под это заведена единственная подсказка Sound: — в отличие
от Veo, где подсказок под звук три (шумы, фон, реплика). Шаблоны каталога с этим
согласны: Soft ambient room tone, Soft projector whir — по четыре слова,
и ни в одном нет расписанной звуковой дорожки.
Три шаблона подробно
«Плёночное мерцание»: движется не человек, а плёнка
Самый ходовой из шести: 7 запусков и 2 отметки «нравится» против 2–3 запусков
у остальных (данные каталога на 17.08.2026). Промпт устроен против интуиции.
Субъект прямо запрещено двигать: Subject stays almost completely still — no wind, no hair blow, no clothing flutter. Анимируется оптика — пульсирующая экспозиция,
ползущее зерно 35 мм, царапины, пылинки в луче.
Приём обходит главную беду оживления портретов. Двигаешь лицо — лицо плывёт.
Двигаешь свет вокруг лица — плывёт свет, а он и так дрожит. В шаблоне закреплены
режим normal, 8 секунд и 720p, звук задан одной фразой: Soft projector whir.
«Живой семейный кадр»: число людей проговорено
В шаблоне на семейное фото к удержанию личности
добавлены same count и no face swap — счёт людей
в кадре назван прямо. Дальше запрет на масштаб движения: no chaos, no windstorm, no running. Камера жёстко закреплена словом LOCKED, звук — Soft ambient room tone, из параметров зафиксированы 6 секунд и 720p.
Групповой кадр — худший случай для оживления: людей несколько, лицо мелкое, а модель охотно превращает четвёртого справа в пятого. Отсюда и счёт.
«Возьми телефон (вайб)»: запрет как часть промпта
Единственный шаблон, где в текст вписана правовая рамка: Original generic motion only — do NOT copy any celebrity choreography or artist likeness. Рядом
no warped hands — руки с телефоном ломаются чаще всего остального. Параметры
не закреплены ни одного: шаблон отдаёт разрешение, длительность и режим настройкам
формы.
Отрицания здесь в ходу — и это не общее правило
Поля запретов у Grok нет: ни в документации xAI, ни в схеме площадки-посредника
нет ничего похожего на negative_prompt. Запреты идут внутрь текста, и все шесть
шаблонов каталога написаны именно так — no morphing, no pan, no cuts,
do NOT copy.
Для сравнения: Google в руководстве по видеомоделям отводит запретам отдельное поле
и прямо не советует формулировать их словами — «Not recommended: using instructive
language or words such as “no” or “don’t”», вместо «no walls» предлагается перечислить
wall, frame [5].
У Grok такого поля нет, и деваться отрицаниям некуда. Доказательства, что здесь они
срабатывают надёжнее, у меня нет — есть практика каталога: шесть промптов из шести
держатся на них.
Секунды здесь считаются деньгами
Тарификация Grok посекундная — и у вендора, и у нас. У xAI по прайсу классическая модель стоит $0,05 за секунду в 480p и $0,07 в 720p, версия 1.5 — $0,08, $0,14 и $0,25 за секунду в 480p, 720p и 1080p соответственно [6].
В студии RED AI ставка за секунду тоже растёт от разрешения: на классике 3 и 4 ₽AI за секунду в 480p и 720p, на Video 1.5 — 5 и 6 ₽AI. Ролик 6 секунд в 720p на классике выходит в 24 ₽AI, восемь секунд на 1.5 — в 48 ₽AI. Цены сверены 17 августа 2026, точная сумма всегда показана у кнопки запуска до списания.
Длительность у двух поколений разная, и это влияет на промпт сильнее цены. В документации xAI диапазон один для всего — 1–15 секунд. В форме RED AI ползунок на Video 1.5 начинается с одной секунды, а на классике — с шести: короче посредник запрос не принимает. То есть под классику промпт всегда пишется минимум на шесть секунд экранного времени, и одно моргание их не заполнит.
Пол цены на Video 1.5 — 15 ₽AI, и он даёт неочевидный эффект: ролик в одну секунду 480p стоит столько же, сколько в три. Секунду просить незачем — просите три. А пятнадцать секунд в 720p обойдутся в 90 ₽AI, и промпт под такую длину должен нести три-четыре события, иначе вы платите за паузу.
Время тоже растёт от длины и разрешения — это записано и в документации xAI («longer videos take more time», «higher resolutions increase processing time»), и в наших настройках ожидания: для Video 1.5 выставлено 240 секунд. Число снято с двух выполненных заказов, разброс между ними 58 и 416 секунд. Выборка крошечная, порядок — минуты.
Три места, где запрос меняется молча
Режим spicy при своей картинке становится normal. Прямая цитата площадки:
«When generating videos using external image inputs, Spicy mode is not supported
and will automatically switch to Normal» [7].
Переключатель в форме останется в выбранном положении, а поедет другой режим.
Соотношение сторон при своём кадре растягивает картинку. xAI пишет, что в режиме из фото соотношение по умолчанию берётся из файла, а заданный параметр «will override this and stretch the image to the desired aspect ratio» [1]. Посредник в описании того же поля утверждает другое: «This parameter is invalid if it is a single image».
Что верно, из двух документов не следует, и это раздражает: цена ошибки — весь
ролик. Безопасное поведение одно — ставить соотношение исходника. На Video 1.5
для этого есть значение auto, и его лучше не трогать; на классике такого
варианта нет, выбирайте руками то, что у файла.
Синтаксис ссылки на картинку зависит от того, откуда зовут модель. У xAI
в режиме с референсами картинки адресуются как <IMAGE_1>, <IMAGE_2> [8],
у посредника — как @image1 с пробелом после, а подсказка в нашей форме вставляет
Image 1. Практический вывод скучнее спора: если кадр один и он загружен, ссылаться
на него в тексте не нужно вообще — он и есть первый кадр.
Чего у Grok в RED AI нет
- Изображений. У xAI в семействе Imagine есть и генерация картинок
(
grok-imagine-image-2.0, $0,04 за изображение), но в RED AI из Grok подключено только видео. Промпты под картинки этой статье не пригодятся. - Продолжения и правки готового ролика. У вендора есть extend (вход 2–15 секунд, добавка 2–10) и редактирование видео с входом до 8,7 секунды [9] [10]. В нашей форме этих режимов нет.
- 1080p. У xAI версия 1.5 его поддерживает, в форме RED AI выбор из 480p и 720p.
- Референсов и голосов. Режим reference-to-video принимает до семи картинок
и до трёх готовых голосов по
voice_id, обращение к ним —<AUDIO_0>. Он не подключён; загруженный кадр у нас работает как первый кадр, а не как референс. - Тишины. «Generated videos include an audio track by default» — звук будет всегда. Если он в проекте лишний, его придётся снимать в монтаже.
- Гарантии на вторую и третью картинку. Посредник пишет, что поддерживается только одно изображение, при этом принимает до семи файлов. Форма RED AI тоже принимает до семи. Если вторая и третья картинка ни на что не влияют — причина здесь; ставьте один кадр.
И ещё одно ограничение, уже не про режимы. Отдельного руководства по промптам
для Imagine у xAI нет: на страницах раздела только примеры в одну-две строки,
вроде Generate a slow and serene time-lapse (проверено по карте сайта
docs.x.ai 17.08.2026; x.ai/news и x.ai/legal через curl отдают 403).
Так что длинные структурированные промпты вроде наших шаблонов — не пересказ
официального гайда, а практика площадок. Заодно это объясняет разброс советов
в сети.
Кстати, пример реплики у посредника показывает, что речь пишется прямо в текст:
she says happily: "thanks! Back to work" [11].
Отдельного поля под диалог нет.
Что открыть в студии
Шаблоны под Grok лежат в каталоге промптов — там есть фильтр по инструменту, шесть записей найдутся сразу. Кнопка открытия в студии подставляет промпт и закреплённые параметры, дальше остаётся загрузить свой кадр. Описание режимов и форма — на странице Grok Imagine; переключатель поколения там же, и он меняет и минимальную длительность, и ставку за секунду.
Если задача — постановочная сцена по тексту, а не оживший кадр, посмотрите
Kling. У него в режиме из фото соотношение сторон, наоборот, просто
не действует: «Aspect ratio is inferred from the start image. The aspect_ratio
field in the UI is ignored by the model» [12].
Плюс покадровая раскадровка, которой у Grok нет вовсе.
Как собран материал
Сверено 17 августа 2026 года: страницы docs.x.ai про генерацию видео,
image-to-video, reference-to-video, редактирование, продолжение и цены; карточка
модели и документация площадки-посредника kie.ai; каталог шаблонов RED AI
(140 записей, из них шесть под Grok); два рейтинга Artificial Analysis Video
Arena. Правила использования Grok не проверялись — x.ai/legal закрыт.
Материал готовился с участием ИИ, факты и числа сверены по первоисточникам вручную.
Источники
- xAI, docs.x.ai — страница о генерации видео (text-to-video).
- xAI, docs.x.ai — страница о режиме image-to-video.
- Artificial Analysis, Video Arena — рейтинг text-to-video.
- Artificial Analysis, Video Arena — рейтинг image-to-video.
- Google Cloud, Vertex AI — руководство по промптам для генерации видео.
- xAI, docs.x.ai — страница с ценами (pricing).
- Kie.ai — страница модели Grok Imagine.
- xAI, docs.x.ai — страница о режиме reference-to-video.
- xAI, docs.x.ai — страница о функции extension (продолжение ролика).
- xAI, docs.x.ai — страница о редактировании видео (editing).
- Kie.ai, документация — раздел Grok Imagine, image-to-video.
- fal.ai — карточка модели Kling Video v3 Pro (image-to-video).