Блог
Статья30 августа 2026 г.

Промпты для Grok Imagine: разбор шести шаблонов

У Grok текстовый промпт сначала становится кадром и только потом движением. Разбор шаблонов каталога, посекундной цены и мест, где запрос меняется молча.

Промпты для Grok Imagine: разбор шести шаблонов

Промпты для Grok Imagine пишутся в два слоя: сначала кадр, потом движение внутри кадра. Так устроена сама модель — запрос из текста у неё проходит через картинку, и оживает уже она. Дальше — шесть живых шаблонов каталога RED AI, разобранных на повторяющиеся блоки, арифметика посекундной цены и три места, где Grok меняет запрос молча.

Это блог RED AI, сервиса доступа к нейросетям за рубли. Своих прогонов Grok для этой статьи не было: разобрано то, что написано в документации xAI, у площадки KIE (через неё запрос уходит к модели) и в шести шаблонах нашего же каталога. Единственное число из сервиса — время ожидания, и оно снято с двух заказов, о чём сказано на месте.

Текст у Grok сначала становится картинкой

Формулировка из документации xAI, дословно: «text-to-video uses text-to-image then image-to-video under the hood: the model generates a first frame from your prompt, then animates it» — модель рисует первый кадр по вашему тексту, а затем анимирует его [1]. Промежуточная картинка не возвращается, запрос остаётся один.

Отсюда практика. Половина промпта должна описывать неподвижный кадр: свет, фон, план, объектив. Вторая половина — что в этом кадре меняется. Напишете только движение — модель придумает кадр за вас и честно облетит камерой то, что придумала.

В режиме из фотографии первый кадр берётся из файла, и промпт там вообще необязателен [2]. То есть половина работы уже сделана — остаётся описать движение.

Косвенно это видно и в слепых рейтингах. В Video Arena от Artificial Analysis классический grok-imagine-video стоит 18-м из 28 в текст-в-видео и 11-м из 29 в фото-в-видео, а grok-imagine-video-1.5 — 4-й из 29 в фото-в-видео и в текстовом рейтинге не представлен вовсе (снято 17.08.2026: рейтинг text-to-video [3], рейтинг image-to-video [4]).

Оговорки обязательны. Доверительный интервал ±7–8 пунктов, места площадка сама пишет диапазонами: 4–6 и 11–13. У версии 1.5 всего 5423 голоса против 13 558 у классической. Elo двух таблиц между собой не сопоставимы — сравнивать можно только порядок внутри каждой.

Шесть шаблонов каталога: что в них повторяется

В каталоге промптов RED AI под Grok лежит шесть записей — пять на классической модели и одна на Video 1.5. Все шесть про оживление готового кадра, ни одной текстовой сцены с нуля. Я разобрал их промпты на блоки и посчитал, сколько раз каждый блок встречается.

Блок Сколько шаблонов из шести Как выглядит в промпте
Удержание личности 6 Keep the exact same face and identity stable — no morphing
Камера почти неподвижна 6 Camera LOCKED — no pan, no zoom, no dolly
Ведущее движение названо первой фразой 6 Primary motion: shared soft smile growing slightly, gentle blinks
Запрет склеек 4 smooth continuous motion, no sudden cuts
Звук одной фразой 2 Soft projector whir
Правовой запрет внутри промпта 1 do NOT copy any celebrity choreography or artist likeness

Скелет читается сразу: одно движение, зафиксированная камера, лицо под замком. Ни один из шести промптов не просит героя пройти по комнате и обернуться. Автор шаблонов явно уже посмотрел, что бывает с лицом на таком движении.

Отдельно про звук. Он у Grok в ролике будет всегда, и описывается одной фразой, а не блоком: в форме под это заведена единственная подсказка Sound: — в отличие от Veo, где подсказок под звук три (шумы, фон, реплика). Шаблоны каталога с этим согласны: Soft ambient room tone, Soft projector whir — по четыре слова, и ни в одном нет расписанной звуковой дорожки.

Три шаблона подробно

«Плёночное мерцание»: движется не человек, а плёнка

Самый ходовой из шести: 7 запусков и 2 отметки «нравится» против 2–3 запусков у остальных (данные каталога на 17.08.2026). Промпт устроен против интуиции. Субъект прямо запрещено двигать: Subject stays almost completely still — no wind, no hair blow, no clothing flutter. Анимируется оптика — пульсирующая экспозиция, ползущее зерно 35 мм, царапины, пылинки в луче.

Приём обходит главную беду оживления портретов. Двигаешь лицо — лицо плывёт. Двигаешь свет вокруг лица — плывёт свет, а он и так дрожит. В шаблоне закреплены режим normal, 8 секунд и 720p, звук задан одной фразой: Soft projector whir.

«Живой семейный кадр»: число людей проговорено

В шаблоне на семейное фото к удержанию личности добавлены same count и no face swap — счёт людей в кадре назван прямо. Дальше запрет на масштаб движения: no chaos, no windstorm, no running. Камера жёстко закреплена словом LOCKED, звук — Soft ambient room tone, из параметров зафиксированы 6 секунд и 720p.

Групповой кадр — худший случай для оживления: людей несколько, лицо мелкое, а модель охотно превращает четвёртого справа в пятого. Отсюда и счёт.

«Возьми телефон (вайб)»: запрет как часть промпта

Единственный шаблон, где в текст вписана правовая рамка: Original generic motion only — do NOT copy any celebrity choreography or artist likeness. Рядом no warped hands — руки с телефоном ломаются чаще всего остального. Параметры не закреплены ни одного: шаблон отдаёт разрешение, длительность и режим настройкам формы.

Отрицания здесь в ходу — и это не общее правило

Поля запретов у Grok нет: ни в документации xAI, ни в схеме площадки-посредника нет ничего похожего на negative_prompt. Запреты идут внутрь текста, и все шесть шаблонов каталога написаны именно так — no morphing, no pan, no cuts, do NOT copy.

Для сравнения: Google в руководстве по видеомоделям отводит запретам отдельное поле и прямо не советует формулировать их словами — «Not recommended: using instructive language or words such as “no” or “don’t”», вместо «no walls» предлагается перечислить wall, frame [5]. У Grok такого поля нет, и деваться отрицаниям некуда. Доказательства, что здесь они срабатывают надёжнее, у меня нет — есть практика каталога: шесть промптов из шести держатся на них.

Секунды здесь считаются деньгами

Тарификация Grok посекундная — и у вендора, и у нас. У xAI по прайсу классическая модель стоит $0,05 за секунду в 480p и $0,07 в 720p, версия 1.5 — $0,08, $0,14 и $0,25 за секунду в 480p, 720p и 1080p соответственно [6].

В студии RED AI ставка за секунду тоже растёт от разрешения: на классике 3 и 4 ₽AI за секунду в 480p и 720p, на Video 1.5 — 5 и 6 ₽AI. Ролик 6 секунд в 720p на классике выходит в 24 ₽AI, восемь секунд на 1.5 — в 48 ₽AI. Цены сверены 17 августа 2026, точная сумма всегда показана у кнопки запуска до списания.

Длительность у двух поколений разная, и это влияет на промпт сильнее цены. В документации xAI диапазон один для всего — 1–15 секунд. В форме RED AI ползунок на Video 1.5 начинается с одной секунды, а на классике — с шести: короче посредник запрос не принимает. То есть под классику промпт всегда пишется минимум на шесть секунд экранного времени, и одно моргание их не заполнит.

Пол цены на Video 1.5 — 15 ₽AI, и он даёт неочевидный эффект: ролик в одну секунду 480p стоит столько же, сколько в три. Секунду просить незачем — просите три. А пятнадцать секунд в 720p обойдутся в 90 ₽AI, и промпт под такую длину должен нести три-четыре события, иначе вы платите за паузу.

Время тоже растёт от длины и разрешения — это записано и в документации xAI («longer videos take more time», «higher resolutions increase processing time»), и в наших настройках ожидания: для Video 1.5 выставлено 240 секунд. Число снято с двух выполненных заказов, разброс между ними 58 и 416 секунд. Выборка крошечная, порядок — минуты.

Три места, где запрос меняется молча

Режим spicy при своей картинке становится normal. Прямая цитата площадки: «When generating videos using external image inputs, Spicy mode is not supported and will automatically switch to Normal» [7]. Переключатель в форме останется в выбранном положении, а поедет другой режим.

Соотношение сторон при своём кадре растягивает картинку. xAI пишет, что в режиме из фото соотношение по умолчанию берётся из файла, а заданный параметр «will override this and stretch the image to the desired aspect ratio» [1]. Посредник в описании того же поля утверждает другое: «This parameter is invalid if it is a single image».

Что верно, из двух документов не следует, и это раздражает: цена ошибки — весь ролик. Безопасное поведение одно — ставить соотношение исходника. На Video 1.5 для этого есть значение auto, и его лучше не трогать; на классике такого варианта нет, выбирайте руками то, что у файла.

Синтаксис ссылки на картинку зависит от того, откуда зовут модель. У xAI в режиме с референсами картинки адресуются как <IMAGE_1>, <IMAGE_2> [8], у посредника — как @image1 с пробелом после, а подсказка в нашей форме вставляет Image 1. Практический вывод скучнее спора: если кадр один и он загружен, ссылаться на него в тексте не нужно вообще — он и есть первый кадр.

Чего у Grok в RED AI нет

  • Изображений. У xAI в семействе Imagine есть и генерация картинок (grok-imagine-image-2.0, $0,04 за изображение), но в RED AI из Grok подключено только видео. Промпты под картинки этой статье не пригодятся.
  • Продолжения и правки готового ролика. У вендора есть extend (вход 2–15 секунд, добавка 2–10) и редактирование видео с входом до 8,7 секунды [9] [10]. В нашей форме этих режимов нет.
  • 1080p. У xAI версия 1.5 его поддерживает, в форме RED AI выбор из 480p и 720p.
  • Референсов и голосов. Режим reference-to-video принимает до семи картинок и до трёх готовых голосов по voice_id, обращение к ним — <AUDIO_0>. Он не подключён; загруженный кадр у нас работает как первый кадр, а не как референс.
  • Тишины. «Generated videos include an audio track by default» — звук будет всегда. Если он в проекте лишний, его придётся снимать в монтаже.
  • Гарантии на вторую и третью картинку. Посредник пишет, что поддерживается только одно изображение, при этом принимает до семи файлов. Форма RED AI тоже принимает до семи. Если вторая и третья картинка ни на что не влияют — причина здесь; ставьте один кадр.

И ещё одно ограничение, уже не про режимы. Отдельного руководства по промптам для Imagine у xAI нет: на страницах раздела только примеры в одну-две строки, вроде Generate a slow and serene time-lapse (проверено по карте сайта docs.x.ai 17.08.2026; x.ai/news и x.ai/legal через curl отдают 403). Так что длинные структурированные промпты вроде наших шаблонов — не пересказ официального гайда, а практика площадок. Заодно это объясняет разброс советов в сети.

Кстати, пример реплики у посредника показывает, что речь пишется прямо в текст: she says happily: "thanks! Back to work" [11]. Отдельного поля под диалог нет.

Что открыть в студии

Шаблоны под Grok лежат в каталоге промптов — там есть фильтр по инструменту, шесть записей найдутся сразу. Кнопка открытия в студии подставляет промпт и закреплённые параметры, дальше остаётся загрузить свой кадр. Описание режимов и форма — на странице Grok Imagine; переключатель поколения там же, и он меняет и минимальную длительность, и ставку за секунду.

Если задача — постановочная сцена по тексту, а не оживший кадр, посмотрите Kling. У него в режиме из фото соотношение сторон, наоборот, просто не действует: «Aspect ratio is inferred from the start image. The aspect_ratio field in the UI is ignored by the model» [12]. Плюс покадровая раскадровка, которой у Grok нет вовсе.

Как собран материал

Сверено 17 августа 2026 года: страницы docs.x.ai про генерацию видео, image-to-video, reference-to-video, редактирование, продолжение и цены; карточка модели и документация площадки-посредника kie.ai; каталог шаблонов RED AI (140 записей, из них шесть под Grok); два рейтинга Artificial Analysis Video Arena. Правила использования Grok не проверялись — x.ai/legal закрыт. Материал готовился с участием ИИ, факты и числа сверены по первоисточникам вручную.

Источники

  1. xAI, docs.x.ai — страница о генерации видео (text-to-video).
  2. xAI, docs.x.ai — страница о режиме image-to-video.
  3. Artificial Analysis, Video Arena — рейтинг text-to-video.
  4. Artificial Analysis, Video Arena — рейтинг image-to-video.
  5. Google Cloud, Vertex AI — руководство по промптам для генерации видео.
  6. xAI, docs.x.ai — страница с ценами (pricing).
  7. Kie.ai — страница модели Grok Imagine.
  8. xAI, docs.x.ai — страница о режиме reference-to-video.
  9. xAI, docs.x.ai — страница о функции extension (продолжение ролика).
  10. xAI, docs.x.ai — страница о редактировании видео (editing).
  11. Kie.ai, документация — раздел Grok Imagine, image-to-video.
  12. fal.ai — карточка модели Kling Video v3 Pro (image-to-video).