Блог
Статья30 августа 2026 г.

Промпты для Kling: синтаксис и типичные ошибки

Разбор синтаксиса Kling — почему в режиме из фото игнорируется соотношение сторон, как работают elements и multi_prompt, где модель ломается предсказуемо.

Промпты для Kling: синтаксис и типичные ошибки

Промпты для Kling отличаются от промптов для любой другой видеомодели тремя вещами: соотношение сторон в режиме «из фото» задаётся не параметром, а самой картинкой; реплики пишутся прямо в текст запроса; смена плана делается отдельным полем, а не словами «затем камера переходит». Ниже — разбор каждого пункта и список мест, где брак предсказуем заранее.

Это блог RED AI, сервиса доступа к нейросетям за рубли. Собственных прогонов в тексте нет: разобрано то, что написано в документации площадок и что видно в промптах готовых шаблонов каталога. Все страницы открыты 15 августа 2026 года, номер источника стоит рядом с каждым параметром.

Одна оговорка про источники. Официальный портал разработчика Kling (app.klingai.com) отдаёт пустую оболочку без текста — прочитать его инструментом, который не исполняет JavaScript, нельзя. Поэтому спецификация ниже — по карточкам модели на fal.ai, где параметры описаны построчно.

Параметры, которых нет у соседей

Схема запроса Kling 3.0 Pro в карточке image-to-video на fal.ai [1] разложена по полям. Часть из них меняет то, как пишется сам текст.

Поле Значение по умолчанию Что это меняет в промпте
duration "5", диапазон 3–15 с На 3 секундах развитие сцены не помещается — только одно действие
generate_audio true Звук описывается словами; выключать надо явно
negative_prompt "blur, distort, and low quality" Отдельное поле под запреты, и оно уже непустое
cfg_scale 0.5 Сила следования тексту, описана как «prompt adherence strength»
multi_prompt Раскадровка: у каждой сцены свой текст и своя длительность
shot_type "customize" Обязателен, если используется multi_prompt
elements Персонаж или предмет, адресуемый в тексте как @Element1

Два дефолта здесь стоят отдельного внимания. generate_audio: true означает, что модель по умолчанию сочиняет звук — и если в промпте про звук ничего нет, придумает его сама. А negative_prompt заполнен заранее строкой blur, distort, and low quality: своё значение встаёт на её место, а не добавляется к ней, — поэтому запреты разумнее дописывать к готовой строке.

Соотношение сторон в режиме «из фото» не задаётся параметром

Это самая дорогая ошибка в работе с Kling, потому что она не выглядит ошибкой. В разделе Known Limitations той же карточки написано дословно: «Aspect ratio is inferred from the start image. The aspect_ratio field in the UI is ignored by the model» [1]. Поле в форме есть, вы его переключаете — модель на него не смотрит.

Отсюда три практических следствия.

Первое: слова о формате в тексте промпта бесполезны. «Vertical 9:16 shot», «wide cinematic frame», «квадратный кадр» — всё это модель, может, и прочитает как указание на композицию, но пропорции возьмёт из загруженного кадра. Формат решается кадрированием исходника, а не абзацем в запросе.

Второе: кадрировать нужно до загрузки. Горизонтальное фото, отправленное в Kling с намерением получить вертикальное видео для Reels, вернёт горизонтальное видео. Обрезать после генерации — значит выбросить края кадра, за которые уже заплачено.

Третье: в режиме «из текста» ограничение не действует — там соотношение сторон работает как обычный параметр. Один и тот же интерфейс ведёт себя по-разному в зависимости от того, загружена картинка или нет.

В студии RED AI это сделано так, что ошибиться сложнее: на странице Kling селектор соотношения сторон исчезает, как только загружен первый кадр. Не подсказка мелким шрифтом, а отсутствие ручки, которая всё равно ни на что не влияет.

Kling в режиме «из фото» продолжает исходную сцену, а не заменяет её

Стартовый кадр для Kling — это буквально первый кадр видео. Не «референс стиля» и не «пример композиции». Модель начинает с него и дальше движется от него, поэтому запрос «сделай, чтобы человек шёл по парку» из фотографии во дворе даёт человека, идущего по двору.

Это хорошо видно в промптах готовых шаблонов каталога. У шаблона «Прогулка в парке» текст начинается не с описания парка, а с прямой команды сменить сцену, и содержит отдельный блок запретов:

Completely transform the scene: the SAME family from the reference walks together mid-stride through a green city park. ENVIRONMENT (critical): tree-lined park path, grass, daylight foliage — NOT a panel-building courtyard, NOT playground swings, NOT asphalt dvor, NOT parked cars.

Перечисленные через NOT места — не абстрактные страшилки. Это ровно то, что оказывается на исходных фотографиях пользователей и что модель охотно оставляет в кадре.

Тот же приём в шаблоне «Проход по столовой»: «NOT a gym locker room, NOT metal lockers, NOT modern sportswear hallway». По рабочим записям каталога первая версия этого шаблона возвращала именно раздевалку с исходного фото — блок запретов появился после этого.

Отсюда структура промпта, которая для Kling работает лучше линейного описания:

  1. Команда на заменуCompletely transform the scene, если сцена должна смениться.
  2. Что сохранить — лицо, количество людей, возраст, очки: Keep every person identity stable — same count, faces, ages; no morphing.
  3. Новая обстановка — конкретными предметами, а не настроением.
  4. Список запретов — то, что придёт из исходника, если не запретить.
  5. Камера и темп — отдельным предложением в конце.

Пункт про идентичность есть во всех видеошаблонах каталога с людьми, и формулировка там одна и та же: no morphing, no warped hands. Руки и лицо на длинной проходке — первое, что уплывает.

Что Kling понимает в движении камеры

Демонстрационные промпты, которые fal.ai ставит в саму форму запроса, — это, по сути, подсказка от площадки, каким языком с моделью говорить. В карточке Pro стоит «Slow cinematic push-in through the empty ancient temple», в карточке Standard [2] — «Camera slowly orbits around the vase. Soft light shifts across the ceramic surface».

Работает конкретная операторская лексика: push-in, dolly back, orbit, steadicam float, shallow depth of field, parallax. Именно она стоит в шаблонах: у «Кинематографичной прогулки» — «smooth cinematic dolly back with a slight push-in at the end, shallow depth of field, gentle steadicam float».

А вот монтаж словами описывать не нужно. Фраза «затем камера переключается на крупный план» просит модель угадать момент склейки внутри одного сплошного текста.

У Kling 3.0 для этого есть отдельный механизм. multi_prompt делит клип на планы, у каждого свой текст и своя длительность, а поле shot_type при этом обязано быть заполнено [1]. Смена плана здесь — параметр запроса, а не предложение в промпте.

Обратная сторона: раз модель умеет резать, ей приходится явно запрещать резать. Во всех видеошаблонах каталога, где нужен один непрерывный кадр, стоит Continuous shot, no cuts. Без этой строки на длинном клипе склейка может появиться сама.

elements: не стартовый кадр и не стиль

elements — третий вход помимо текста и стартового кадра, и путать его с загрузкой первого кадра не стоит. Элемент состоит из фронтального изображения (frontal_image_url) и необязательных дополнительных ракурсов (reference_image_urls) либо из видео; в промпте на него ссылаются как @Element1, @Element2 [1].

Разница по смыслу простая. Стартовый кадр отвечает на вопрос «с чего начинается видео» и заодно диктует пропорции. Элемент отвечает на вопрос «кто в кадре» — его можно вписать в сцену, которой на исходной фотографии не было, и обратиться к нему по имени внутри текста: «@Element1 walks slowly into frame from the left» — это демонстрационный промпт с той же страницы.

Одно ограничение прописано прямо: «Voice binding is only supported for video elements, not image elements. Attempting voice binding with an image element returns an error». Привязать голос к персонажу, собранному из фотографий, нельзя — только к элементу-видео.

И встречное замечание про связку «первый кадр — последний кадр»: там адресация в тексте не работает вовсе. Роль изображения задаёт слот загрузки, а не упоминание в промпте, и писать «на первой картинке — герой, на второй — финальная поза» бессмысленно. Это зафиксировано и в описании инструмента в RED AI: для Kling 3.0 адресация референсов помечена как неподдерживаемая.

Реплики пишутся внутри промпта — и не по-русски

У Kling звук синтезируется в том же проходе, что и видео, а речь задаётся прямо в тексте запроса. Демонстрационный промпт в карточке Kling 2.6 Pro [3] выглядит так: A king walks slowly and says "My people, here I am! I am here to save you all". Реплика в кавычках внутри обычного описания действия — это и есть синтаксис.

Там же две детали, которых нет у соседних моделей. Первая: аббревиатуры и имена собственные рекомендуется писать заглавными — от этого зависит произношение. Вторая, более важная для русскоязычного пользователя: «Audio language support: Chinese and English natively. Other languages are auto-translated to English». Русская реплика не озвучится по-русски — её переведут на английский.

Это меняет постановку задачи. Если нужен ролик с русской озвучкой, звук у Kling лучше выключить и наложить отдельно; если реплика нужна модели для синхронизации губ — писать её сразу по-английски, а не надеяться на перевод.

Ограничения: где брак предсказуем

  • Пропорции в режиме «из фото» не контролируются промптом. Единственная ручка — кадрирование исходника.
  • Русская речь в кадре. Нативно поддержаны китайский и английский, остальное переводится на английский [3].
  • Исходная обстановка протекает в результат. Без явной команды на замену и списка запретов сцена остаётся прежней.
  • Руки и лицо на длинной проходке. Формулировки no morphing, no warped hands стоят в шаблонах каталога не для красоты.
  • Голос нельзя привязать к персонажу из фотографий — только к элементу-видео, попытка возвращает ошибку.
  • Цена растёт линейно по секундам, а не по кадрам. На fal.ai Kling 3.0 стоит $0,112 за секунду без звука, $0,168 со звуком и $0,196 при управлении голосом; пятнадцатисекундный клип со звуком — $2,52 [1]. Это цены площадки-посредника, а не вендора: собственный прайс Kling закрыт для чтения. Практический вывод один — неудачные 15 секунд стоят втрое дороже неудачных пяти, и подбирать формулировки дешевле на коротких клипах.

Ещё одна вещь, которую полезно знать до выбора режима. В слепом голосовании Artificial Analysis [4] Kling 3.0 Pro стоит 8-м в таблице text-to-video и 12-м [5] — в image-to-video.

Это не «просадка на четыре позиции». Таблицы считаются по разным наборам сравнений, а доверительный интервал по строкам — от ±6 до ±9 пунктов Elo, так что соседние места между собой не различаются. Но два независимых замера ставят Kling в тексте выше, чем в оживлении фотографии.

Что с этим делать в RED AI

Обе версии Kling — 2.6 и 3.0 — доступны в студии на странице Kling: оплата в рублях, без зарубежной карты, режим выбирается наличием загруженного кадра, а не отдельным переключателем. Разобранные выше промпты лежат целиком в каталоге готовых шаблонов — их можно открыть, посмотреть текст и отредактировать под себя, а не переписывать с этой страницы вручную.

Вывод под конкретный сценарий. Нужен вертикальный ролик из готового фото — сначала обрежьте фото под 9:16, потом пишите промпт, и начните текст с команды сменить обстановку со списком того, чего в кадре быть не должно.

Нужна смена плана — не описывайте её словами, а разбейте запрос на сцены через multi_prompt. Нужна русская озвучка — выключите звук и наложите его отдельно.

Источники

  1. fal.ai — карточка модели Kling 3.0 Pro (image-to-video).
  2. fal.ai — карточка модели Kling 3.0 Standard (image-to-video).
  3. fal.ai — карточка модели Kling 2.6 Pro (image-to-video).
  4. Artificial Analysis, Video Arena — рейтинг text-to-video.
  5. Artificial Analysis, Video Arena — рейтинг image-to-video.