Разбираемся, что в промпте Kling реально меняет результат дубля, а что нужно просто закладывать в бюджет кредитов заранее
Две цифры не бьются друг с другом, и это стоит знать до того, как вы напишете следующий промпт. В контролируемом недельном тесте Vuela.ai на 15-секундный аэросъёмочный кадр три дубля из пяти вышли пригодны для клиентской подачи без ретуши — то есть около 60% сразу в дело (Vuela.ai). У пользователей на vc.ru в пиковые часы — 30-40% неудачных генераций (vc.ru). Методологии разные: один тест — контролируемый эксперимент на одном типе кадра, другой — неформальные жалобы в пиковую нагрузку, поэтому сравнивать цифры напрямую нельзя. Но выводы совпадают: даже у людей, которые понимают формулу промпта, часть дублей улетает в мусорку не из-за ошибки в тексте запроса.
Это меняет то, как стоит читать промпты для клинг, включая эту статью. Формула не гарантирует пригодный результат — она задаёт направление и отсекает часть случайных провалов. Дальше начинается зона, которую промпт не контролирует вообще.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Что формула реально делает
Официальная структура text-to-video промпта в Kling — пять полей: Subject (кто в кадре), Subject Movement (что делает), Scene (обстановка), затем Camera Language, Lighting и Atmosphere как уточняющий слой (Kling AI). Смысл в том, что без этих полей модель не «додумывает» правильно — она додумывает быстро и произвольно. Автор обзора Kling на vc.ru формулирует это жёстко: «Kling не телепат. Если вы не решили, что должно быть в кадре, модель решит за вас» — вплоть до смены лица или фона человека в недостаточно детализированной сцене.
Для image-to-video формула работает иначе, и это самая частая ошибка новичков. Если кадр уже загружен, промпт должен описывать только движение — не пересказывать то, что уже видно на изображении (официальный гайд Kling AI по промптам). Фраза «женщина в красном платье стоит у окна на закате, она поворачивается» для image-to-video избыточна: модель пытается согласовать текстовое описание сцены с уже заданной сценой на кадре и путается. Для text-to-video, наоборот, сцену нужно строить с нуля, потому что кроме текста у модели ничего нет.
Одно движение камеры — и точка завершения
Здесь начинается зона, где промпт управляет результатом предсказуемо. Одно чёткое движение камеры за дубль — tracking shot или slow zoom in — работает надёжнее, чем попытка описать сложную многошаговую хореографию в одном запросе: при двух движениях сразу модель путается (Veed.io). Автор практического гайда по камере в Kling, Хлоя Мёрфи, привязывает это к конкретной настройке: значения слайдера движения камеры стоит держать в диапазоне 1-3, а слайдер, близкий к 5, деформирует лицо персонажа при панорамировании — «если лицо персонажа плывёт при панораме влево, движение слишком быстрое» (гайд Хлои Мёрфи по камере). Это управляемая переменная: снизили интенсивность слайдера — снизили риск конкретного артефакта.
Вторая управляемая переменная — явная точка завершения действия. Известная проблема сообщества, «99% hang», — зависание прогресс-бара рендера, которое чаще всего возникает, когда промпт описывает движение, но не описывает, чем оно заканчивается; об этом же пишет Veed.io в том же гайде. Фраза вроде «then settles into position» или «coming to rest» закрывает действие явно, и модели не приходится домысливать, где остановить кадр.
Motion Control: описывать контекст, а не движение

Если движение переносится через референс-видео (Motion Control), логика промпта разворачивается на 180 градусов. Движение уже задано референсом — промпт должен описывать окружение и контекст, а не пересказывать то же движение словами; переописание движения — самая частая ошибка при использовании этой функции, по наблюдению fal.ai, коммерческого реселлера API Kling (гайд fal.ai по Motion Control). У функции есть и жёсткие технические границы: в режиме image orientation лимит 10 секунд, в video orientation — 30 секунд, а референс-видео длиннее 5 секунд, по данным Atlas Cloud, «размывает сигнал движения» (сравнение версий Atlas Cloud). В версии 3.0 доступно до 7 референсных изображений персонажа против одного в 2.6 — но это неофициальная сравнительная таблица стороннего реселлера, без подтверждения от самого Kuaishou.
Заявленный официальный масштаб продукта расходится с тем, что фиксирует сообщество. Пресс-релиз Kuaishou о запуске 3.0 обещает гибкую длительность видео до 15 секунд, изображение в разрешении до 4K и Multi-Shot Storyboard — до шести планов в одном клипе с автоматическим сохранением пространственной целостности между планами (пресс-релиз Kuaishou). Но «автоматическая целостность» между планами и Motion Control — разные вещи: по тем же данным Atlas Cloud, сообщество на r/generativeAI фиксирует «spaghetti limbs» при пересечении конечностей и «face drift» при переносе движения как самую частую проблему.
Сильнейшее возражение: промпт тут ни при чём
Можно возразить, что весь разговор про формулировку промпта — отвлечение от главного. Тайлер Смит, автор обзора Kling 3.0 на образовательной площадке Curious Refuge, ставит модели высокую оценку за кинематографичность движения камеры в image-to-video — 8.1 из 10, — но прямо указывает на границу: «Facial likeness often drifted and the lip-sync remained inconsistent» (обзор Тайлера Смита). Дрейф лица и лип-синк проявляются независимо от того, насколько тщательно вы описали камеру, свет и точку завершения движения. Это архитектурное ограничение, а не ошибка формулировки запроса — и статья, которая обещает читателю, что «правильный промпт» решает эту проблему, обманывает.
Ответ на это возражение не в поиске более точной формулировки для устойчивого лица — судя по независимым данным, такой формулировки нет. Ответ — в бюджетировании. Если consistency лица и рук — зона систематических сбоев, закладывайте 2-5 дублей на кадр с людьми в движении, особенно при Motion Control и многошаговых генерациях, и не тратите время на переписывание промпта в надежде «докрутить» устойчивость лица десятой попыткой формулировки. Промпт управляет тем, что он в принципе способен контролировать: композицией, движением камеры, светом, точкой завершения действия. Лицо и руки — не в этом списке.
Что ещё съедает дубли без вины промпта

Негативные промпты работают лучше, когда сфокусированы на конкретных дефектах — «no extra fingers, no deformed limbs» — а не на общих словах о качестве; рекомендуемая длина списка — 3-7 пунктов, иначе модель «путается» от перегруженного описания (гайд Filmora по негативным промптам). Похожая логика работает с длиной самого промпта: лимит API — 2500 символов, но короткий текст на 60-100 слов по формуле обычно даёт результат лучше, чем «стена» из прилагательных (гайд Atlas Cloud по формуле и лимитам). Для функции Start & End Frame добавляется отдельное требование: стартовый и финальный кадр должны совпадать по цветовой палитре и тону, а промпт — описывать весь переход от начала до конца целиком, иначе кадры выходят визуально смещёнными (обзор Start & End Frame).
Длительность и путаница версий в гайдах
Гибкая длительность в 15 секунд, которую обещает пресс-релиз Kuaishou, не означает, что в неё стоит впихивать максимум событий: если промпт перегружен действиями, модель, по тем же наблюдениям vc.ru, начинает упрощать сцену, пропускать часть действий или собирать «красивую, но неправильную» картинку — то есть длинный хронометраж не отменяет правило одного управляемого движения за дубль. Второй практический риск не связан с содержанием промпта вообще: значительная часть открытых гайдов по Kling — от слайдера камеры до лимитов Motion Control — не указывает, к какой версии модели относится совет, а рекомендации для 2.6 и 3.0 местами расходятся (например, число референсных изображений персонажа выросло с одного до семи). Перед тем как довериться конкретной цифре из стороннего гайда, стоит проверить дату публикации и версию модели, которую тестировал автор, — иначе есть риск настраивать слайдер под уже неактуальный лимит.
Шаблон, который стоит держать под рукой
Промпты для клинг делятся на три рабочих сценария, и шаблон ниже отражает разницу между ними.
Text-to-video: Subject: [кто/что в кадре, детально] Subject Movement: [одно конкретное действие] + endpoint ("then settles into position") Scene: [место, время суток, детали окружения] Camera Language: [одно движение камеры — pan / tilt / zoom / track / roll / pedestal] Lighting & Atmosphere: [источник света, настроение] Negative prompt: [3-7 конкретных дефектов, не общие слова]
Image-to-video (референсный кадр уже загружен): Movement only: [одно действие субъекта] + endpoint Camera: [одно движение, слайдер интенсивности 1-3] Negative prompt: [3-7 пунктов]
Motion Control (референс-видео): Context/Environment: [место, объекты, освещение — без описания движения] Duration check: референс ≤ 5 сек, режим image orientation ≤ 10 сек / video orientation ≤ 30 сек
Если промпт для конкретного кадра готов, а дубль всё равно бракован из-за лица, это не повод переписывать текст ещё раз — это повод перегенерировать.
Раз часть дублей уходит в мусорку независимо от качества промпта, разумно перед крупной закупкой кредитов сравнить, как та же сцена ведёт себя в другой видеомодели: provod.ai даёт доступ к каталогу видеомоделей через единый API, так что такое сравнение не требует регистрации в отдельных личных кабинетах под каждый сервис.
Если промпты для одного проекта пишут несколько человек в команде, отследить, сколько кредитов реально ушло на непригодные дубли, а сколько — на рабочие, помогает не переписка в чате, а корпоративное пространство provod.ai с одним общим балансом в рублях и контролем расходов на уровне организации, а не личного кабинета каждого автора.
provod.ai — модели для IDE, SDK и внутренних инструментов
Не заставляйте разработчиков менять рабочую среду: OpenAI-совместимые IDE, библиотеки и приложения подключаются к общему endpoint, а команда продолжает работать привычными командами и SDK.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Расширение выбора моделей не увеличивает тариф: стоимость запросов совпадает с официальной 1:1, без наценки со стороны provod.ai.
Подключите AI к рабочему стеку: форма регистрации · цены на модели · защита данных по 152-ФЗ · инструкция по миграции
Источники
- Vuela.ai — тест дублей на Kling 3
- vc.ru — обзор Kling AI в России
- Kling AI — официальный гайд по text-to-video
- Veed.io — гид по промптам и точке завершения движения
- GLBGPT — гид Хлои Мёрфи по движению камеры
- Fal.ai — гид по Motion Control для Kling 2.6
- Atlas Cloud — сравнение Motion Control 2.6 и 3.0
- GlobeNewswire — пресс-релиз Kuaishou о запуске Kling 3.0
- Curious Refuge — обзор Kling 3.0 от Тайлера Смита
- Wondershare Filmora — гид по негативным промптам Kling
- Atlas Cloud — формула промпта и лимиты символов
- Imagine.art — обзор функции Start & End Frame
