В начале апреля 2026 года независимый разработчик Julius Brussee выложил на GitHub плагин caveman: он заставляет Claude Code отвечать как пещерный человек - коротко, без артиклей, вежливых вступлений и хеджирования. К июлю о нём написали 404 Media и 3DNews, по данным 404 Media его используют разработчики из Nvidia, GitHub и OpenAI, а тест издания зафиксировал экономию 5800 токенов (65%) за одну сессию. Legrand во внутренней памятке прямо рекомендует скилл сотрудникам.
Причина ажиотажа - деньги. По официальному прайсу Anthropic на июль 2026 output-токены Claude стоят в пять раз дороже input, а «болтливость» модели - та часть счёта, которую можно ужать без потери кода. Первичный бенчмарк обещает в среднем −65% output-токенов.
Экономить токены - полдела. Вторая - не переплачивать за каждый: агрегатор provod.ai (российский OpenRouter) отдаёт те же Claude и GPT из России по ценам официальных провайдеров, в рублях и без VPN. Дальше - без мемной шелухи: сколько «пещерный режим» экономит на самом деле, где он вредит и что доводит суммарную экономию до честного «вдвое».
Платите в рублях за Claude API без наценки на токены через provod.ai
Что такое caveman claude и откуда взялся «режим пещерного человека»?
Коротко: бесплатный open-source скилл (лицензия MIT), который переключает модель на телеграфный стиль - из ответов вычищаются артикли, filler-слова и оговорки. Работает с Claude Code, Codex, Gemini CLI, Cursor, GitHub Copilot и ещё более чем 30 агентами.
Механика простая: скилл подмешивает в сессию инструкцию отвечать фрагментами - «bug in render loop. state not memoized. fix: useMemo». Код и имена функций остаются нетронутыми, сжимается только проза вокруг. Автор в README формулирует так: «caveman no make brain smaller, caveman make mouth smaller». Мне нравится эта честность: главным выигрышем он называет читаемость, а экономию - бонусом.
Запрос «caveman claude» (и зеркальный «claude caveman») дорос до устойчивого термина - люди ищут именно режим, а не пещерную эстетику. Директор по инжинирингу OpenAI Shayne Sweeney лично внёс в репозиторий поддержку Codex, упоминается использование в агентстве DEPT.
Сколько токенов реально экономит caveman?
Коротко: по первичному бенчмарку - в среднем 65% output-токенов, диапазон 22-87%. По независимому недельному тесту - 48% output и 15-25% всего счёта на coding-сессиях. Рекламные «75%» к деньгам напрямую не привязывай.
Замеры из репозитория (реальные вызовы Claude API, 10 задач, проверено 19.07.2026):
| Задача | Обычный ответ, токенов | caveman, токенов | Экономия |
|---|---|---|---|
| Объяснить баг ре-рендера React | 1180 | 159 | −87% |
| Настроить пул соединений PostgreSQL | 2347 | 380 | −84% |
| Рефакторинг callback → async/await | 387 | 301 | −22% |
| Среднее по выборке | 1214 | 294 | примерно на три четверти |
Источник: бенчмарк JuliusBrussee/caveman, GitHub.
Две оговорки. Первая: caveman режет только output, thinking/reasoning-токены не затрагивает вообще - в «рассуждающих» сценариях он почти ничего не даст. Вторая: output - не весь счёт. Независимый недельный тест (блог Pasquale Pillitteri, 4 июля 2026) на реальных задачах - миграция Laravel 10→11, фоновые агенты, ревью - показал −48% output-токенов и −22% диалоговых ходов на задачу при том же уровне ошибок (2 на 47 задач, как у baseline). Автор оценивает реальную экономию на счёте в 15-25%.<!-- IMAGE\_SPEC\_START id: exhibit path: images/02-exhibit.png kind: exhibit kicker: График 1 headline: Три задачи из бенчмарка: caveman режет output-токены на 22-87% metric: output-токены на один ответ, normal vs caveman, 10 задач, Claude API, проверено 19.07.2026 visual: horizontal bar chart, три пары горизонтальных баров (normal - графит, caveman - cyan #80D2FF): «баг ре-рендера React» 1180 vs 159, «пул соединений PostgreSQL» 2347 vs 380, «рефакторинг callback → async/await» 387 vs 301; highlighted item - пара PostgreSQL с максимальной абсолютной экономией, blue-to-violet акцент #1B3AFF -> #7A2FFF только на ней; bottom-line строка: «среднее по выборке: 1214 → 294, −65%»; ровно одна читаемая publisher-надпись provod.ai в углу кадра data: 1180, 159, −87%; 2347, 380, −84%; 387, 301, −22%; 1214, 294, −65% accent: пара баров PostgreSQL source: GitHub JuliusBrussee/caveman, первичный бенчмарк репозитория, проверено 19.07.2026 negative: выдуманные задачи и числа, 3D-эффекты, rainbow neon, внешние логотипы, watermarks, мелкий нечитаемый текст, эмодзи IMAGE\_SPEC\_END -->

Почему краткость работает - и когда она вредит?
Коротко: многословие у больших моделей само порождает ошибки, это измерено. Но где ответ нужно собирать из контекста, принудительная краткость добавляет промахов - поэтому у скилла есть предохранитель, а у тебя должны быть сценарии, где он выключен.
Статья на arXiv «Brevity Constraints Reverse Performance Hierarchies in Language Models» (11 марта 2026) прогнала 31 модель (0.5B-405B) на 1485 задачах: принуждение к краткости улучшило точность больших моделей на 26.3 процентных пункта там, где многословие вело к ошибкам (overelaboration), и сократило отставание от лидеров на 67%.
Исключение важнее результата: на BoolQ, задаче чтения с пониманием, краткость увеличила ошибки (23.5 → 24.3 п.п.). Отсюда практика, которую подтверждает и автор недельного теста: не включай caveman при обучении новому, обсуждении архитектуры, отладке неизвестных багов и для результатов «на вынос». Discovery interview с заказчиком - тоже мимо: там паузы и полные формулировки несут смысл, а «пещерные» обрубки читаются как хамство.
Второй предохранитель встроен в скилл: правило auto-clarity отключает сжатие для предупреждений о безопасности, подтверждений необратимых действий и многошаговых последовательностей, а код, команды, URL и строки ошибок не изменяются никогда. «delete table prod. confirm? yes» ты не получишь - такие места останутся развёрнутыми.
Как установить и настроить caveman за пять минут?
Коротко: две команды в Claude Code или один one-liner для всех поддерживаемых агентов на машине (нужен Node 18+). Дальше - четыре уровня сжатия и вспомогательные команды экосистемы.
claude plugin marketplace add JuliusBrussee/caveman claude plugin install caveman@caveman
Альтернатива - one-liner (curl ... install.sh | bash), который сам определяет всех поддерживаемых агентов. В Claude Code, Codex и Gemini скилл активируется автоматически каждую сессию через hook-файлы.
Уровни переключаются на лету /caveman lite|full|ultra и держатся до конца сессии: lite убирает только filler, full - дефолтный «пещерный» стиль, ultra - телеграфный максимум, wenyan - стилизация под классический китайский 文言文, самая короткая (даже промпт «нарисуй котенка» сожмёт до двух слов). Выключение - фраза «normal mode» или «stop caveman».
Экосистема автора закрывает соседние задачи: /caveman-commit пишет conventional commit до 50 символов, /caveman-review оставляет однострочные PR-комментарии вида L42: bug: user null. Add guard., /caveman-stats - встроенный counter экономии со статуслайн-бейджем вида [CAVEMAN] 12.4k. Отдельно стоит /caveman-compress: переписывает «пещерным» стилем CLAUDE.md и memory-файлы - на 5 реальных файлах экономия input-токенов 46% (898 → 481), код и пути сохраняются побайтово. Есть и проект caveman-code - терминальный агент, по заявлению автора расходующий примерно вдвое меньше токенов, чем Codex; независимых замеров нет.
Какие ещё приёмы режут расход токенов вдвое и больше?
Коротко: caveman - один слой из пяти. Официальные механизмы Anthropic и гигиена контекста дают каждый свой крупный кусок, а общий эффект зависит от долей input, output и thinking в счёте конкретной задачи. По прайсу и докам Anthropic на июль 2026.
| Приём | Что режет | Эффект | Источник |
|---|---|---|---|
| caveman | output-токены | −65% в среднем | бенчмарк репозитория |
| /caveman-compress | input memory-файлов | −46% | замер автора на 5 файлах |
| prompt caching | повторный input | −90% (чтение 0.1× базовой цены) | Anthropic Docs |
| Batch API | input и output | −50% на асинхронных задачах | Anthropic Docs |
| Haiku 4.5 вместо Opus 4.8 | цена токена | −80% ($1/$5 против $5/$25 за MTok) | прайс на июль 2026 |
| Новый токенизатор (Opus 4.7+, Sonnet 5, Fable 5) | антиприём | +30% токенов на тот же текст | Anthropic Docs |
Prompt caching: запись в кэш стоит 1.25× базовой цены input на 5 минут (2× на час), чтение - 0.1×, то есть скидка 90% на повторный контекст; пятиминутный кэш окупается после одного чтения. Batch API режет пополам цену входа и выхода для задач, которым не нужен ответ немедленно. Скидки комбинируются.
Выбор модели - самый грубый рычаг: Opus 4.8/4.7/4.6/4.5 - $5/$25 за MTok (input/output), Sonnet 4.6/4.5 - $3/$15, Sonnet 5 - $2/$10 по вводной цене до 31.08.2026 (с 01.09.2026 - $3/$15), Haiku 4.5 - $1/$5. Из доков по расходу Claude Code сюда же: /clear между задачами, /compact с инструкциями, haiku для сабагентов, отключение неиспользуемых MCP-серверов, CLAUDE.md под 200 строк, снижение effort и MAX_THINKING_TOKENS, plan mode. Антиприём из таблицы тоже важен: новый токенизатор дробит тот же текст примерно на 30% больше токенов - переехал на свежую модель, и счёт растёт сам.
Все цифры выше - официальные тарифы в долларах. В рублях по тем же цифрам 1:1, без наценки, эти модели считает provod.ai: Sonnet для рутины и Opus для тяжёлых задач доступны, по заявлению сервиса, на его условиях, только платить можно картой РФ, СБП или по счёту с закрывающими. Условия и комиссии посредников нужно сравнивать по актуальным тарифам.
Чего caveman не решает?
Коротко: скилл укорачивает ответы, но не управляет ни «размышлениями» модели, ни объемным контекстом кодовой базы, ни агентными циклами. Эти строки расхода лечатся дисциплиной, а не плагином.
Thinking-токены вне досягаемости - у reasoning-сценариев это главная строка счёта. Агентные команды по официальной статистике Anthropic расходуют примерно в 7 раз больше токенов стандартной сессии: каждый тиммейт - отдельное окно контекста. Фоновые процессы (саммари для --resume) стоят обычно меньше $0.04 за сессию, но тоже не сжимаются.
Есть и ловушка «бедного родственника»: проект drona23/claude-token-efficient предлагает drop-in CLAUDE.md с правилами краткости, но автор честно предупреждает - сам файл инструкций добавляет input-токены в каждый ход и, разросшись, будет стоить дороже, чем экономит.
Почему о токенах заговорили даже Uber и Microsoft?
Коротко: счета выросли из «мелочи для разработчика» в бюджет компании. Uber ввёл лимит $1500 в месяц на ИИ-инструмент на сотрудника, Microsoft свернул часть лицензий Claude Code. Экономия токенов стала корпоративной дисциплиной.
По Bloomberg (пересказ 36Kr от 7 июля 2026), в Uber годовой бюджет на Claude Code израсходовали за 4 месяца - доступ получили около 5000 инженеров в декабре 2025 - после чего ввели лимит $1500 в месяц на инструмент (Claude Code, Cursor) на сотрудника. По The Verge, Microsoft отозвала лицензии Claude Code у подразделения Experiences+Devices с переводом на GitHub Copilot CLI до 30 июня.
Фон - из официальной статистики Anthropic: около $13 на разработчика в активный день и $150-250 в месяц, 90% пользователей укладываются в менее чем $30 в день. На этом фоне памятка Legrand читается как политика расходов: при счёте команды в десятки тысяч долларов минус 15-25% - это зарплата ещё одного инженера.
Как платить за Claude из России без наценки?
Коротко: все приёмы из статьи работают поверх обычного API, и вторая половина экономии - цена каждого токена. Из России уравнение закрывается агрегатором: официальный тариф без наценки, рубли, один баланс на чат и прод.
Подключение сводится к замене двух строк - API-ключ и base_url: единый API совместим и с OpenAI-SDK (/v1/chat/completions), и с Anthropic (/v1/messages), так что Claude Code, Cursor и другие клиенты подхватывают его без переписывания кода. Для команд - team workspaces с общим балансом организации и контролем расхода; юрлицам - договор, счёт и закрывающие.
Когда provod.ai не подходит
Если нужны фирменные подписочные фичи Claude.ai - приложения, память, проекты - понадобится прямая подписка вендора, агрегатор её не воспроизводит. При непрерывном heavy-chat целыми днями подписка может выйти дешевле оплаты по токенам: посчитай расход через /usage. Fine-tuning, on-prem и прямой Enterprise-контракт ради SLA - тоже не сюда. И главное: ни один сервис не настроит за тебя гигиену расхода - уровни caveman, кэширование и выбор модели остаются твоей работой.
Словарик запросов кластера
Коротко: рядом с «caveman claude» люди гуглят много странного. Часть запросов - про нашу тему, большинство - из соседних миров. Разбираем честно.
Про caveman и скиллы Claude
- «claude counter github» - так ищут счётчик токенов, его роль играет
/caveman-stats. - «claude skills ilm council» - сборники скиллов; ilm - артефакт автоподстановки.
- «coleam claude memory compiler» - компиляция memory-файлов, родственник
/caveman-compress. - «alirezarezvani claude skills» - скиллы ищут по никам авторов.
- «copilot claude opus cucumbervfrwmewoek» - запрос с мусорным хвостом: cucumbervfrwmewoek - сбой автоподстановки.
- «qwen coder 410 gone» - ошибка API: gone - модель снята; в каталоге агрегатора её заменяет актуальная.
- «стейбл Diffusion» - опечатка пути к Stable Diffusion, чужой кластер.
- «дефассье лоран луи клод» - французские Клоды; имена лоран и луи к нейросети отношения не имеют.
Локальные модели и llama.cpp
- «llama linux amd64 tgz» - архив под Linux; «llama cpp b5934» - номер билда; «llama cpp fedora» - установка на Fedora.
- «llama cpp ctx» - размер контекста; «llama cpp tensor parallelism» - параллелизм на GPU; «thetom llama cpp turboquant» - форк с квантованием.
- «comfyui llama dapao» - ComfyUI с локальной LLM, dapao - «сборка» по-китайски.
Stable Diffusion, Flux и картинки
- «stable diffusion 5060», «stable diffusion 5070» - подбор видеокарты; «stable diffusion radeon» - запуск на AMD.
- «animatediff stable diffusion», «svd stable diffusion», «img2vid stable diffusion» - анимация и видео.
- «stable diffusion arguments», «stable diffusion configs», «stable diffusion modules», «stable diffusion embeds», «extras stable diffusion» - файлы и папки WebUI.
- «stable diffusion sampler», «refiner stable diffusion», «stable diffusion upscalers», «stable diffusion xformer», «stable diffusion mask», «stable diffusion strength», «stable diffusion poses», «stable diffusion stderr» - параметры и логи.
- «dreamshaper stable diffusion», «illustrious stable diffusion», «photon stable diffusion», «stable diffusion pasanctuary» - чекпоинты; «stable diffusion pruned» - обрезанные веса.
- «stable diffusion webu» - WebUI; «stable diffusion collabs» - коллабы; «civital stable diffusion» - Civitai; «wildcards stable diffusion» - подстановки.
- «flux q3 comfui workwflow» - workflow Flux, опечатка зашита в запрос; «comfyanonymous flux text encoders» - encoders Flux.
- «fluksa флюкс флоу», «fluxlisimo» - прозвища Flux; «recraft crisp upscale» - апскейл в Recraft.
Другие чат-модели
- «deepseek coder 33b», «deepseek deepthink r1», «janus pro от deepseek», «jwangkun deepseek desktop» - модели и клиент DeepSeek.
- «qwen agentworld 35b a3b» - агентный бенчмарк; «qwen allocated quota exceeded» - квота allocated превышена exceeded; «nvidia k80 qwen» - запуск на старой карте.
- «mistral 7b bfclv3» - бенчмарк вызова функций; «ilyagusev saiga mistral 7b», «undi95 dpo mistral 7b» - Saiga и DPO-файнтюн.
- «xiaomi 14t gemini», «realme c63 джеминь», «gillman rustam gemini», «gemini tahir editz» - телефоны и блогеры; «gemini apps activity» - журнал; «gemini 470 dsp обновление» - прошивка; «gemini desktop dns switcher» - утилита доступа.
- «wooask chatgpt translator a8» - переводчик; «cdk chatgpt k12 nw» - раздача ключей; «chatgpt uzbek tilida onlayn» - ChatGPT на узбекском; «chatgpt openai opco llc» - юрлицо из чека; «gpt 4o wolfram alpha» - связка с wolfram.
- «ücretsiz indir grok» - «скачать бесплатно» по-турецки; обрубок cretsiz стал отдельным словом.
- «яндекс gpt2 нейросеть онлайн», «yandexgpt qled 4k uhd» - телевизор с нейросетью; «yandexart viral cindo» - фильтр YandexART.
- «peppa pig grounded sora» - мемы в Sora; «perplexity notewise goodnotes» - заметки; «gamma doro официальный сайт» - презентации; «nano banana massey» - фоторедактор; «suno andfm lenka cpacec» - музыка.
- «забросить ваз 2101 шедеврум», «оао кзпо профиль шедеврум» - «Шедеврум»: «копейка» и профиль с кзпо.
Алиса и бытовой шум
- «яндекс алиса 30вт» - колонка 30 Вт; «колонка яндекс алиса hdmi» - к телевизору; «алиса нейросеть inshot» - видеоредактор; «яндекс алиса миди аач» - миди-файлы, аач - артефакт клавиатуры.
- «алиса мими лиса маленький» - мультсериал, мими - персонаж; «бимбо элис алиса ай» - фандом вокруг элис.
- «через сколько придешь» - так спрашивают Алису; caveman ответил бы: «скоро».
- «теперь грок довольный сирусый» - мемный сирус про Grok; «почему гигачат теперь гич» - прозвище GigaChat.

provod.ai — общий AI-контур для команды агентов
Разделяйте роли между исследователем, разработчиком, критиком и исполнителем, не заводя отдельный кабинет для каждого: модели и расходы всей системы видны через одну платформу.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Мультиагентность не означает цепочку посреднических наценок: каждый вызов оплачивается по официальной цене 1:1, без маржи provod.ai.
Объедините агентов в одном API: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
FAQ
Коротко: пять вопросов, которые остаются после установки. Код не страдает, экономия реальна, но меньше рекламной.
caveman claude ухудшает качество кода?
Код, команды и строки ошибок скилл не изменяет, но качество рассуждения может меняться; для обучения, архитектуры и сложной диагностики режим лучше выключать. В недельном тесте ошибок не прибавилось (2 на 47 задач, как у baseline), а arXiv-исследование на coding-подобных задачах зафиксировало рост точности при принуждении к краткости.
Сколько я реально сэкономлю в деньгах?
Output упадёт примерно наполовину (48% в независимом тесте, 65% в бенчмарке автора), а доля output в счёте зависит от задач: оценка - 15-25% счёта на coding-сессиях. Точную цифру дадут /caveman-stats и /usage в Claude Code - померь неделю до и после.
Работает ли caveman с Cursor, Codex и Gemini CLI?
Да, скилл поддерживает более 30 агентов, включая Windsurf, Cline и GitHub Copilot; универсальный установщик сам определяет, что стоит на машине.
Чем caveman отличается от prompt caching и Batch API?
Он режет output, а они - input и цену: кэш даёт −90% на повторный контекст, батч - −50% на асинхронных задачах. Всё комбинируется - это соседние слои, а не конкуренты.
Это официальная функция Anthropic? Заменит ли курсы claude certified architect?
Нет и нет. Это community-скилл с лицензией MIT; Anthropic его не комментировала и не запрещала. И скилл не учит проектировать системы: выбор модели, сабагенты и бюджетирование остаются человеческой работой.
Источники
Коротко: первоисточники и проверяемые разборы; ссылки проверены 19.07.2026.
- S1: vc.ru - режим «пещерного человека» в Claude Code - https://vc.ru/ai/3006023-ekonomiya-tokenov-v-claude-code-rezhim-peshernogo-chelo
- S2: GitHub - JuliusBrussee/caveman - https://github.com/JuliusBrussee/caveman
- S3: Anthropic Docs - Models & pricing - https://docs.anthropic.com/en/docs/about-claude/pricing
- S4: Anthropic Docs - Claude Code: costs - https://docs.anthropic.com/en/docs/claude-code/costs
- S5: arXiv 2604.00025 - Brevity Constraints - https://arxiv.org/html/2604.00025v1
- S6: AI Weekly - пересказ 404 Media - https://aiweekly.co/alerts/caveman-plugin-trims-claude-and-codex-output-to-cut-ai-bills
- S7: 3DNews - «ИИ научили говорить как пещерный человек» - https://3dnews.ru/1144355
- S8: 36Kr - пересказ Bloomberg и The Verge - https://www.36kr.com/p/3884763059319044
- S9: Pasquale Pillitteri - недельный тест - https://pasqualepillitteri.it/de/news/849/claude-code-caveman-mode-token-sparen
- S10: Utsav Works - обзор Caveman Skill - https://www.utsavworks.in/blog/caveman-skill-reduce-claude-code-token-cost
- S11: Adam Blackington - «65% Token Savings» - https://adamblackington.blog/caveman-claude-code-skill-token-savings/
- S12: GitHub - drona23/claude-token-efficient - https://github.com/drona23/claude-token-efficient
