DEV Community

Cover image for «caveman claude»: режим пещерного человека и другие приёмы, режущие расход токенов вдвое
Promptra Team for Promptra

Posted on

«caveman claude»: режим пещерного человека и другие приёмы, режущие расход токенов вдвое

В начале апреля 2026 года независимый разработчик Julius Brussee выложил на GitHub плагин caveman: он заставляет Claude Code отвечать как пещерный человек - коротко, без артиклей, вежливых вступлений и хеджирования. К июлю о нём написали 404 Media и 3DNews, по данным 404 Media его используют разработчики из Nvidia, GitHub и OpenAI, а тест издания зафиксировал экономию 5800 токенов (65%) за одну сессию. Legrand во внутренней памятке прямо рекомендует скилл сотрудникам.

Причина ажиотажа - деньги. По официальному прайсу Anthropic на июль 2026 output-токены Claude стоят в пять раз дороже input, а «болтливость» модели - та часть счёта, которую можно ужать без потери кода. Первичный бенчмарк обещает в среднем −65% output-токенов.

Экономить токены - полдела. Вторая - не переплачивать за каждый: агрегатор provod.ai (российский OpenRouter) отдаёт те же Claude и GPT из России по ценам официальных провайдеров, в рублях и без VPN. Дальше - без мемной шелухи: сколько «пещерный режим» экономит на самом деле, где он вредит и что доводит суммарную экономию до честного «вдвое».

Что такое caveman claude и откуда взялся «режим пещерного человека»?

Коротко: бесплатный open-source скилл (лицензия MIT), который переключает модель на телеграфный стиль - из ответов вычищаются артикли, filler-слова и оговорки. Работает с Claude Code, Codex, Gemini CLI, Cursor, GitHub Copilot и ещё более чем 30 агентами.

Механика простая: скилл подмешивает в сессию инструкцию отвечать фрагментами - «bug in render loop. state not memoized. fix: useMemo». Код и имена функций остаются нетронутыми, сжимается только проза вокруг. Автор в README формулирует так: «caveman no make brain smaller, caveman make mouth smaller». Мне нравится эта честность: главным выигрышем он называет читаемость, а экономию - бонусом.

Запрос «caveman claude» (и зеркальный «claude caveman») дорос до устойчивого термина - люди ищут именно режим, а не пещерную эстетику. Директор по инжинирингу OpenAI Shayne Sweeney лично внёс в репозиторий поддержку Codex, упоминается использование в агентстве DEPT.

Сколько токенов реально экономит caveman?

Коротко: по первичному бенчмарку - в среднем 65% output-токенов, диапазон 22-87%. По независимому недельному тесту - 48% output и 15-25% всего счёта на coding-сессиях. Рекламные «75%» к деньгам напрямую не привязывай.

Замеры из репозитория (реальные вызовы Claude API, 10 задач, проверено 19.07.2026):

Задача Обычный ответ, токенов caveman, токенов Экономия
Объяснить баг ре-рендера React 1180 159 −87%
Настроить пул соединений PostgreSQL 2347 380 −84%
Рефакторинг callback → async/await 387 301 −22%
Среднее по выборке 1214 294 примерно на три четверти

Источник: бенчмарк JuliusBrussee/caveman, GitHub.

Две оговорки. Первая: caveman режет только output, thinking/reasoning-токены не затрагивает вообще - в «рассуждающих» сценариях он почти ничего не даст. Вторая: output - не весь счёт. Независимый недельный тест (блог Pasquale Pillitteri, 4 июля 2026) на реальных задачах - миграция Laravel 10→11, фоновые агенты, ревью - показал −48% output-токенов и −22% диалоговых ходов на задачу при том же уровне ошибок (2 на 47 задач, как у baseline). Автор оценивает реальную экономию на счёте в 15-25%.<!-- IMAGE_SPEC_START
id: exhibit
path: images/02-exhibit.png
kind: exhibit
kicker: График 1
headline: Три задачи из бенчмарка: caveman режет output-токены на 22-87%
metric: output-токены на один ответ, normal vs caveman, 10 задач, Claude API, проверено 19.07.2026
visual: horizontal bar chart, три пары горизонтальных баров (normal - графит, caveman - cyan #80D2FF): «баг ре-рендера React» 1180 vs 159, «пул соединений PostgreSQL» 2347 vs 380, «рефакторинг callback → async/await» 387 vs 301; highlighted item - пара PostgreSQL с максимальной абсолютной экономией, blue-to-violet акцент #1B3AFF -> #7A2FFF только на ней; bottom-line строка: «среднее по выборке: 1214 → 294, −65%»; ровно одна читаемая publisher-надпись provod.ai в углу кадра
data: 1180, 159, −87%; 2347, 380, −84%; 387, 301, −22%; 1214, 294, −65%
accent: пара баров PostgreSQL
source: GitHub JuliusBrussee/caveman, первичный бенчмарк репозитория, проверено 19.07.2026
negative: выдуманные задачи и числа, 3D-эффекты, rainbow neon, внешние логотипы, watermarks, мелкий нечитаемый текст, эмодзи
IMAGE_SPEC_END -->

Три задачи из бенчмарка caveman: output-токены normal vs caveman, экономия 22-87%

Почему краткость работает - и когда она вредит?

Коротко: многословие у больших моделей само порождает ошибки, это измерено. Но где ответ нужно собирать из контекста, принудительная краткость добавляет промахов - поэтому у скилла есть предохранитель, а у тебя должны быть сценарии, где он выключен.

Статья на arXiv «Brevity Constraints Reverse Performance Hierarchies in Language Models» (11 марта 2026) прогнала 31 модель (0.5B-405B) на 1485 задачах: принуждение к краткости улучшило точность больших моделей на 26.3 процентных пункта там, где многословие вело к ошибкам (overelaboration), и сократило отставание от лидеров на 67%.

Исключение важнее результата: на BoolQ, задаче чтения с пониманием, краткость увеличила ошибки (23.5 → 24.3 п.п.). Отсюда практика, которую подтверждает и автор недельного теста: не включай caveman при обучении новому, обсуждении архитектуры, отладке неизвестных багов и для результатов «на вынос». Discovery interview с заказчиком - тоже мимо: там паузы и полные формулировки несут смысл, а «пещерные» обрубки читаются как хамство.

Второй предохранитель встроен в скилл: правило auto-clarity отключает сжатие для предупреждений о безопасности, подтверждений необратимых действий и многошаговых последовательностей, а код, команды, URL и строки ошибок не изменяются никогда. «delete table prod. confirm? yes» ты не получишь - такие места останутся развёрнутыми.

Как установить и настроить caveman за пять минут?

Коротко: две команды в Claude Code или один one-liner для всех поддерживаемых агентов на машине (нужен Node 18+). Дальше - четыре уровня сжатия и вспомогательные команды экосистемы.

claude plugin marketplace add JuliusBrussee/caveman
claude plugin install caveman@caveman
Enter fullscreen mode Exit fullscreen mode

Альтернатива - one-liner (curl ... install.sh | bash), который сам определяет всех поддерживаемых агентов. В Claude Code, Codex и Gemini скилл активируется автоматически каждую сессию через hook-файлы.

Уровни переключаются на лету /caveman lite|full|ultra и держатся до конца сессии: lite убирает только filler, full - дефолтный «пещерный» стиль, ultra - телеграфный максимум, wenyan - стилизация под классический китайский 文言文, самая короткая (даже промпт «нарисуй котенка» сожмёт до двух слов). Выключение - фраза «normal mode» или «stop caveman».

Экосистема автора закрывает соседние задачи: /caveman-commit пишет conventional commit до 50 символов, /caveman-review оставляет однострочные PR-комментарии вида L42: bug: user null. Add guard., /caveman-stats - встроенный counter экономии со статуслайн-бейджем вида [CAVEMAN] 12.4k. Отдельно стоит /caveman-compress: переписывает «пещерным» стилем CLAUDE.md и memory-файлы - на 5 реальных файлах экономия input-токенов 46% (898 → 481), код и пути сохраняются побайтово. Есть и проект caveman-code - терминальный агент, по заявлению автора расходующий примерно вдвое меньше токенов, чем Codex; независимых замеров нет.

Какие ещё приёмы режут расход токенов вдвое и больше?

Коротко: caveman - один слой из пяти. Официальные механизмы Anthropic и гигиена контекста дают каждый свой крупный кусок, а общий эффект зависит от долей input, output и thinking в счёте конкретной задачи. По прайсу и докам Anthropic на июль 2026.

Приём Что режет Эффект Источник
caveman output-токены −65% в среднем бенчмарк репозитория
/caveman-compress input memory-файлов −46% замер автора на 5 файлах
prompt caching повторный input −90% (чтение 0.1× базовой цены) Anthropic Docs
Batch API input и output −50% на асинхронных задачах Anthropic Docs
Haiku 4.5 вместо Opus 4.8 цена токена −80% ($1/$5 против $5/$25 за MTok) прайс на июль 2026
Новый токенизатор (Opus 4.7+, Sonnet 5, Fable 5) антиприём +30% токенов на тот же текст Anthropic Docs

Prompt caching: запись в кэш стоит 1.25× базовой цены input на 5 минут (2× на час), чтение - 0.1×, то есть скидка 90% на повторный контекст; пятиминутный кэш окупается после одного чтения. Batch API режет пополам цену входа и выхода для задач, которым не нужен ответ немедленно. Скидки комбинируются.

Выбор модели - самый грубый рычаг: Opus 4.8/4.7/4.6/4.5 - $5/$25 за MTok (input/output), Sonnet 4.6/4.5 - $3/$15, Sonnet 5 - $2/$10 по вводной цене до 31.08.2026 (с 01.09.2026 - $3/$15), Haiku 4.5 - $1/$5. Из доков по расходу Claude Code сюда же: /clear между задачами, /compact с инструкциями, haiku для сабагентов, отключение неиспользуемых MCP-серверов, CLAUDE.md под 200 строк, снижение effort и MAX_THINKING_TOKENS, plan mode. Антиприём из таблицы тоже важен: новый токенизатор дробит тот же текст примерно на 30% больше токенов - переехал на свежую модель, и счёт растёт сам.

Все цифры выше - официальные тарифы в долларах. В рублях по тем же цифрам 1:1, без наценки, эти модели считает provod.ai: Sonnet для рутины и Opus для тяжёлых задач доступны, по заявлению сервиса, на его условиях, только платить можно картой РФ, СБП или по счёту с закрывающими. Условия и комиссии посредников нужно сравнивать по актуальным тарифам.

Чего caveman не решает?

Коротко: скилл укорачивает ответы, но не управляет ни «размышлениями» модели, ни объемным контекстом кодовой базы, ни агентными циклами. Эти строки расхода лечатся дисциплиной, а не плагином.

Thinking-токены вне досягаемости - у reasoning-сценариев это главная строка счёта. Агентные команды по официальной статистике Anthropic расходуют примерно в 7 раз больше токенов стандартной сессии: каждый тиммейт - отдельное окно контекста. Фоновые процессы (саммари для --resume) стоят обычно меньше $0.04 за сессию, но тоже не сжимаются.

Есть и ловушка «бедного родственника»: проект drona23/claude-token-efficient предлагает drop-in CLAUDE.md с правилами краткости, но автор честно предупреждает - сам файл инструкций добавляет input-токены в каждый ход и, разросшись, будет стоить дороже, чем экономит.

Почему о токенах заговорили даже Uber и Microsoft?

Коротко: счета выросли из «мелочи для разработчика» в бюджет компании. Uber ввёл лимит $1500 в месяц на ИИ-инструмент на сотрудника, Microsoft свернул часть лицензий Claude Code. Экономия токенов стала корпоративной дисциплиной.

По Bloomberg (пересказ 36Kr от 7 июля 2026), в Uber годовой бюджет на Claude Code израсходовали за 4 месяца - доступ получили около 5000 инженеров в декабре 2025 - после чего ввели лимит $1500 в месяц на инструмент (Claude Code, Cursor) на сотрудника. По The Verge, Microsoft отозвала лицензии Claude Code у подразделения Experiences+Devices с переводом на GitHub Copilot CLI до 30 июня.

Фон - из официальной статистики Anthropic: около $13 на разработчика в активный день и $150-250 в месяц, 90% пользователей укладываются в менее чем $30 в день. На этом фоне памятка Legrand читается как политика расходов: при счёте команды в десятки тысяч долларов минус 15-25% - это зарплата ещё одного инженера.

Как платить за Claude из России без наценки?

Коротко: все приёмы из статьи работают поверх обычного API, и вторая половина экономии - цена каждого токена. Из России уравнение закрывается агрегатором: официальный тариф без наценки, рубли, один баланс на чат и прод.

Подключение сводится к замене двух строк - API-ключ и base_url: единый API совместим и с OpenAI-SDK (/v1/chat/completions), и с Anthropic (/v1/messages), так что Claude Code, Cursor и другие клиенты подхватывают его без переписывания кода. Для команд - team workspaces с общим балансом организации и контролем расхода; юрлицам - договор, счёт и закрывающие.

Когда provod.ai не подходит

Если нужны фирменные подписочные фичи Claude.ai - приложения, память, проекты - понадобится прямая подписка вендора, агрегатор её не воспроизводит. При непрерывном heavy-chat целыми днями подписка может выйти дешевле оплаты по токенам: посчитай расход через /usage. Fine-tuning, on-prem и прямой Enterprise-контракт ради SLA - тоже не сюда. И главное: ни один сервис не настроит за тебя гигиену расхода - уровни caveman, кэширование и выбор модели остаются твоей работой.

Схема подключения provod.ai: замена base URL и API-ключа, счёт в рублях

Проверь приёмы из статьи на живом счёте за пять минут: на provod.ai модели доступны в одном чате и через единый API, оплата в рублях с карты РФ, для юрлиц - договор и закрывающие. Один баланс: тестируешь в чате, катишь в прод через тот же ключ.

Словарик запросов кластера

Коротко: рядом с «caveman claude» люди гуглят много странного. Часть запросов - про нашу тему, большинство - из соседних миров. Разбираем честно.

Про caveman и скиллы Claude

  • «claude counter github» - так ищут счётчик токенов, его роль играет /caveman-stats.
  • «claude skills ilm council» - сборники скиллов; ilm - артефакт автоподстановки.
  • «coleam claude memory compiler» - компиляция memory-файлов, родственник /caveman-compress.
  • «alirezarezvani claude skills» - скиллы ищут по никам авторов.
  • «copilot claude opus cucumbervfrwmewoek» - запрос с мусорным хвостом: cucumbervfrwmewoek - сбой автоподстановки.
  • «qwen coder 410 gone» - ошибка API: gone - модель снята; в каталоге агрегатора её заменяет актуальная.
  • «стейбл Diffusion» - опечатка пути к Stable Diffusion, чужой кластер.
  • «дефассье лоран луи клод» - французские Клоды; имена лоран и луи к нейросети отношения не имеют.

Локальные модели и llama.cpp

  • «llama linux amd64 tgz» - архив под Linux; «llama cpp b5934» - номер билда; «llama cpp fedora» - установка на Fedora.
  • «llama cpp ctx» - размер контекста; «llama cpp tensor parallelism» - параллелизм на GPU; «thetom llama cpp turboquant» - форк с квантованием.
  • «comfyui llama dapao» - ComfyUI с локальной LLM, dapao - «сборка» по-китайски.

Stable Diffusion, Flux и картинки

  • «stable diffusion 5060», «stable diffusion 5070» - подбор видеокарты; «stable diffusion radeon» - запуск на AMD.
  • «animatediff stable diffusion», «svd stable diffusion», «img2vid stable diffusion» - анимация и видео.
  • «stable diffusion arguments», «stable diffusion configs», «stable diffusion modules», «stable diffusion embeds», «extras stable diffusion» - файлы и папки WebUI.
  • «stable diffusion sampler», «refiner stable diffusion», «stable diffusion upscalers», «stable diffusion xformer», «stable diffusion mask», «stable diffusion strength», «stable diffusion poses», «stable diffusion stderr» - параметры и логи.
  • «dreamshaper stable diffusion», «illustrious stable diffusion», «photon stable diffusion», «stable diffusion pasanctuary» - чекпоинты; «stable diffusion pruned» - обрезанные веса.
  • «stable diffusion webu» - WebUI; «stable diffusion collabs» - коллабы; «civital stable diffusion» - Civitai; «wildcards stable diffusion» - подстановки.
  • «flux q3 comfui workwflow» - workflow Flux, опечатка зашита в запрос; «comfyanonymous flux text encoders» - encoders Flux.
  • «fluksa флюкс флоу», «fluxlisimo» - прозвища Flux; «recraft crisp upscale» - апскейл в Recraft.

Другие чат-модели

  • «deepseek coder 33b», «deepseek deepthink r1», «janus pro от deepseek», «jwangkun deepseek desktop» - модели и клиент DeepSeek.
  • «qwen agentworld 35b a3b» - агентный бенчмарк; «qwen allocated quota exceeded» - квота allocated превышена exceeded; «nvidia k80 qwen» - запуск на старой карте.
  • «mistral 7b bfclv3» - бенчмарк вызова функций; «ilyagusev saiga mistral 7b», «undi95 dpo mistral 7b» - Saiga и DPO-файнтюн.
  • «xiaomi 14t gemini», «realme c63 джеминь», «gillman rustam gemini», «gemini tahir editz» - телефоны и блогеры; «gemini apps activity» - журнал; «gemini 470 dsp обновление» - прошивка; «gemini desktop dns switcher» - утилита доступа.
  • «wooask chatgpt translator a8» - переводчик; «cdk chatgpt k12 nw» - раздача ключей; «chatgpt uzbek tilida onlayn» - ChatGPT на узбекском; «chatgpt openai opco llc» - юрлицо из чека; «gpt 4o wolfram alpha» - связка с wolfram.
  • «ücretsiz indir grok» - «скачать бесплатно» по-турецки; обрубок cretsiz стал отдельным словом.
  • «яндекс gpt2 нейросеть онлайн», «yandexgpt qled 4k uhd» - телевизор с нейросетью; «yandexart viral cindo» - фильтр YandexART.
  • «peppa pig grounded sora» - мемы в Sora; «perplexity notewise goodnotes» - заметки; «gamma doro официальный сайт» - презентации; «nano banana massey» - фоторедактор; «suno andfm lenka cpacec» - музыка.
  • «забросить ваз 2101 шедеврум», «оао кзпо профиль шедеврум» - «Шедеврум»: «копейка» и профиль с кзпо.

Алиса и бытовой шум

  • «яндекс алиса 30вт» - колонка 30 Вт; «колонка яндекс алиса hdmi» - к телевизору; «алиса нейросеть inshot» - видеоредактор; «яндекс алиса миди аач» - миди-файлы, аач - артефакт клавиатуры.
  • «алиса мими лиса маленький» - мультсериал, мими - персонаж; «бимбо элис алиса ай» - фандом вокруг элис.
  • «через сколько придешь» - так спрашивают Алису; caveman ответил бы: «скоро».
  • «теперь грок довольный сирусый» - мемный сирус про Grok; «почему гигачат теперь гич» - прозвище GigaChat.

provod.ai — единый AI-контур для бизнеса и команды

Рабочие пространства, отдельные аккаунты и разграничение доступа — компания централизованно управляет балансом, правами и расходами, а сотрудники не используют разрозненные личные ключи.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Компания оплачивает запросы по ценам самих провайдеров: 1:1 и без надбавки provod.ai. Расчёты идут в рублях, для юридических лиц доступны договор, счёт и закрывающие документы.

Соберите корпоративное пространство в provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для договора

FAQ

Коротко: пять вопросов, которые остаются после установки. Код не страдает, экономия реальна, но меньше рекламной.

caveman claude ухудшает качество кода?

Код, команды и строки ошибок скилл не изменяет, но качество рассуждения может меняться; для обучения, архитектуры и сложной диагностики режим лучше выключать. В недельном тесте ошибок не прибавилось (2 на 47 задач, как у baseline), а arXiv-исследование на coding-подобных задачах зафиксировало рост точности при принуждении к краткости.

Сколько я реально сэкономлю в деньгах?

Output упадёт примерно наполовину (48% в независимом тесте, 65% в бенчмарке автора), а доля output в счёте зависит от задач: оценка - 15-25% счёта на coding-сессиях. Точную цифру дадут /caveman-stats и /usage в Claude Code - померь неделю до и после.

Работает ли caveman с Cursor, Codex и Gemini CLI?

Да, скилл поддерживает более 30 агентов, включая Windsurf, Cline и GitHub Copilot; универсальный установщик сам определяет, что стоит на машине.

Чем caveman отличается от prompt caching и Batch API?

Он режет output, а они - input и цену: кэш даёт −90% на повторный контекст, батч - −50% на асинхронных задачах. Всё комбинируется - это соседние слои, а не конкуренты.

Это официальная функция Anthropic? Заменит ли курсы claude certified architect?

Нет и нет. Это community-скилл с лицензией MIT; Anthropic его не комментировала и не запрещала. И скилл не учит проектировать системы: выбор модели, сабагенты и бюджетирование остаются человеческой работой.

Источники

Коротко: первоисточники и проверяемые разборы; ссылки проверены 19.07.2026.

Top comments (0)