В гайде OpenAI для reasoning-моделей, актуальном на июль 2026, есть строка, которая ломает привычку нескольких лет: «Try zero shot first, then few shot if needed». А Google в гайде от 10 июня 2026 советует противоположное - всегда включать примеры. Два главных вендора дают взаимоисключающие рекомендации.
Привычка понятна: гайды 2023-2024 годов учили «всегда добавляй в промпт 3-5 примеров». С тех пор вышли работы, которые проверили привычку на современных моделях, - и она не выдержала проверки. Ниже - первоисточники и гайды на июнь-июль 2026: где few-shot ещё работает и как проверить всё на своей задаче за вечер.
Отдельная ставка: правильный ответ зависит от модели - Cheng et al. гоняли Qwen2.5, авторы Hi-CoT - Qwen3 и дистилляты DeepSeek-R1. Прогнать один A/B-тест на нескольких моделях проще через единый API: в provod.ai (российский OpenRouter) Qwen и DeepSeek живут рядом с флагманами OpenAI.
Что такое few-shot промптинг и откуда он взялся?
Коротко: это режим, когда вместе с задачей модели показывают несколько готовых примеров «вход - выход». Термины zero-shot, one-shot и few-shot ввела статья про GPT-3 в 2020 году - с тех пор примеры стали советом по умолчанию.
В работе Brown et al. «Language Models are Few-Shot Learners» (arXiv, 28 мая 2020) модель GPT-3 со 175 млрд параметров решала задачи, получая их чисто текстом: без градиентов и файнтюнинга. Zero-shot - только инструкция, one-shot - плюс один пример, few-shot - плюс горстка примеров. Модель «училась» прямо в контексте, и казалось, что примеры передают ей знание о задаче.
Потом пришёл chain-of-thought с «let's think step by step», и примеры начали клеить в задачи на рассуждение: покажи модели, как рассуждать, и она повторит. Эту логику и пошли проверять.
Что показали исследования 2025-2026: примеры перестали учить модель думать?
Коротко: для серии Qwen2.5 классические CoT-примеры не улучшили рассуждение по сравнению с zero-shot CoT; в этом исследовании их основная функция свелась к выравниванию формата ответа.
Главная работа - Cheng et al., «Revisiting Chain-of-Thought Prompting: Zero-Shot Can Be Stronger than Few-Shot» (arXiv 2506.14641, v1 17.06.2025, v3 08.01.2026). Связку «zero-shot CoT против few-shot CoT» проверили на серии Qwen2.5: примеры прироста не дают, их функция свелась к выравниванию формата.
Проверку усилили: взяли «улучшенные» примеры, построенные на ответах топовых Qwen2.5-Max и DeepSeek-R1. Не помогли - модели игнорируют экземпляры и фокусируются на инструкциях. Сколько процентов тут теряется, в абстракте нет, и выдумывать цифры я не буду - вывод качественный и однозначный.
Второй источник - Hi-CoT (arXiv 2604.00130, v2, 2026). Авторы осознанно работают в zero-shot парадигме, потому что, со ссылкой на Cheng et al., «CoT-экземпляры дают ограниченный прирост в рассуждении у современных LLM и в первую очередь служат для принуждения к формату вывода». Вместо примеров - структура, и она даёт то, что обещали от примеров.
Почему модель игнорирует твои примеры?
Коротко: потому что примеры и не передают «знания». Ещё в 2022 году Min et al. показали: примеры задают пространство меток, распределение входа и формат последовательности. Правильность их содержимого почти неважна.
В работе Min et al., «Rethinking the Role of Demonstrations» (arXiv 2202.12837, 25 февраля 2022), взяли 12 моделей, включая GPT-3, и случайно заменили правильные метки на неправильные. Результат на классификации и multi-choice почти не ухудшился: модель считывает с примеров, какие метки существуют, как выглядит вход и в каком формате отвечать, - а не «узнаёт», как решать задачу.
Отсюда механика: добавляя примеры, ты не учишь модель, а калибруешь интерфейс. Поэтому реакция разнится от модели к модели - у фронтир-модели «умение рассуждать» влито при обучении, слабой может не хватить и примеров. Люди чувствуют это интуитивно: в запросах вроде «зачем 2 моделма» (так ищут, зачем держать рядом DeepSeek и Qwen) кроется правильный вопрос - разные модели по-разному отзываются на один промпт.
Меня напрягает вот что: совет «добавь 3-5 примеров» тиражируется как универсальный, хотя четыре года известно, что примеры работают иначе. Гайды-2024 просто не дочитали Min et al.
Под какую задачу какая техника нужна в 2026 году?
Коротко: few-shot - для формата, стиля, кастомных меток и строгих схем вывода. Для рассуждений - zero-shot и thinking-режимы. Сводка на июнь-июль 2026 - в таблице.
| Задача | Техника первого выбора | Почему |
|---|---|---|
| Математика, логика, многошаговый анализ | zero-shot + thinking-режим | рассуждение внутри модели; примеры не улучшают (Cheng et al.; OpenAI) |
| Строгий формат ответа (JSON, таблица, шаблон) | few-shot | «самый надёжный якорь формата» (explainx.ai, июнь-июль 2026) |
| Кастомная классификация по своим меткам | few-shot | примеры задают пространство меток (Min et al.; prompt-architects.com) |
| Экстракция по жёсткой JSON-схеме | few-shot или structured output | зона few-shot по explainx.ai |
| Фирменный tone of voice, перевод тональностей | few-shot | выигрыш у prompt-architects.com; у Anthropic - 3-5 примеров в <example>
|
| Саммари, код, общие ответы | zero-shot first | примеры - только если формат «поехал» (OpenAI, проверен 19.07.2026) |
За таблицей - реальный конфликт. OpenAI: «Try zero shot first, then few shot if needed», плюс предупреждение: примеры обязаны строго соответствовать инструкции, иначе смещения. Google в гайде от 10 июня 2026: всегда включайте few-shot примеры - они задают «формат, формулировки, рамки или общий паттерн ответа». Anthropic: multishot особенно эффективен для структурированного вывода, доза - 3-5 разнообразных примеров.
Противоречие снимается просто: все трое говорят про формат. OpenAI добавляет «для рассуждения не нужны», Google - нет, отсюда спор. Вывод: подобрать технику под задачу, а не под привычку.
Чем заменить примеры в рассуждениях: структура вместо шотов?
Коротко: zero-shot CoT, thinking-режим и структурные промпты. Методы выигрывают формой рассуждения, а не количеством примеров, - и экономят токены.
Первая опора - встроенное «мышление»: по гайду OpenAI, reasoning-модели o-серии часто не нуждаются в примерах, «think step by step» для них излишне - рассуждение происходит внутри. Google пишет то же о Gemini 2.5 и 3.
Вторая - Hi-CoT, иерархический chain-of-thought с чередованием блоков <|instruction|> и <|execution|>. Чистый zero-shot метод: в среднем +6.2% к точности (до 61.4% на отдельных связках) при сокращении reasoning-трассы на 13.9% против обычного CoT - замеры на 13 конфигурациях (Qwen3 от 0.6B до 32B, дистилляты DeepSeek-R1) и 5 математических бенчмарках. При строгом следовании формату точность доходит до 100% на AMC и MATH500, трасса режется до 75%. Ключевым фактором оказалась структура, а не примеры.
Третья - Chain of Draft (arXiv 2502.18600, 25 февраля 2025): лаконичные «черновые» шаги вместо развёрнутого CoT, точность на уровне или выше при расходе от 7.6% токенов. Урок тот же: выигрыш даёт форма рассуждения, а не объём подсказок.
Чего few-shot не решает?
Коротко: безопасность, модерацию, пробелы в знаниях и слабость малых моделей. Примеры - инструмент формата, и требовать большего - типичная ошибка.
Начну с границы, о которой спрашивают чаще всего. Никакие примеры не отключают фильтры платформы: запросы на обнаженных людей, инструкции в духе «сосет по фото» и прочий explicit-интент уходят в отказ, у Grok такие перехваты видны как пометка «content moderated». Модерация живёт выше уровня промпта, few-shot тут бессилен - как и jailbreak-конструкции. Инструкций по обходу не будет: это зона отказа, а не промптинг.
Вторая граница - знания. Примеры не обновляют знания модели и не заменяют RAG, но могут передавать факты, метки и контекст конкретной задачи. Для знаний нужны RAG и источники, не шоты.
Третья - слабые модели. В ограничениях Hi-CoT записано: самые маленькие (Qwen3-0.6B, DeepSeek-R1-Distill-Qwen-1.5B) часто не удерживают заданную структуру, прирост маргинален - есть порог reasoning-способности. Для локальных моделей класса llama 3.2 11b жёсткий формат и пара примеров могут быть ещё нужнее, чем для фронтир-моделей.
И четвёртое, бытовое: сервисы-«улучшатели» промптов (prompt enhancer) не заменяют понимания механики. Улучшатель докрутит формулировки, но решение «нужны ли примеры под эту задачу» за тебя не примет.
Работает ли few-shot у генераторов картинок?
Коротко: в текстовом смысле - нет. Пары «вход - выход» в промпт image-модели не вставишь; роль шотов играют слова-якоря.
Люди ищут это массово, просто в других словах: «фото в стиле gta», «ai character draw», «gemini draw», «flux lighting», «qwen image lighting», «midjourney color», «kling color», «pic to pic». За каждым запросом - потребность few-shot: зафиксировать формат результата. Только якорем служит набор маркеров: lighting для света, color для палитры, название стиля для композиции.
Параллель точная: как в тексте примеры задают паттерн ответа, в картинках паттерн задают якорные слова. И как избыток примеров «переобучает» ответ (Google, 10.06.2026), перегруз якорями размывает сцену. Механика одна, поверхность разная.
Как проверить всё это на своей задаче за один вечер?
Коротко: берёшь 20-30 реальных входов, гоняешь два варианта промпта (zero-shot против few-shot) на 3-5 моделях и считаешь, где формат стабильнее и ответы точнее. Никакая статья - включая эту - не заменит прогон.
- Собери 20-30 типичных входов из своей задачи - тех, что приходят в прод.
- Сделай два промпта: чистая инструкция (zero-shot) и она же плюс 2-5 примеров. По гайду prompt-architects.com (07.06.2026) больше 5 примеров «размывает» паттерн, самый показательный ставь последним - действует recency bias.
- Прогони оба варианта на 3-5 моделях: поведение примеров различается от модели к модели, это и есть главное измерение.
- Считай три метрики: соблюдение формата, точность по твоей проверке, расход токенов.
- Оставь технику, выигравшую на твоих данных, а не в чужом гайде.
Прогон - один цикл, где модель меняется одной строкой конфигурации. Единый API provod.ai совместим и с OpenAI-SDK (/v1/chat/completions), и с Anthropic (/v1/messages): тест заводится из России сменой ключа и base_url на https://api.provod.ai/v1 без переписывания кода. Один баланс в рублях на весь прогон, оплата картой РФ или СБП по ценам официальных провайдеров без наценки, для юрлиц - договор и закрывающие. Для локальной проверки на модели класса 11b пайплайн тот же, только железо своё.
Когда provod.ai не подходит
Коротко: когда задача решается одной фирменной подпиской вендора, когда нужен on-prem или fine-tuning, и когда A/B-тест уже прогнан, а разницы нет.
Если вся работа живёт внутри одного фирменного приложения с памятью и проектами, а модель одна - агрегатор ничего нового не даст: подписочные фичи вендора он не воспроизводит. Нужны on-prem, дообучение на своих данных или прямой enterprise-контракт ради SLA - тоже мимо. И честный случай: прогнал тест и увидел, что задаче хватает zero-shot на одной дешёвой модели? Отлично - ты сэкономил на примерах и инструментах.
Словарик запросов кластера
Рядом с темой в поиске плавает много странного. Разбираю, что ищут и куда это ведёт.
Обходы и взрослый шум.
- «panda», «gyno» - обрывки jailbreak-запросов к ChatGPT; примерами модель не «сломать», это зона фильтров, не промптинга.
- «pornopop», «undress», «раздеватор18», «mike», «видио», «восемнадцать» - «раздеваторы» фото; adult-сервисы вне темы и вне правил платформ.
- «юноши», «лобками», «новорожденного» - генерация тел и лиц; с реальными людьми - юридическая мина.
- «партнером» - «фото поцелуй с партнёром»: сведение снимков image-редактором.
- «одиночество», «фентази», «ть» - обрывки про ИИ-собеседника, «видео фантазии», «ть фото ия бесплатно»; смысла нет.
Сервисы «оживить и улучшить фото».
- «bigipg», «fasee», «zawa», «zyro», «impulscaler» - апскейлеры и улучшатели фото.
- «homiwork», «storiko», «videomaker», «vidfulai», «vling», «zevs», «zeusgpt», «yolla», «leiapix», «megakadr», «mangoai», «neuralnetworks», «visualgpt», «vidlin», «fly», «hotpot», «imgur», «баноно», «визардио», «rdio», «quin», «vizerd» - сервисы «оживить фото» и «видео из фото»; имя меняется, суть одна.
- «jpg», «видеопо», «818», «4630300», «2к17», «1э» - обрывки с форматами и номерами («улучшить jpg», «замена лица 4630300»); сервиса за номером нет.
- «поврежденных», «потертого», «открыванию», «объединенные», «соединенные», «оживленным», «оживленными» - реставрация: повреждённых родных с потёртого снимка, открывание глаз, объединённые и соединённые кадры.
- «redmagic», «иос26» - «отключить ИИ-улучшение на Redmagic», «изменять фото на iOS 26»; вопросы к настройкам устройства.
- «nmkd» - локальный GUI для Stable Diffusion.
- «автокад» - «нейронка автокад»; генеративный дизайн в CAD, не промптинг.
- «klerk» - «grok бесплатно klerk ru»; навигация к статье на «Клерке».
Опечатки, имена и загадки.
- «тоха» - самый частотный мусорный запрос кластера: «тоха смотреть видео про себя нейросеть»;; вирусный персонаж..
- «бриали», «вандама», «дефассье» - так ищут «Жан-Клода»: Бриали и Ван Дамма смешали с Claude; Дефассье - реальный Лоран Луи Клод.
- «гигачта», «зефс» - опечаточные написания GigaChat и Zeus.
- «коля», «масип» - «нейро Коля» и обрывок «масипнуть пасту, Алиса»; чат-боты и голос-команды.
- «нологи» - «майнкрафт на русский нолог»: летсплеи.
- «мураками», «натали», «радуга», «malinova», «lady» - музыкальный шум: «мураками привет алиса», кавер «Натали», «радуга дэш», «DJ Malinova», «lady gaga runway».
- «газонокосилках» - «чей двигатель на газонокосилках GPT»; аббревиатуру приняли за бренд.
- «мэт» - «объединить фото мэт пейнтинг»: фоторедактор с опечаткой.
- «кошечки», «тойчик», «тихонечко», «перепечки» - милые ролики, вирусные видео и «разбор перепечки»; мемный шум.
- «fragrantica» - «поиск по нотам» на Fragrantica: про RAG и базы знаний.
- «film», «movie» - «sora film» и «flash movie ai бесплатно»; навигация к видеогенераторам.
- «вдв», «сту» - обрывки «генерировать фото вдв» и «проверка СТУ»; вузовские контексты.
- «улучшатель» разобран в тексте: prompt enhancer докручивает формулировки, но не решает, нужны ли примеры.
provod.ai — российский LLM API-агрегатор
Один OpenAI-совместимый endpoint вместо набора интеграций: подключайте модели к продукту, агентам, IDE и SDK через общий API. Во многих совместимых инструментах достаточно заменить base_url и API-ключ.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Цены 1:1 с официальными ценами провайдеров — без собственной наценки provod.ai. Оплата в рублях, единый баланс и документы для юридических лиц.
Если статья была полезной — попробуйте provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
FAQ
Сколько примеров класть в few-shot промпт в 2026 году?
По гайду prompt-architects.com (07.06.2026) оптимум - 2-5; больше размывает паттерн. Anthropic советует 3-5 в тегах <example>, Google требует единой структуры вплоть до разделителей. Самый показательный - последним: recency bias.
Работает ли few-shot с reasoning-моделями?
По гайду OpenAI (проверен 19.07.2026) o-серия часто не нуждается в примерах. Добавляешь - они обязаны строго соответствовать инструкции, иначе смещения.
Чем few-shot отличается от файнтюнинга?
Few-shot - примеры внутри контекста, без обновления весов. Файнтюнинг меняет саму модель - отдельный инженерный проект.
Могут ли плохие примеры ухудшить ответ?
Да: расходящиеся с инструкцией дают смещения (OpenAI), а избыток «переобучает» ответ на образцы (Google, 10.06.2026).
У выбора есть цена. следуешь Google «всегда добавляй примеры» - платишь токенами и рискуешь переобучить ответ на образцы; следуешь OpenAI «zero shot first» - рискуешь недожать формат там, где он критичен. Я бы прогнал свою задачу вместо веры гайдам. Ты с какой стороны?
Все модели из разбора доступны для такого прогона в одном месте: provod.ai - единый API, совместимый с OpenAI- и Anthropic-SDK, оплата в рублях с карты РФ, юрлицам - договор и закрывающие. Условия доступа и оплаты уточняй у provod.ai.
Источники
- S1 - arXiv:2604.00130v2, «Hierarchical Chain-of-Thought» (Hi-CoT) - https://arxiv.org/html/2604.00130v2
- S2 - arXiv:2506.14641, Cheng et al., «Revisiting Chain-of-Thought Prompting» - https://arxiv.org/abs/2506.14641
- S3 - OpenAI API Docs, «Reasoning best practices», проверено 19.07.2026 - https://platform.openai.com/docs/guides/reasoning-best-practices
- S4 - Google, «Prompt design strategies» (Gemini API), обновл. 10.06.2026 - https://ai.google.dev/gemini-api/docs/prompting-strategies
- S5 - Claude Docs (Anthropic), «Use examples (multishot prompting)» - https://docs.claude.com/en/docs/build-with-claude/prompt-engineering/multishot-prompting
- S6 - arXiv:2005.14165, Brown et al., «Language Models are Few-Shot Learners» - https://arxiv.org/abs/2005.14165
- S7 - arXiv:2202.12837, Min et al., «Rethinking the Role of Demonstrations» - https://arxiv.org/abs/2202.12837
- S8 - arXiv:2502.18600, Xu et al., «Chain of Draft» - https://arxiv.org/abs/2502.18600
- S9 - explainx.ai, «Zero-Shot vs Few-Shot vs Chain-of-Thought: Guide 2026» - https://explainx.ai/blog/zero-shot-few-shot-chain-of-thought-prompting-guide-2026
- S10 - prompt-architects.com, «Few-Shot vs Zero-Shot Prompting» - https://prompt-architects.com/blog/44-few-shot-vs-zero-shot-prompting


Top comments (0)