DEV Community

Cover image for «few-shot промптинг» в 2026 нужен только для формата - разбор свежих исследований
Promptra Team for Promptra

Posted on

«few-shot промптинг» в 2026 нужен только для формата - разбор свежих исследований

В гайде OpenAI для reasoning-моделей, актуальном на июль 2026, есть строка, которая ломает привычку нескольких лет: «Try zero shot first, then few shot if needed». А Google в гайде от 10 июня 2026 советует противоположное - всегда включать примеры. Два главных вендора дают взаимоисключающие рекомендации.

Привычка понятна: гайды 2023-2024 годов учили «всегда добавляй в промпт 3-5 примеров». С тех пор вышли работы, которые проверили привычку на современных моделях, - и она не выдержала проверки. Ниже - первоисточники и гайды на июнь-июль 2026: где few-shot ещё работает и как проверить всё на своей задаче за вечер.

Отдельная ставка: правильный ответ зависит от модели - Cheng et al. гоняли Qwen2.5, авторы Hi-CoT - Qwen3 и дистилляты DeepSeek-R1. Прогнать один A/B-тест на нескольких моделях проще через единый API: в provod.ai (российский OpenRouter) Qwen и DeepSeek живут рядом с флагманами OpenAI.

Что такое few-shot промптинг и откуда он взялся?

Коротко: это режим, когда вместе с задачей модели показывают несколько готовых примеров «вход - выход». Термины zero-shot, one-shot и few-shot ввела статья про GPT-3 в 2020 году - с тех пор примеры стали советом по умолчанию.

В работе Brown et al. «Language Models are Few-Shot Learners» (arXiv, 28 мая 2020) модель GPT-3 со 175 млрд параметров решала задачи, получая их чисто текстом: без градиентов и файнтюнинга. Zero-shot - только инструкция, one-shot - плюс один пример, few-shot - плюс горстка примеров. Модель «училась» прямо в контексте, и казалось, что примеры передают ей знание о задаче.

Потом пришёл chain-of-thought с «let's think step by step», и примеры начали клеить в задачи на рассуждение: покажи модели, как рассуждать, и она повторит. Эту логику и пошли проверять.

Что показали исследования 2025-2026: примеры перестали учить модель думать?

Коротко: для серии Qwen2.5 классические CoT-примеры не улучшили рассуждение по сравнению с zero-shot CoT; в этом исследовании их основная функция свелась к выравниванию формата ответа.

Главная работа - Cheng et al., «Revisiting Chain-of-Thought Prompting: Zero-Shot Can Be Stronger than Few-Shot» (arXiv 2506.14641, v1 17.06.2025, v3 08.01.2026). Связку «zero-shot CoT против few-shot CoT» проверили на серии Qwen2.5: примеры прироста не дают, их функция свелась к выравниванию формата.

Проверку усилили: взяли «улучшенные» примеры, построенные на ответах топовых Qwen2.5-Max и DeepSeek-R1. Не помогли - модели игнорируют экземпляры и фокусируются на инструкциях. Сколько процентов тут теряется, в абстракте нет, и выдумывать цифры я не буду - вывод качественный и однозначный.

Второй источник - Hi-CoT (arXiv 2604.00130, v2, 2026). Авторы осознанно работают в zero-shot парадигме, потому что, со ссылкой на Cheng et al., «CoT-экземпляры дают ограниченный прирост в рассуждении у современных LLM и в первую очередь служат для принуждения к формату вывода». Вместо примеров - структура, и она даёт то, что обещали от примеров.

Почему модель игнорирует твои примеры?

Коротко: потому что примеры и не передают «знания». Ещё в 2022 году Min et al. показали: примеры задают пространство меток, распределение входа и формат последовательности. Правильность их содержимого почти неважна.

В работе Min et al., «Rethinking the Role of Demonstrations» (arXiv 2202.12837, 25 февраля 2022), взяли 12 моделей, включая GPT-3, и случайно заменили правильные метки на неправильные. Результат на классификации и multi-choice почти не ухудшился: модель считывает с примеров, какие метки существуют, как выглядит вход и в каком формате отвечать, - а не «узнаёт», как решать задачу.

Отсюда механика: добавляя примеры, ты не учишь модель, а калибруешь интерфейс. Поэтому реакция разнится от модели к модели - у фронтир-модели «умение рассуждать» влито при обучении, слабой может не хватить и примеров. Люди чувствуют это интуитивно: в запросах вроде «зачем 2 моделма» (так ищут, зачем держать рядом DeepSeek и Qwen) кроется правильный вопрос - разные модели по-разному отзываются на один промпт.

Меня напрягает вот что: совет «добавь 3-5 примеров» тиражируется как универсальный, хотя четыре года известно, что примеры работают иначе. Гайды-2024 просто не дочитали Min et al.

Под какую задачу какая техника нужна в 2026 году?

Коротко: few-shot - для формата, стиля, кастомных меток и строгих схем вывода. Для рассуждений - zero-shot и thinking-режимы. Сводка на июнь-июль 2026 - в таблице.

Задача Техника первого выбора Почему
Математика, логика, многошаговый анализ zero-shot + thinking-режим рассуждение внутри модели; примеры не улучшают (Cheng et al.; OpenAI)
Строгий формат ответа (JSON, таблица, шаблон) few-shot «самый надёжный якорь формата» (explainx.ai, июнь-июль 2026)
Кастомная классификация по своим меткам few-shot примеры задают пространство меток (Min et al.; prompt-architects.com)
Экстракция по жёсткой JSON-схеме few-shot или structured output зона few-shot по explainx.ai
Фирменный tone of voice, перевод тональностей few-shot выигрыш у prompt-architects.com; у Anthropic - 3-5 примеров в <example>
Саммари, код, общие ответы zero-shot first примеры - только если формат «поехал» (OpenAI, проверен 19.07.2026)

За таблицей - реальный конфликт. OpenAI: «Try zero shot first, then few shot if needed», плюс предупреждение: примеры обязаны строго соответствовать инструкции, иначе смещения. Google в гайде от 10 июня 2026: всегда включайте few-shot примеры - они задают «формат, формулировки, рамки или общий паттерн ответа». Anthropic: multishot особенно эффективен для структурированного вывода, доза - 3-5 разнообразных примеров.

Противоречие снимается просто: все трое говорят про формат. OpenAI добавляет «для рассуждения не нужны», Google - нет, отсюда спор. Вывод: подобрать технику под задачу, а не под привычку.

Матрица «задача - техника»: few-shot закреплён за форматом, метками и стилем, рассуждения ушли к zero-shot и thinking-режимам

Чем заменить примеры в рассуждениях: структура вместо шотов?

Коротко: zero-shot CoT, thinking-режим и структурные промпты. Методы выигрывают формой рассуждения, а не количеством примеров, - и экономят токены.

Первая опора - встроенное «мышление»: по гайду OpenAI, reasoning-модели o-серии часто не нуждаются в примерах, «think step by step» для них излишне - рассуждение происходит внутри. Google пишет то же о Gemini 2.5 и 3.

Вторая - Hi-CoT, иерархический chain-of-thought с чередованием блоков <|instruction|> и <|execution|>. Чистый zero-shot метод: в среднем +6.2% к точности (до 61.4% на отдельных связках) при сокращении reasoning-трассы на 13.9% против обычного CoT - замеры на 13 конфигурациях (Qwen3 от 0.6B до 32B, дистилляты DeepSeek-R1) и 5 математических бенчмарках. При строгом следовании формату точность доходит до 100% на AMC и MATH500, трасса режется до 75%. Ключевым фактором оказалась структура, а не примеры.

Третья - Chain of Draft (arXiv 2502.18600, 25 февраля 2025): лаконичные «черновые» шаги вместо развёрнутого CoT, точность на уровне или выше при расходе от 7.6% токенов. Урок тот же: выигрыш даёт форма рассуждения, а не объём подсказок.

Чего few-shot не решает?

Коротко: безопасность, модерацию, пробелы в знаниях и слабость малых моделей. Примеры - инструмент формата, и требовать большего - типичная ошибка.

Начну с границы, о которой спрашивают чаще всего. Никакие примеры не отключают фильтры платформы: запросы на обнаженных людей, инструкции в духе «сосет по фото» и прочий explicit-интент уходят в отказ, у Grok такие перехваты видны как пометка «content moderated». Модерация живёт выше уровня промпта, few-shot тут бессилен - как и jailbreak-конструкции. Инструкций по обходу не будет: это зона отказа, а не промптинг.

Вторая граница - знания. Примеры не обновляют знания модели и не заменяют RAG, но могут передавать факты, метки и контекст конкретной задачи. Для знаний нужны RAG и источники, не шоты.

Третья - слабые модели. В ограничениях Hi-CoT записано: самые маленькие (Qwen3-0.6B, DeepSeek-R1-Distill-Qwen-1.5B) часто не удерживают заданную структуру, прирост маргинален - есть порог reasoning-способности. Для локальных моделей класса llama 3.2 11b жёсткий формат и пара примеров могут быть ещё нужнее, чем для фронтир-моделей.

И четвёртое, бытовое: сервисы-«улучшатели» промптов (prompt enhancer) не заменяют понимания механики. Улучшатель докрутит формулировки, но решение «нужны ли примеры под эту задачу» за тебя не примет.

Работает ли few-shot у генераторов картинок?

Коротко: в текстовом смысле - нет. Пары «вход - выход» в промпт image-модели не вставишь; роль шотов играют слова-якоря.

Люди ищут это массово, просто в других словах: «фото в стиле gta», «ai character draw», «gemini draw», «flux lighting», «qwen image lighting», «midjourney color», «kling color», «pic to pic». За каждым запросом - потребность few-shot: зафиксировать формат результата. Только якорем служит набор маркеров: lighting для света, color для палитры, название стиля для композиции.

Параллель точная: как в тексте примеры задают паттерн ответа, в картинках паттерн задают якорные слова. И как избыток примеров «переобучает» ответ (Google, 10.06.2026), перегруз якорями размывает сцену. Механика одна, поверхность разная.

Как проверить всё это на своей задаче за один вечер?

Коротко: берёшь 20-30 реальных входов, гоняешь два варианта промпта (zero-shot против few-shot) на 3-5 моделях и считаешь, где формат стабильнее и ответы точнее. Никакая статья - включая эту - не заменит прогон.

  1. Собери 20-30 типичных входов из своей задачи - тех, что приходят в прод.
  2. Сделай два промпта: чистая инструкция (zero-shot) и она же плюс 2-5 примеров. По гайду prompt-architects.com (07.06.2026) больше 5 примеров «размывает» паттерн, самый показательный ставь последним - действует recency bias.
  3. Прогони оба варианта на 3-5 моделях: поведение примеров различается от модели к модели, это и есть главное измерение.
  4. Считай три метрики: соблюдение формата, точность по твоей проверке, расход токенов.
  5. Оставь технику, выигравшую на твоих данных, а не в чужом гайде.

Прогон - один цикл, где модель меняется одной строкой конфигурации. Единый API provod.ai совместим и с OpenAI-SDK (/v1/chat/completions), и с Anthropic (/v1/messages): тест заводится из России сменой ключа и base_url на https://api.provod.ai/v1 без переписывания кода. Один баланс в рублях на весь прогон, оплата картой РФ или СБП по ценам официальных провайдеров без наценки, для юрлиц - договор и закрывающие. Для локальной проверки на модели класса 11b пайплайн тот же, только железо своё.

Когда provod.ai не подходит

Коротко: когда задача решается одной фирменной подпиской вендора, когда нужен on-prem или fine-tuning, и когда A/B-тест уже прогнан, а разницы нет.

Если вся работа живёт внутри одного фирменного приложения с памятью и проектами, а модель одна - агрегатор ничего нового не даст: подписочные фичи вендора он не воспроизводит. Нужны on-prem, дообучение на своих данных или прямой enterprise-контракт ради SLA - тоже мимо. И честный случай: прогнал тест и увидел, что задаче хватает zero-shot на одной дешёвой модели? Отлично - ты сэкономил на примерах и инструментах.

Словарик запросов кластера

Рядом с темой в поиске плавает много странного. Разбираю, что ищут и куда это ведёт.

Обходы и взрослый шум.

  • «panda», «gyno» - обрывки jailbreak-запросов к ChatGPT; примерами модель не «сломать», это зона фильтров, не промптинга.
  • «pornopop», «undress», «раздеватор18», «mike», «видио», «восемнадцать» - «раздеваторы» фото; adult-сервисы вне темы и вне правил платформ.
  • «юноши», «лобками», «новорожденного» - генерация тел и лиц; с реальными людьми - юридическая мина.
  • «партнером» - «фото поцелуй с партнёром»: сведение снимков image-редактором.
  • «одиночество», «фентази», «ть» - обрывки про ИИ-собеседника, «видео фантазии», «ть фото ия бесплатно»; смысла нет.

Сервисы «оживить и улучшить фото».

  • «bigipg», «fasee», «zawa», «zyro», «impulscaler» - апскейлеры и улучшатели фото.
  • «homiwork», «storiko», «videomaker», «vidfulai», «vling», «zevs», «zeusgpt», «yolla», «leiapix», «megakadr», «mangoai», «neuralnetworks», «visualgpt», «vidlin», «fly», «hotpot», «imgur», «баноно», «визардио», «rdio», «quin», «vizerd» - сервисы «оживить фото» и «видео из фото»; имя меняется, суть одна.
  • «jpg», «видеопо», «818», «4630300», «2к17», «1э» - обрывки с форматами и номерами («улучшить jpg», «замена лица 4630300»); сервиса за номером нет.
  • «поврежденных», «потертого», «открыванию», «объединенные», «соединенные», «оживленным», «оживленными» - реставрация: повреждённых родных с потёртого снимка, открывание глаз, объединённые и соединённые кадры.
  • «redmagic», «иос26» - «отключить ИИ-улучшение на Redmagic», «изменять фото на iOS 26»; вопросы к настройкам устройства.
  • «nmkd» - локальный GUI для Stable Diffusion.
  • «автокад» - «нейронка автокад»; генеративный дизайн в CAD, не промптинг.
  • «klerk» - «grok бесплатно klerk ru»; навигация к статье на «Клерке».

Опечатки, имена и загадки.

  • «тоха» - самый частотный мусорный запрос кластера: «тоха смотреть видео про себя нейросеть»;; вирусный персонаж..
  • «бриали», «вандама», «дефассье» - так ищут «Жан-Клода»: Бриали и Ван Дамма смешали с Claude; Дефассье - реальный Лоран Луи Клод.
  • «гигачта», «зефс» - опечаточные написания GigaChat и Zeus.
  • «коля», «масип» - «нейро Коля» и обрывок «масипнуть пасту, Алиса»; чат-боты и голос-команды.
  • «нологи» - «майнкрафт на русский нолог»: летсплеи.
  • «мураками», «натали», «радуга», «malinova», «lady» - музыкальный шум: «мураками привет алиса», кавер «Натали», «радуга дэш», «DJ Malinova», «lady gaga runway».
  • «газонокосилках» - «чей двигатель на газонокосилках GPT»; аббревиатуру приняли за бренд.
  • «мэт» - «объединить фото мэт пейнтинг»: фоторедактор с опечаткой.
  • «кошечки», «тойчик», «тихонечко», «перепечки» - милые ролики, вирусные видео и «разбор перепечки»; мемный шум.
  • «fragrantica» - «поиск по нотам» на Fragrantica: про RAG и базы знаний.
  • «film», «movie» - «sora film» и «flash movie ai бесплатно»; навигация к видеогенераторам.
  • «вдв», «сту» - обрывки «генерировать фото вдв» и «проверка СТУ»; вузовские контексты.
  • «улучшатель» разобран в тексте: prompt enhancer докручивает формулировки, но не решает, нужны ли примеры.

provod.ai — российский LLM API-агрегатор

Один OpenAI-совместимый endpoint вместо набора интеграций: подключайте модели к продукту, агентам, IDE и SDK через общий API. Во многих совместимых инструментах достаточно заменить base_url и API-ключ.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Цены 1:1 с официальными ценами провайдеров — без собственной наценки provod.ai. Оплата в рублях, единый баланс и документы для юридических лиц.

Если статья была полезной — попробуйте provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

FAQ

Сколько примеров класть в few-shot промпт в 2026 году?
По гайду prompt-architects.com (07.06.2026) оптимум - 2-5; больше размывает паттерн. Anthropic советует 3-5 в тегах <example>, Google требует единой структуры вплоть до разделителей. Самый показательный - последним: recency bias.

Работает ли few-shot с reasoning-моделями?
По гайду OpenAI (проверен 19.07.2026) o-серия часто не нуждается в примерах. Добавляешь - они обязаны строго соответствовать инструкции, иначе смещения.

Чем few-shot отличается от файнтюнинга?
Few-shot - примеры внутри контекста, без обновления весов. Файнтюнинг меняет саму модель - отдельный инженерный проект.

Могут ли плохие примеры ухудшить ответ?
Да: расходящиеся с инструкцией дают смещения (OpenAI), а избыток «переобучает» ответ на образцы (Google, 10.06.2026).

У выбора есть цена. следуешь Google «всегда добавляй примеры» - платишь токенами и рискуешь переобучить ответ на образцы; следуешь OpenAI «zero shot first» - рискуешь недожать формат там, где он критичен. Я бы прогнал свою задачу вместо веры гайдам. Ты с какой стороны?

A/B-прогон одного промпта на пяти моделях через единый API provod.ai

Все модели из разбора доступны для такого прогона в одном месте: provod.ai - единый API, совместимый с OpenAI- и Anthropic-SDK, оплата в рублях с карты РФ, юрлицам - договор и закрывающие. Условия доступа и оплаты уточняй у provod.ai.

Источники

Top comments (0)