Почему «думай шаг за шагом» на самом деле не работает

Почему «думай шаг за шагом» на самом деле не работает

Года три подряд в любой статье про промпты советовали одно и то же: напиши «думай шаг за шагом», назначь модели роль эксперта, попроси её рассуждать как профессор — и точность вырастет сама собой. Свежий отчёт Wharton Prompting Science, который разбирали в одном из обзоров практики промпт-инжиниринга за сентябрь, аккуратно проверил эти советы на современных моделях. Результат неприятный: половина классики больше не работает, а часть советов вредит.

Миф 1: «Думай шаг за шагом» всегда повышает точность

Это самая живучая инструкция в промпт-инжиниринге. Логика понятна: заставь модель разложить рассуждение на шаги — и она не проскочит ошибку. Но на моделях с собственным режимом рассуждения эта фраза уже встроена в архитектуру, и добавлять её вручную — как просить человека подумать, пока он уже думает.

Wharton's second Prompting Science report found small gains on some reasoning models, worse results on another, and response times 20% to 80% longer. Several non-reasoning models also made new mistakes on easy questions after being told to reason step by step.

То есть эффект не просто «не работает» — он непредсказуемый. На одной модели прибавка на несколько процентов, на другой просадка, и везде — заметно дольше ответ. Если вы вставляете эту фразу в системный промпт по умолчанию, вы с равной вероятностью тратите токены впустую или портите результат.

Миф 2: роль эксперта в промпте делает ответы точнее

«Ты опытный юрист с 20-летним стажем» — классика жанра. Идея в том, что персона как бы подключает модель к более качественному «слою знаний». На практике персона влияет на тон и стиль, но не на фактическую корректность.

Wharton tested in-domain expert personas across six models and found no significant factual improvement across almost all of them. Более того, USC study saw MMLU accuracy fall as the persona became longer.

Получается обратный эффект: чем пышнее и детальнее вы описываете личность эксперта, тем выше риск, что модель начнёт «играть роль» вместо того, чтобы честно отрабатывать задачу. Персона — это инструмент голоса и тона, а не допуск к более достоверным фактам.

Миф 3: сложные схемы рассуждения работают в одном сообщении чата

Self-consistency, Tree of Thoughts, ReAct — приёмы, которые регулярно всплывают в списках «продвинутых техник промпт-инжиниринга». Проблема в том, что это не формулировки для одного запроса, а архитектуры из нескольких вызовов модели с агрегацией результатов.

  • Self-consistency требует нескольких независимых генераций и голосования между ними — одним сообщением это не воспроизвести.
  • Tree of Thoughts подразумевает ветвление и отбраковку путей рассуждения — тоже внешний цикл, а не текст промпта.
  • ReAct — это цикл «рассуждение-действие-наблюдение» с вызовом инструментов, а не красивая формулировка в одном окне чата.

Если скопировать название техники в промпт без самой оркестрации вокруг неё, модель в лучшем случае изобразит видимость многошагового рассуждения — без реального перебора вариантов.

Что реально работает: примеры вместо инструкций и проверка вместо веры

На фоне разочарований в «заклинаниях» вроде «думай шаг за шагом» один приём держится стабильно — показывать модели конкретный пример нужного формата или логики принятия решения, а не описывать его словами. Пример убирает двусмысленность там, где инструкция оставляет простор для интерпретации.

Второй рабочий принцип — не доверять промпту «на глаз», а проверять его на наборе реальных кейсов перед тем, как закладывать в постоянный шаблон. Подход, близкий к циклу из гайда OpenAI по GPT-5.2: выбрать модель и уровень рассуждения, прогнать оценки, скорректировать там, где результат не дотягивает, затем снова прогнать оценки. Без этого цикла правки промпта превращаются в игру на ощупь: правка строится в основном на интуиции по нескольким запомнившимся примерам, а новая версия может выглядеть лучше и незаметно портить случаи, которые вы не проверяли.

Разница между мифами выше и этим приёмом простая: формулировки типа «подумай как эксперт» пытаются управлять моделью словами и надеются на лучшее. Примеры и проверка управляют результатом — вы видите конкретный формат и конкретные ошибки, а не верите, что магическая фраза сработает именно в вашем случае.

Что с этим делать на практике

Если вы собираете промпты для бота, карточек товара или автоматизации контента, стоит пересмотреть привычный набор фраз:

  • убрать автоматическое «думай шаг за шагом» из шаблонов для рассуждающих моделей — проверить, действительно ли оно помогает именно в вашей задаче;
  • не раздувать описание роли эксперта — короткая персона для тона работает не хуже длинной для фактов;
  • не копировать названия сложных схем рассуждения в текст промпта без соответствующей оркестрации;
  • там, где промпт используется регулярно — держать набор тестовых примеров и проверять на них любые правки.

Промпт-инжиниринг не умер и не превратился в шаманство — просто часть советов, которые работали на моделях три года назад, перестала давать эффект на моделях с рассуждением. Проверка на реальных примерах решает больше, чем любая удачная формулировка.

Если хочется проверить эти наблюдения на своих задачах — в GEMERA AI доступны и рассуждающие, и классические модели GPT, Claude и Gemini в одном чате, так что сравнить разные подходы к промптам можно без лишних переключений между сервисами.