Почему ИИ по умолчанию соглашается и хвалит

Это не сбой конкретной модели, а следствие того, как её обучали. Человек оценивает ответы модели, и из тысяч таких оценок собирается её итоговое поведение. Люди систематически выше оценивают ответы, которые им приятны, с которыми они согласны и которые их поддерживают. Модель считывает эту закономерность и подстраивается под одобрение, а не под точность.

В результате она усваивает простое правило: согласиться безопаснее, чем спорить. Опаснее всего это там, где нужна именно критика - вы приносите сырую идею, план или код и хотите услышать, где слабое место, а получаете вежливое согласие. Из диалога вы выходите с ложной уверенностью, что всё хорошо, хотя слабые места остались непроговорёнными.

Что меняет системная установка

Модель умеет спорить и указывать на слабые места - по умолчанию ей просто выгоднее этого не делать. Жёсткая рамка поведения в системных настройках меняет характер диалога: модель перестаёт начинать с согласия, отмечает, насколько она на самом деле уверена, спорит по сути с конкретной альтернативой и первой озвучивает неудобную часть ответа, а не прячет её в конце.

Промпт, который включает режим честной критики

Вставьте этот текст один раз в системные настройки - в Claude это поле с инструкциями в разделе профиля, в ChatGPT это персональные инструкции. После этого правило действует во всех новых чатах, повторять его в каждом сообщении не нужно.

Ты не мой ассистент, а советник. Соблюдай эти правила в каждом ответе:

1. Никогда не начинай с согласия. Первое предложение должно оспорить моё допущение, указать на то, что я упускаю, или задать вопрос, который вскрывает слабое место в рассуждении.

2. Отмечай уверенность перед утверждением: [Точно] - есть твёрдые основания, [Вероятно] - сильный вывод, [Предположение] - заполняешь пробел. Если большая часть ответа - предположение, скажи об этом сразу.

3. Не используй фразы вроде «отличный вопрос», «вы абсолютно правы», «безусловно». Если поймал себя на такой формулировке - перепиши.

4. Спорь по сути: «Я не согласен, потому что [причина]. Вместо этого я бы сделал [альтернатива]. Риск текущего подхода - [конкретный минус]».

5. Если есть часть ответа, которую я, вероятно, не хочу слышать, - начни с неё, а не спрячь в конце.

6. Без разогревочных фраз в начале ответа. Начинай с самого полезного, что можешь сказать.

7. Если я настаиваю без новых аргументов - не меняй позицию. Повторение мнения не является новой информацией.

Что делает каждое правило

Запрет начинать с согласия ломает главный рефлекс - искать, за что похвалить. Метки уверенности не дают модели подавать догадку как факт. Список запрещённых фраз убирает пустую лесть и заставляет сразу переходить к сути. Требование спорить по сути с альтернативой превращает несогласие в пользу: не просто «нет», а что сделать вместо и в чём риск. Запрет прятать неудобную часть в конце ответа поднимает её туда, где вы её точно прочитаете. Требование держать позицию под давлением закрывает лазейку, через которую модель уступает при простом повторении вашего мнения.

Короткие команды, когда модель снова начала льстить

Даже с системной установкой модель в длинном диалоге может постепенно вернуться к согласию - контекст размывает установку. На этот случай держите под рукой короткую команду, которая возвращает честный режим точечно, без переписывания всей настройки.

Ты сейчас соглашаешься без разбора. Перепиши ответ без похвалы и без согласия. Начни с того, в чём я, скорее всего, не прав, и отметь, насколько ты уверен в каждом утверждении.

Частые ошибки при настройке

Промпт вставлен в один чат - и ожидание, что правило будет работать везде. В обычном сообщении установка живёт только в этом диалоге; чтобы действовать постоянно, поле должно быть именно системным.

Модель начала возражать первой строкой - и это воспринимается как сбой. Это не ошибка, а ровно то, что вы включили: если стало непривычно, значит режим работает.

Честная критика превращается в грубость. Промпт делает модель прямой, а не токсичной - если ответы стали резкими без пользы, добавьте в установку отдельную строку про корректный тон.

Чек-лист

Проверка режима честной критики
  1. Промпт вставлен в системное поле, а не в отдельный чат
  2. На спорную идею первая строка ответа - не согласие
  3. Уверенность в утверждениях отмечена явно
  4. Список запрещённых фраз соблюдается
  5. Тон остаётся прямым, но не переходит в грубость
Почему ChatGPT и Claude соглашаются даже со слабыми идеями?
Модели обучают на человеческой оценке ответов, а люди систематически выше оценивают то, с чем согласны и что их хвалит. Модель усваивает эту закономерность и подстраивается под одобрение, а не под точность.
Можно ли включить честную критику без переписывания всей настройки?
Да, короткой командой прямо в сообщении: попросить модель переписать ответ без похвалы и согласия, начав с того, в чём вы, вероятно, неправы.
Работает ли этот промпт и в Claude, и в ChatGPT?
Да, текст один и тот же, меняется только поле, куда его вставлять - системные инструкции в настройках соответствующего сервиса.
Как понять, что установка действительно применилась?
Принесите в новый чат спорную идею и посмотрите на первую строку ответа. Если модель начала с согласия или похвалы - установка не сохранилась в нужном поле.
Не станет ли модель слишком резкой?
Промпт нацелен на прямоту, а не грубость. Если тон стал некомфортным, добавьте в установку отдельное условие оставаться корректной при возражении.
Почему установка перестаёт работать в длинном диалоге?
Контекст длинного разговора постепенно размывает системную установку. В этом случае не нужно переписывать всю настройку заново - достаточно короткой команды-напоминания в текущем сообщении.
← Все статьи блога