← lazyaram.ru

Почему ИИ отвечает вам хуже, чем мог бы

Арам Маркарян · 4 октября 2026 · 10 минут

Я давно заметил, что разные люди по-разному пользуются Claude Code, и уровень использования инструмента сильно меняет весь опыт, особенно первичный.

Впервые я с этим столкнулся, когда установил жене Claude Code, и у нее была задача проанализировать переписки ее цветочного магазина в Telegram, чтобы заготовить скрипты и потом оптимизировать общение с клиентами или улучшить его.

Я помню, что аналогичная задача когда-то была у меня в Seller Mate, и тогда это решилось очень просто: я помнил про Telethon. Через него программа заходит в телегу от твоего имени и может все то же, что ты в приложении: читать чаты, искать по ним, отвечать.

Потом я сидел с женой, и она запустила Claude Code с той же задачей. Клод ей предлагал сделать экспорт чатов и закинуть их, чтобы он проанализировал. Меня это удивило, потому что зачем так делать? Достаточно же просто подключить Telethon и вообще регулярно этим пользоваться, потому что, скорее всего, задача не одноразовая. И это буквально быстрее, чем руками скачивать 100, 200 переписок с клиентами.

В общем, я задумался: почему так происходит? А так происходит, потому что Claude Code изначально предлагает самое простое решение. Это значит, что если ты в какой-то области не обладаешь знаниями, скорее всего, он будет давать тебе самое простое решение, которое не факт, что самое лучшее. При том, что возможность использовать лучшие решения благодаря ИИ теперь есть у каждого. Так оказываешься в эхо-камере: он отражает тебя, твое мнение, твои способности, что плохо с точки зрения роста и развития.

Одна фраза меняет совет

Встал вопрос, можно ли решить эту проблему. Для начала надо было убедиться, что качество выдачи действительно зависит от того, как ты задаешь вопрос. Понятно, что это очевидно, но все равно хотелось убедиться. Поэтому я запустил отдельные чистые сессии, без памяти и настроек, где задавал вопросы разного уровня в одной тематике, и смотрел на выдачу.

Естественно, где человек задавал вопрос правильнее, Клод предлагал более сложные решения. И вывел формулу: если просить не просто решение, а набор решений, и еще попросить дать не самое простое, а лучшее, он работает совсем иначе.

Как часто сильное решение становится главным советом

5 бытовых задач × 3 прогона = 15 ответов на каждую формулировку. Задачи: переписки с клиентами в Telegram, падает выручка магазина, посчитать посетителей по камере, какие статьи блога приводят клиентов, напоминания клиентам в WhatsApp.
Просто вопрос
8 из 15
+ «Я не специалист в этом»
8 из 15
+ «Какие есть способы, от самого простого до самого мощного?»
11 из 15
+ «Изучи, как это делают на рынке»
11 из 15
+ «Если решение ручное, скажи, как сделать, чтобы работало само»
13 из 15
+ «Не предлагай самый простой вариант, предложи лучший, даже если он сложнее»
15 из 15
то же + «Я не специалист в этом»
11 из 15
Свод правил в настройках Claude (см. ниже)
15 из 15
Что считали простым и сильным решением

Критерии записал заранее, до прогонов. Цифры: сколько раз из 3 прогонов сильное решение было главным советом - без подсказки и с фразой «предложи лучший».

Переписки с клиентами в Telegram
Простое: разово выгрузить чаты из Telegram Desktop и отдать файл.
Сильное: постоянный автоматический сбор переписок (Telethon, бот через Telegram Business или CRM) и регулярный анализ.
0 из 3 → 3 из 3
Падает выручка магазина
Простое: общий список возможных причин (маркетинг, ассортимент, сезон).
Сильное: разложить выручку на посетителей × конверсию × средний чек, сравнить с прошлым годом и найти, что именно упало.
3 из 3 → 3 из 3
Посчитать посетителей, есть камера
Простое: считать вручную по записям или купить отдельный счетчик.
Сильное: автоматический подсчет по той же камере (встроенная видеоаналитика или компьютерное зрение).
3 из 3 → 3 из 3
Какие статьи блога приводят клиентов
Простое: смотреть просмотры и популярные страницы.
Сильное: считать заявки и привязывать каждую к статье, с которой человек пришел.
1 из 3 → 3 из 3
Напоминания клиентам в WhatsApp
Простое: отправлять вручную или через неофициальные рассыльщики (риск бана).
Сильное: автоматические напоминания по официальному каналу (встроенные в систему записи или WhatsApp Business API).
1 из 3 → 3 из 3

Интересно, что «я не специалист» сам по себе ничего не меняет, но гасит эффект просьбы о лучшем: 11 из 15 вместо 15. Модель честно подстраивается под собеседника и упрощает.

Может ли новичок дотянуться до профи

Все равно стоял вопрос: если у тебя нет знаний в этой сфере, можешь ли ты достигнуть такого же результата, как профессионал? Я запустил новый эксперимент на 10 сложных темах (опреснитель для деревни, свой спутник, пассивный дом и другие) и строил лестницу вопросов, которая помогает новичку приблизиться к профессионалу.

Вот как это выглядит на одной задаче: в деревне у моря нет пресной воды.

Вопрос с нуля
Клод советует брать воду из колодцев понемногу, чтобы туда не затянуло морскую, и собирать дождевую.
С нуля + «предложи лучший, а не простой»
Поставить опреснитель на солнечных панелях, который работает только днем, а на ночь и пасмурные дни запасать готовую воду в баках. Так не нужны дорогие аккумуляторы.
Вопрос профессионала
Как управлять установкой, когда солнце садится и мощности не хватает, и какая примесь в воде задает предел очистки. Это уже уровень инженера.

Лестница выглядит так. Сначала спросить, какие вопросы по этой задаче задал бы профессионал. Потом ответить на них про свою ситуацию простыми словами, без терминов. И добавить свою догадку, даже наивную, например «думаю, больше аккумуляторов или генератор на зиму».

Глубина ответа в зависимости от вопроса

Оценка от 1 (общие слова) до 10 (уровень сильного инженера). Две модели оценивали каждый ответ вслепую, не видя вопроса; здесь среднее двух оценок. 10 тем, 20 ответов на каждую строку. Доверительные интервалы в таблице ниже.
Новичок
Вопрос с нуля
4,0
+ «предложи лучший, а не простой»
5,1
Лестница: + «какие вопросы задал бы профи?»
5,4
Лестница: + ответы про свою ситуацию
6,5
Лестница: + своя догадка
6,6
Для сравнения: вопросы людей, которые разбираются
Начинающий
4,9
Немного разбирается
6,3
Практик
7,8
Суперпрофи
8,5
Все цифры с интервалами

Глубина - среднее двух оценщиков из 10. Интервал: в каком диапазоне скорее всего лежит настоящее среднее (95%). План - насколько по ответу можно начать делать: 0 нет плана, 3 этапы с цифрами и сроками.

Как спросилиГлубина95% ДИПлан, 0–3
Вопрос с нуля4,03,8–4,21,5
+ «предложи лучший»5,14,8–5,42,5
Лестница: вопросы профи (2 сообщения)5,45,1–5,72,9
Лестница: вопросы профи (1 сообщение)5,95,7–6,12,9
Лестница: + свои факты6,56,2–6,73,0
Лестница: + свои факты и догадка6,66,4–6,83,0
Начинающий4,94,6–5,21,9
Немного разбирается6,36,0–6,52,3
Практик7,87,6–7,92,6
Суперпрофи8,58,3–8,72,5

Оказалось, что через лестницу можно получить результат намного лучше, чем одним запросом «дай лучшее решение». До профи она не дотягивает, но закрывает больше половины разрыва. При этом план у лестницы лучший из всех вариантов, даже лучше, чем у вопросов профи. Последний шаг до профи только через знания: профессионал знает, между какими вариантами вообще выбирают.

Отдельно интересно, почему сами вопросы профи без твоих ответов мало что дают. Почти все они оказались про твою ситуацию: где деревня, сколько людей, какой бюджет. Ответить на них за тебя модель не может и честно пишет «вы не указали, беру типичный сценарий».

Что говорят компании и наука

Об этом говорят и сами компании. Anthropic измерил, что Клод умеет отвечать очень сложно, но делает это, когда сложный вопрос: уровень сложности запроса и ответа совпадает почти полностью (корреляция выше 0,92). В документации пишут прямо: хотите больше обычного, просите явно. У Google про Gemini то же самое.

Почему модели поддакивают

А эхо-камера вообще следствие обучения: людям больше нравятся ответы, где с ними соглашаются.

Кому ИИ помогает, а кого подводит

Это ровно моя картина: новичок не видит, что ему дали простой или поддакивающий ответ, и доволен им.

Что делать

Поэтому мой вам совет:

  1. Просите не решение, а варианты от простого до сильного и лучший, а не самый простой.
  2. В незнакомой теме спросите, какие вопросы задал бы профессионал, и ответьте на них про свою ситуацию.
  3. Добавьте свою догадку, даже наивную, модели есть с чем спорить.
  4. Не пишите «я не разбираюсь», это снижает уровень ответа.

Свод правил, который я дописал Клоду в настройки (дал 15 из 15 на бытовых задачах):

Если в какой-то момент вам кажется, что он тупой, исполняет что-то не так и вы получаете не лучший результат, есть очень высокая вероятность, что вы действительно не так спрашиваете. Страшнее это осознать, когда ты думаешь, что хорошо задаешь вопросы, а оказывается, что вообще не хорошо. И особенно это часто у тех, кто очень много им пользуется, но не вылезает из эхо-камеры.

Как я это проверял

Модель. Claude Code на модели Claude Opus 5.5, каждый прогон в чистой сессии: без памяти, без настроек, без дополнительных навыков и без доступа к интернету и файлам. То есть так, как ответил бы человек, который только поставил программу. Всего около 370 ответов.

Эксперимент 1, бытовые задачи. 5 задач, сформулированных как у обычного человека, например «хочу проанализировать переписки с клиентами в телеграмм». К каждой добавлял одну приписку или ничего, по 3 прогона на вариант. Для каждой задачи заранее, до прогонов, записал, какое решение считать сильным: например, для переписок это постоянный автоматический сбор, а не ручная выгрузка. Отдельная модель (Claude Sonnet) читала ответ и отмечала, стало ли сильное решение главным советом.

Эксперимент 2, сложные темы. 10 тем: солнечная станция для дома без сети, кубсат, культивированное мясо, распознавание речи для малого языка, опреснитель, своя языковая модель, раннее оповещение о землетрясениях, пассивный дом, мониторинг вырубок по спутнику, доставка лекарств дронами. К каждой написал вопросы пяти уровней, от полного нуля до суперпрофи, и варианты лестницы. По 2 прогона, 199 ответов. Каждый ответ вслепую, не видя вопроса, оценили две модели (Claude Sonnet и Claude Opus) по шкале глубины от 1 до 10, плюс план, риски и пользу для профессионала.

Насколько можно верить оценкам. Две модели-оценщика сошлись сильно: корреляция 0,91, в среднем расходятся на 0,4 балла. Интервалы на графике посчитаны бутстрэпом по 20 ответам в строке.

Ограничения.

Источники

  1. Anthropic Economic Index, «Economic primitives», 15.01.2026. anthropic.com
  2. Anthropic, Prompting best practices. platform.claude.com
  3. Google, Gemini API: prompt design strategies. ai.google.dev
  4. OpenAI, «Expanding on what we missed with sycophancy», 02.05.2025. openai.com
  5. Wei et al., «Simple synthetic data reduces sycophancy in large language models», Google DeepMind, 2023. arXiv:2308.03958
  6. Anthropic, «How people use Claude for personal guidance», 30.04.2026. anthropic.com
  7. Cheng, Lee, Khadpe, Yu, Han, Jurafsky, Science 391, 26.03.2026. doi:10.1126/science.aec8352
  8. Brynjolfsson, Li, Raymond, «Generative AI at Work», NBER w31161 (QJE, 2025). nber.org
  9. Dell'Acqua et al., «Navigating the Jagged Technological Frontier», HBS Working Paper 24-013, 2023. hbs.edu
  10. Otis, Clarke, Delecourt, Holtz, Koning, «The Uneven Impact of Generative AI on Entrepreneurial Performance», HBS Working Paper 24-042 (цифры немного отличаются между версиями статьи). doi:10.2139/ssrn.4671369
  11. Lee et al., «The Impact of Generative AI on Critical Thinking», Microsoft Research, CHI 2025. microsoft.com