Claude ошибается, и Anthropic пишет об этом в собственной справке и просит тщательно проверять любые советы, от которых многое зависит. Выдуманную цифру или норму Claude называет тем же уверенным тоном, что и верную. А если вы засомневаетесь и возразите, он может извиниться и поменять ответ, хотя прав был он. Проверять ответ приходится тем, что от вашей уверенности не зависит: первоисточником, повтором вопроса, второй моделью, доводами за и против. Всё это можно сделать без специальных знаний. Данные в статье актуальны на 27 сентября 2026 года.
Разборы задач, которые предприниматели решают с Claude, выходят в нашем телеграм-канале про ИИ в бизнесе.
Языковая модель не сверяется с базой фактов. Она продолжает текст самым правдоподобным образом, и правдоподобная выдумка выглядит так же гладко, как правда. В справке Claude о неверных ответах, обновлённой 16 марта 2026 года, Anthropic называет это галлюцинациями и отдельно предупреждает о цитатах, которые звучат убедительно, но не основаны на фактах.
Технологическая компания Saturn задала 18 популярным моделям 121 вопрос о личных финансах по британским правилам: пенсии, налоги, долги, сбережения. По пересказу исследования в «Коммерсанте» от 21 сентября 2026 года модели в среднем ошибались в 57% ответов. Лучший результат показала Claude Opus 5 в режиме рассуждений, и даже она ошиблась в 39% ответов. Для человека, который сам налоги не считает, это больше трети советов с ошибкой, и отличить их от верных по тону нельзя.
Модели учат на оценках людей, и люди охотнее хвалят ответы, которые совпадают с их мнением. Anthropic описала эту угодливость ещё в 2023 году как общее свойство моделей, обученных на человеческих предпочтениях. В исследовании о том, как люди просят у Claude совета от 30 апреля 2026 года компания разобрала около 38 тысяч реальных разговоров, где люди спрашивали совета о своей жизни. Угодливость нашлась в 9% разговоров, где человек не спорил, и в 18% тех, где он возражал.
В описании Claude Opus 5.5 от 22 сентября Anthropic пишет, что галлюцинаций у новой модели по большинству показателей мало, но давлению пользователя она поддаётся немного сильнее, чем предыдущие.
В разговорах о жизненных советах Claude под нажимом чаще держится своего, чем уступает, но только по диалогу не видно, какой случай перед вами. Claude назвал цифру, вы написали «мне кажется, тут ошибка», модель извинилась и выдала другую. Исправилась она или отступила от верного ответа, из этого обмена репликами не понять.
На августовском эфире клуба AI Practiq один из участников спросил: «Что бы ты ни сказал, он соглашается и признаёт свою неправоту. Как понять, что вот это, что он сказал сейчас, точно то, к чему можно прислушаться». Сам он старается соглашаться с первым ответом Claude, потому что, начав спорить, начнёт в этом ответе сомневаться.
Другому участнику Claude при составлении плана питания назначил 200 граммов белка в день. Знакомый тренер назвал это вредной ерундой, и участник спросил у Claude, насколько такая норма научна. Claude признал, что 200 граммов пришли из старых программ бодибилдеров, что по современным данным нужно меньше 2 граммов на килограмм веса, и переписал план на 150 граммов. Вопрос о происхождении цифры дал то, что спор бы не дал: вместо новой цифры с потолка появился ориентир в граммах на килограмм, который можно сверить с открытыми рекомендациями.
Вторая модель замечает и то, что потерялось по дороге к первой. Ещё один участник в мае разобрал через Claude видео с отзывами клиентов своего заказчика по текстовой расшифровке, а на следующий день отдал сами ролики Gemini, который смотрит видео целиком. Во втором разборе нашлось 25–30% полезного, которое в расшифровку не попало. Claude в этом не ошибся, он ответил по тому, что получил, и увидеть пропуск в его ответе было нельзя.
Приёмы 1, 2 и 4 удобно держать одной припиской к любому важному вопросу.
Если не уверен или данных не хватает, так и скажи. К каждой цифре и норме дай источник со ссылкой. Перед выводом выпиши аргументы за и против и сделай вывод на их основе.
После ответа остаётся открыть ссылки и задать тот же вопрос другой модели в чистом чате.
В начале сентября vc.ru пересказал историю разработчика с Reddit. Ему нужно было выставить время для скриншотов iOS-приложения, и Claude Opus 5 предложил команду с правами администратора, которая меняла системную дату всего компьютера. Задачу можно было решить внутри симулятора iOS, но разработчик, по его признанию, скопировал команду, не прочитав. Дата на Mac сменилась на 4026 год, и компьютер перестал загружаться.
В коде согласие с первым ответом означает, что команда уже выполнена. Если вы не пишете код сами, в Claude Code хватает трёх просьб.
Налоги, договоры, цены и данные о клиенте перед переговорами Claude может готовить начерно, но решение и подпись остаются за человеком, который отвечает за них деньгами или репутацией.
Anthropic требует того же от компаний, которые строят на Claude сервисы для клиентов. В правилах использования, действующих с 15 сентября 2025 года, юридические, финансовые и медицинские советы отнесены к сценариям высокого риска, и такой совет до того, как дойти до человека, должен проверить квалифицированный специалист в этой области. Владельца бизнеса, который спрашивает о своих налогах, это правило не касается, но рассуждение то же.
Чего нет в тексте договора, модель не увидит, и такие пробелы разобраны в статье о рисках, которые нейросеть пропускает в договоре без юриста. Когда Claude Cowork перепутал юрлицо клиента перед встречей, ошибку поймала только проверка до разговора, иначе на переговорах она прозвучала бы как некомпетентность.
Если ошибка обойдётся дороже часа работы юриста или бухгалтера, ответ Claude стоит показать ему. На проверку уйдёт меньше времени, потому что Claude уже собрал выжимку и вопросы.
Почему Claude меняет ответ, если с ним не согласиться? Причина в угодливости, которой модели учатся на оценках людей. Смена ответа после возражения не говорит о том, какой из двух ответов верный.
Можно ли доверять Claude в финансовых вопросах? Только как черновику, который потом проверяют по первоисточникам или показывают специалисту. Тест Saturn был по британским правилам, и в российских налогах цифры модели стоит проверять тем более.
Помогает ли спросить «ты уверен?» Само по себе скорее мешает. В замере Anthropic на разговорах о личных советах угодливость при возражении выросла с 9 до 18%. Надёжнее спросить, на каком источнике основан ответ, и открыть этот источник.
Как понять, что Claude выдумал источник? Открыть ссылку и найти на странице утверждение, ради которого она дана. Если страницы нет или на ней написано другое, утверждение остаётся непроверенным.
Какая модель Claude ошибается реже? В финансовом тесте Saturn старшая модель ошиблась заметно реже младшей. Бесплатная Claude Haiku 4.5, по данным kod.ru, ошиблась в 82% ответов, Claude Opus 5 в режиме рассуждений — в 39%. Для важных вопросов стоит выбирать старшую модель и всё равно проверять ответ.
Нужен ли эксперт, если есть Claude? Для решений с деньгами и юридическими последствиями нужен. Claude подготовит ему выжимку и вопросы, но подпись под решением ставит человек.
Привычку соглашаться с первым ответом понять легко: стоит начать спорить, и сомневаться придётся во всём ответе, а спор всё равно ничего не доказывает. К ответу Claude можно прислушаться, когда его подтвердил открытый источник, повтор в чистом чате и вторая модель не нашли расхождений, а доводы за и против выдержали проверку по одному. Даже тогда решение с деньгами остаётся за вами.
Если такие разборы пригодятся и дальше, загляните в канал клуба AI Practiq.