Чат-боты дают неправильные ответы на финансовые вопросы в среднем в 57% случаев. При сложных запросах, где требуется провести несколько расчетов или учесть одновременно несколько условий, показатель ошибок возрастает до 88%, в наиболее сложных сценариях отдельные модели ошибаются в 99% случаев. К такому выводу пришли исследователи финтех-компании Saturn, результаты их работы приводит Financial Times.
Авторы исследования протестировали 18 коммерческих ИИ-моделей и задали им более 10 тыс. вопросов о налогах, кредитах, ипотеке, пенсионных накоплениях, сбережениях и займах. Среди протестированных систем были ChatGPT, Claude, Gemini, Grok и Copilot. Каждый вопрос отправляли моделям несколько раз, чтобы проверить стабильность ответов.
Проблема оказалась не только в математических ошибках. Чат-боты могли не учитывать важные условия, использовать устаревшие налоговые правила или ссылаться на несуществующие нормы. При этом формулировки ответов зачастую выглядели достаточно убедительно, чтобы пользователь мог принять их за профессиональную консультацию.
Платная подписка также не стала гарантией точности. По данным исследования, бесплатные версии моделей ошибались в 63% случаев, платные — в 49%. Даже модель с лучшим результатом допустила ошибки примерно в четырех из десяти проверенных случаев.
Исследователи отмечают, что особенно уязвимы пользователи, которые обращаются к ИИ за финансовым советом именно потому, что не разбираются в теме. Если человек не знает правильного ответа заранее, ему сложно заметить ошибку в уверенно написанной рекомендации.
Исследование провели на фоне роста доверия пользователей к ИИ в финансовых вопросах. По данным британского регулятора Financial Conduct Authority, 26% потребителей уже используют или готовы доверять универсальным ИИ-инструментам при получении финансовых советов.
