Технологическая компания Saturn представила результаты исследования точности ответов популярных ИИ-чатботов на финансовые вопросы. Вывод простой и тревожный: модели нередко ошибаются, особенно когда задача требует нескольких последовательных расчетов.

Цифры и участники теста

В тестировании участвовали ChatGPT, Claude, Copilot, Grok и Gemini. По данным Saturn, при ответах на типовые финансовые вопросы ИИ давал неверные результаты в среднем в 57% случаев. Для более сложных запросов с несколькими расчетами доля ошибок возрастала до 88%.

Где особенно велик риск

Повышенная частота промахов на сложных задачах подчеркивает уязвимость генеративных моделей в сценариях, где критична точность вычислений. Saturn отдельно акцентирует, что такие промахи делают рискованным использование чатботов для налоговых задач и других финансовых кейсов.

Что это значит для пользователей

Результаты исследования сигнализируют: без проверки полагаться на генеративный ИИ в финансах нельзя. Автоматические ответы могут быть полезны как отправная точка, но финальные расчеты и решения требуют дополнительной валидации.