Технологическая компания Saturn представила результаты исследования точности ответов популярных ИИ-чатботов на финансовые вопросы. Вывод простой и тревожный: модели нередко ошибаются, особенно когда задача требует нескольких последовательных расчетов.
Цифры и участники теста
В тестировании участвовали ChatGPT, Claude, Copilot, Grok и Gemini. По данным Saturn, при ответах на типовые финансовые вопросы ИИ давал неверные результаты в среднем в 57% случаев. Для более сложных запросов с несколькими расчетами доля ошибок возрастала до 88%.
Где особенно велик риск
Повышенная частота промахов на сложных задачах подчеркивает уязвимость генеративных моделей в сценариях, где критична точность вычислений. Saturn отдельно акцентирует, что такие промахи делают рискованным использование чатботов для налоговых задач и других финансовых кейсов.
Что это значит для пользователей
Результаты исследования сигнализируют: без проверки полагаться на генеративный ИИ в финансах нельзя. Автоматические ответы могут быть полезны как отправная точка, но финальные расчеты и решения требуют дополнительной валидации.
