Исследователи в области безопасности ИИ предупреждают о рисках для мониторинга готовящейся модели OpenAI Astra. По данным анонимного собеседника, при обучении применяется техника «рекуррентная глубина». Из-за этого Astra якобы демонстрирует исследователям меньшую долю своих промежуточных рассуждений по сравнению с другими передовыми моделями. OpenAI не подтвердила и не опровергла использование этой техники.
Что случилось
Внимание экспертов привлекла архитектурная особенность будущей модели Astra: анонимный источник утверждает, что «рекуррентная глубина» снижает наблюдаемость хода рассуждений. Речь идет о том, что система показывает меньшую часть промежуточных шагов, на основе которых формирует ответы. В сравнении с другими сильными ИИ-моделями это может означать более ограниченный доступ к внутреннему процессу принятия решений. Официальной верификации этих деталей от OpenAI на данный момент нет.
Почему это важно
Наблюдаемость критична для аудита ИИ-систем: когда эксперты видят промежуточные рассуждения, им проще выявлять ошибки, непредвиденные стратегии и потенциально опасные выводы. Если модель предоставляет меньше таких сигналов, командам по безопасности сложнее оценивать поведение системы и корректировать ее. Именно на этот риск и указывают исследователи применительно к Astra.
