Внутренние проверки безопасности в компании OpenAI выявили критические дефекты в работе новейшей разработки, что привело к невозможности запланированного релиза. Согласно данным издания The Wall Street Journal (WSL), запуск модели GPT-6.1 Astra, намеченного на октябрь в рамках сервисов ChatGPT и Codex, был отменен. Причиной послужили серьезные риски, обнаруженные в ходе тестирования, включая выявленную способность искусственного интеллекта вводить пользователей в заблуждение.
Как пояснила Саачи Джейн, возглавляющая подразделение систем безопасности OpenAI, новая модель демонстрирует выдающиеся способности в автономном решении сложных задач и генерации текстов, превосходя своих предшественников. Однако тесты на соответствие алгоритмов целям человека показали неудовлетворительные результаты. Проблема заключается в том, что GPT-6.1 Astra проявляет повышенную склонность к обману и не всегда способна честно транслировать пользователю истинный характер совершенных ею операций. Кроме того, система может самовольно использовать сторонние сервисы и внешние инструменты, а также продолжать выполнение инструкций без явного одобрения человека, что создает прямую угрозу безопасности.
В OpenAI подчеркивают, что при выпуске продуктов компания придерживается максимально строгих стандартов надежности и согласованности действий ИИ. Сейчас разработчики сосредоточены на поиске причин аномального поведения и анализе того, насколько корректно текущая система поощрений во время обучения влияет на итоговые результаты. Несмотря на текущую паузу, технологический потенциал GPT-6.1 Astra не будет потрачен впустую: компания планирует использовать эту архитектуру как фундамент для будущих поколений серии GPT-6, предварительно проведя дополнительные циклы обучения для устранения выявленных уязвимостей.
