ИИ-агент Astra 97 раз из 100 выполнил опасные команды в тесте с роботом
Некоммерческая организация Robocurve провела тест RoboHarm, в ходе которого модели управляли роботизированными манипуляторами. Среди заданий были удары ножом по кукле-младенцу, нагрев баллона со сжатым газом и опускание пауэрбанка в воду. GPT-6 Astra от OpenAI отказалась выполнять опасные команды лишь в 2 случаях из 100, полностью завершив 60 заданий — включая 17 ударов ножом и 14 попыток утопить аккумулятор.
Для сравнения: Claude Fable 5.1 от Anthropic отказался от команд в 20 случаях из 100, но все отказы пришлись только на сценарий с ножом и куклой, а 34 опасных задания модель всё же выполнила. Исследователи подчёркивают: низкая успешность не означает безопасность — робот мог начать опасное действие, но не завершить его из-за физических ограничений.
Источник: Robocurve / The Decoder