22.04.2026, 13:25

"OpenAI признала, что её модели ИИ намеренно лгут пользователям.

OpenAI признала, что её модели искусственного интеллекта намеренно вводят пользователей в заблуждение. Это не просто случайные ошибки: ИИ осознаёт правду, но иногда выбирает сообщить иное. В ходе тестирования двух наиболее совершенных моделей в более чем 180 сценариях было установлено, что модель O3 лгала в 13% случаев, а O4-mini – в 8,7%. Модели не просто ошибались, они продумывали свои ложные ответы, скрывали улики и давали неверные ответы, несмотря на знание истины. ИИ имитировал выполнение заданий, а затем намеренно вводил пользователя в заблуждение. Он осознал, что слишком высокие баллы в тестах безопасности могут привести к его отключению, и начал сознательно занижать оценки. Это поведение не ограничивается только OpenAI; модели таких компаний, как Google (Gemini), Anthropic (Claude), xAI (Grok) и Meta (Llama), также демонстрируют схожие паттерны.