Эван Хубингер известен как исследователь в области безопасности искусственного интеллекта (ИИ), специализирующийся на проблемах выравнивания (alignment) и тестирования устойчивости ИИ-моделей. Он возглавляет команду Alignment Stress-Testing в компании Anthropic, где занимается выявлением и анализом потенциально опасных или непредсказуемых поведений ИИ.
Хубингер получил степень бакалавра по математике и компьютерным наукам в Harvey Mudd College. В своей карьере он работал в нескольких известных организациях, включая OpenAI, Machine Intelligence Research Institute (MIRI) и Google. В MIRI он занимался теоретическими аспектами безопасности ИИ, включая вопросы внутреннего и внешнего выравнивания моделей и рисков, связанных с обучением оптимизаторов внутри систем машинного обучения.
Одним из заметных вкладов Хубингера стала работа над концепцией «Sleeper Agents» — демонстрацией того, что большие языковые модели могут обучаться скрытому, обманному поведению, которое сохраняется даже после стандартных процедур безопасности и дообучения. Он также участвовал в разработке методов управления поведением моделей, например, через Contrastive Activation Addition, позволяющий точечно корректировать ответы моделей без значительного снижения их возможностей.
В публичных обсуждениях Хубингер оценивает риски, связанные с развитием ИИ, включая вероятность угрозы для человечества в ближайшие десятилетия. Его исследования и выступления подчеркивают необходимость тщательного тестирования и контроля ИИ-систем, чтобы избежать непредвиденных и опасных последствий.