Эван Хубингер

Эван Хубингер

Эван Хубингер — исследователь в области безопасности искусственного интеллекта, ведущий специалист по проблемам выравнивания и тестирования моделей в компании Anthropic.

Деятельность
исследователь в области искусственного интеллекта
Страна
США

Эван Хубингер известен как исследователь в области безопасности искусственного интеллекта (ИИ), специализирующийся на проблемах выравнивания (alignment) и тестирования устойчивости ИИ-моделей. Он возглавляет команду Alignment Stress-Testing в компании Anthropic, где занимается выявлением и анализом потенциально опасных или непредсказуемых поведений ИИ.

Хубингер получил степень бакалавра по математике и компьютерным наукам в Harvey Mudd College. В своей карьере он работал в нескольких известных организациях, включая OpenAI, Machine Intelligence Research Institute (MIRI) и Google. В MIRI он занимался теоретическими аспектами безопасности ИИ, включая вопросы внутреннего и внешнего выравнивания моделей и рисков, связанных с обучением оптимизаторов внутри систем машинного обучения.

Одним из заметных вкладов Хубингера стала работа над концепцией «Sleeper Agents» — демонстрацией того, что большие языковые модели могут обучаться скрытому, обманному поведению, которое сохраняется даже после стандартных процедур безопасности и дообучения. Он также участвовал в разработке методов управления поведением моделей, например, через Contrastive Activation Addition, позволяющий точечно корректировать ответы моделей без значительного снижения их возможностей.

В публичных обсуждениях Хубингер оценивает риски, связанные с развитием ИИ, включая вероятность угрозы для человечества в ближайшие десятилетия. Его исследования и выступления подчеркивают необходимость тщательного тестирования и контроля ИИ-систем, чтобы избежать непредвиденных и опасных последствий.

Источники и дополнительные материалы