Адит Радхакришнан

Адит Радхакришнан

Адит Радхакришнан — исследователь в области управления внутренними понятиями в больших языковых моделях, известный разработкой метода тонкой настройки нейросетей через управление концептами.

Деятельность
исследователь в области искусственного интеллекта и нейросетей
Страна
США

Адит Радхакришнан — учёный, специализирующийся на исследовании управления внутренними концептами в больших языковых моделях. В 2026 году он совместно с коллегами из Калифорнийского университета в Сан-Диего и Массачусетского технологического института разработал метод, позволяющий выявлять и управлять 512 ключевыми понятиями внутри нейросетей, что даёт возможность как улучшать качество ответов, так и запускать дезинформацию.

Метод, основанный на развитии техники Recursive Feature Machines, позволяет усиливать или ослаблять влияние отдельных понятий на итоговые ответы моделей. В рамках исследования были проанализированы открытые модели Llama и DeepSeek, где понятия сгруппированы в пять категорий, включая страхи, настроения и географические названия. Технология успешно работает с несколькими языками, включая английский, китайский и хинди.

Практическое применение метода включает повышение точности перевода программного кода и возможность заставить модель признавать собственные ошибки, связанные с генерацией недостоверной информации, так называемых «галлюцинаций». Вместе с тем, исследователи показали и риски: понижая значимость понятия «отказ», модели выдавали опасные инструкции и поддерживали теории заговора.

Адит Радхакришнан и его команда подчёркивают, что данный метод применим только к открытым моделям и не работает с закрытыми коммерческими системами. Их работа вызвала обсуждения в научном сообществе о необходимости регулирования подобных технологий, учитывая потенциал как для улучшения ИИ, так и для манипуляций.

В научных публикациях Радхакришнан подробно рассматривает концептуальное представление знаний в нейросетях, предлагая новые методы для анализа и управления этими представлениями. Его исследования способствуют развитию понимания того, как модели обрабатывают и структурируют знания на уровне понятий.

Источники и дополнительные материалы