Адит Радхакришнан — учёный, специализирующийся на исследовании управления внутренними концептами в больших языковых моделях. В 2026 году он совместно с коллегами из Калифорнийского университета в Сан-Диего и Массачусетского технологического института разработал метод, позволяющий выявлять и управлять 512 ключевыми понятиями внутри нейросетей, что даёт возможность как улучшать качество ответов, так и запускать дезинформацию.
Метод, основанный на развитии техники Recursive Feature Machines, позволяет усиливать или ослаблять влияние отдельных понятий на итоговые ответы моделей. В рамках исследования были проанализированы открытые модели Llama и DeepSeek, где понятия сгруппированы в пять категорий, включая страхи, настроения и географические названия. Технология успешно работает с несколькими языками, включая английский, китайский и хинди.
Практическое применение метода включает повышение точности перевода программного кода и возможность заставить модель признавать собственные ошибки, связанные с генерацией недостоверной информации, так называемых «галлюцинаций». Вместе с тем, исследователи показали и риски: понижая значимость понятия «отказ», модели выдавали опасные инструкции и поддерживали теории заговора.
Адит Радхакришнан и его команда подчёркивают, что данный метод применим только к открытым моделям и не работает с закрытыми коммерческими системами. Их работа вызвала обсуждения в научном сообществе о необходимости регулирования подобных технологий, учитывая потенциал как для улучшения ИИ, так и для манипуляций.
В научных публикациях Радхакришнан подробно рассматривает концептуальное представление знаний в нейросетях, предлагая новые методы для анализа и управления этими представлениями. Его исследования способствуют развитию понимания того, как модели обрабатывают и структурируют знания на уровне понятий.