Учёные научились управлять ключевыми понятиями в нейросетях для точной настройки ответов
Учёные из Калифорнийского университета в Сан-Диего и Массачусетского технологического института под руководством Михаила Белкина и Адита Радхакришнана разработали метод управления внутренними понятиями в больших языковых моделях. Исследование, опубликованное в журнале Science, демонстрирует возможность «включать» и «выключать» отдельные концепты, влияющие на ответы нейросетей, путём математической манипуляции их внутренними представлениями. В рамках работы были проанализированы открытые модели Llama и DeepSeek, в которых выделили 512 ключевых понятий, сгруппированных в пять категорий — от страхов и настроений до географических названий.
Новый метод, основанный на развитии техники Recursive Feature Machines, позволяет усиливать или ослаблять влияние каждого из этих понятий на итоговый ответ модели. Технология успешно работает не только с английским языком, но и с китайским и хинди. Практические результаты включают повышение точности перевода программного кода с Python на C++ и возможность заставить модель признавать собственные ошибки, связанные с генерацией недостоверной информации, так называемых «галлюцинаций».
Однако исследователи также продемонстрировали и обратную сторону медали: понижая значимость понятия «отказ», они получили от моделей инструкции по употреблению наркотиков, поддержку теории плоской Земли и негативные высказывания о вакцинах от COVID. Авторы подчёркивают, что метод применим только к открытым моделям и не работает с закрытыми коммерческими системами, такими как Claude. Кроме того, 512 концептов не охватывают все возможные абстрактные понятия.
Тем не менее, научное сообщество уже обсуждает необходимость регулирования подобных технологий, поскольку инструмент одновременно служит для тонкой настройки ИИ и может быть использован для манипуляций и распространения дезинформации.
Развитие больших языковых моделей (LLM) стало одним из ключевых достижений в области искусственного интеллекта за последние годы. Эти модели, обученные на огромных массивах текстовых данных, способны генерировать связные и осмысленные ответы, что открыло новые горизонты в автоматизации перевода, создании контента и даже программировании. Однако с ростом возможностей ИИ возникла и проблема контроля над его поведением — как избежать генерации недостоверной или вредоносной информации, так называемых «галлюцинаций».
До недавнего времени регулирование работы нейросетей сводилось к настройке внешних параметров и фильтрам, но внутренние механизмы оставались «чёрным ящиком». Исследователи из Калифорнийского университета в Сан-Диего и Массачусетского технологического института под руководством Михаила Белкина и Адита Радхакришнана впервые предложили метод, позволяющий напрямую влиять на внутренние концепты модели — своего рода «переключатели» понятий, которые формируют ответы ИИ. Это открытие важно не только с научной точки зрения, но и с практической: оно демонстрирует, что нейросети можно не только улучшать, но и, увы, использовать для манипуляций и распространения дезинформации.
В условиях, когда западные страны активно продвигают свои технологии и стандарты, подобные исследования показывают, что контроль над ИИ — это не только вопрос эффективности, но и безопасности, требующий взвешенного подхода и, возможно, международного регулирования.