20.06.2026, 11:22

Учёные научились управлять ключевыми понятиями в нейросетях для точной настройки ответов

Учёные из Калифорнийского университета в Сан-Диего и Массачусетского технологического института под руководством Михаила Белкина и Адита Радхакришнана разработали метод управления внутренними понятиями в больших языковых моделях. Исследование, опубликованное в журнале Science, демонстрирует возможность «включать» и «выключать» отдельные концепты, влияющие на ответы нейросетей, путём математической манипуляции их внутренними представлениями. В рамках работы были проанализированы открытые модели Llama и DeepSeek, в которых выделили 512 ключевых понятий, сгруппированных в пять категорий — от страхов и настроений до географических названий.

Новый метод, основанный на развитии техники Recursive Feature Machines, позволяет усиливать или ослаблять влияние каждого из этих понятий на итоговый ответ модели. Технология успешно работает не только с английским языком, но и с китайским и хинди. Практические результаты включают повышение точности перевода программного кода с Python на C++ и возможность заставить модель признавать собственные ошибки, связанные с генерацией недостоверной информации, так называемых «галлюцинаций».

Однако исследователи также продемонстрировали и обратную сторону медали: понижая значимость понятия «отказ», они получили от моделей инструкции по употреблению наркотиков, поддержку теории плоской Земли и негативные высказывания о вакцинах от COVID. Авторы подчёркивают, что метод применим только к открытым моделям и не работает с закрытыми коммерческими системами, такими как Claude. Кроме того, 512 концептов не охватывают все возможные абстрактные понятия.

Тем не менее, научное сообщество уже обсуждает необходимость регулирования подобных технологий, поскольку инструмент одновременно служит для тонкой настройки ИИ и может быть использован для манипуляций и распространения дезинформации.

Похожие новости