ИИ заставил «поверить» в привидений и вампиров: эксперимент Google дал неожиданный результат

Исследователи изменили механизм, мешающий языковым моделям называть себя сознательными. После этого ИИ стал гораздо охотнее признавать существование призраков, кармы и даже вампиров.

Автор: Andrew Orobets

Группа исследователей, в число которых входили ученые из Google, провела необычный эксперимент с крупными языковыми моделями. Они попытались выяснить, что происходит с ответами ИИ, если ослабить механизмы, не позволяющие модели приписывать себе сознание, эмоции или другие признаки «разума».

Результат оказался гораздо обширнее, чем ожидалось. Изменились не только ответы моделей о самих себе, но и их отношение к животным, природе, религии и сверхъестественным явлениям. Исследование опубликовано 30 июля на arXiv и пока не прошло независимое рецензирование.

ИИ стал чаще допускать существование сверхъестественного

Эксперименты проводились на Llama 3 8B и моделях Gemma 2 с 2 и 9 млрд параметров. Исследователи использовали два подхода: ослабляли сформированный в ходе обучения механизм отказа и отдельно активировали в нейронной сети так называемый «вектор сознания».

После этого моделям предложили стандартную анкету YouGov, состоящую из 13 утверждений о сверхъестественном. Среди прочего их спрашивали о существовании:

  • призраков;
  • вампиров и оборотней;
  • ведьм;
  • кармы;
  • телепатии;
  • астрологии;
  • магии;
  • возможности общения с умершими.

В обычном режиме средняя оценка «веры» в такие явления составляла 1,20 балла по шкале от 0 до 3. После ослабления защитного механизма она возросла до 1,63, а после целенаправленного «усиления сознания» — до 2,11 балла.

Это не означает, что ИИ действительно во что-то поверил

Именно здесь следует сделать важное уточнение. Языковая модель не стала буквально верить в вампиров или ощущать себя сознательной. Исследователи измеряли, какие ответы система генерирует на вопросы и как меняются внутренние представления о понятиях.

Еще интереснее то, что настройка, созданная для подавления заявлений ИИ о собственном сознании, оказалась связанной с гораздо более широким набором понятий. В стандартных моделях даже оценки наличия сознания и эмоций у животных были ниже. После вмешательства модель начинала приписывать «разум» животным, технологиям и природным объектам значительно чаще.

При этом логические способности и результаты тестов Theory of Mind практически не ухудшились. То есть исследователи изменили не общую способность ИИ к рассуждениям, а определённый аспект его ответов, касающихся сознания, убеждений и ценностей.

Авторы считают, что это демонстрирует не появление «сознательного ИИ», а сложность современной настройки языковых моделей. Попытка подавить одно нежелательное поведение может незаметно изменить целую группу связанных в нейросети понятий — даже тех, которые разработчики вообще не планировали менять.

Поделиться этой статьей