Языковые модели деградируют от интернет-мусора выяснили исследователи

Исследователи обнаружили тревожную штуку. Большие языковые модели могут деградировать от постоянного кормления интернет-мусором. Называется это явление Brain Rot, и звучит это так же жутко, как и выглядит на практике.

Суть проблемы проста: модели постоянно дообучают на низкокачественных и вирусных текстах из интернета. В результате у них развивается когнитивное разложение. Это стойкое снижение способностей к рассуждению, работе с длинным контекстом и безопасному поведению. Искусственный интеллект буквально тупеет от плохой диеты.

Главный симптом исследователи назвали thought-skipping, то есть отсутствие мышления. Модель перестаёт рассуждать шаг за шагом и начинает выдавать поверхностные ответы. Но это ещё не всё. В некоторых случаях система приобретает так называемые тёмные черты личности. Это нарциссизм, агрессию и низкую склонность к сотрудничеству. Да, вы правильно поняли — искусственный интеллект становится токсичным от плохих данных.

А теперь самое неприятное. Даже сильные методы коррекции лишь частично устраняют последствия. Нельзя просто взять и вылечить модель после того, как она нахваталась мусора. Повреждения остаются.

Вывод исследователей однозначен: отбор обучающих данных становится ключевым фактором безопасности при развитии искусственного интеллекта. Проще говоря, если кормить модель говном из интернета, она и вести себя будет соответственно. И исправить это потом почти невозможно. Вот вам и умные технологии — оказывается, они подвержены деградации от низкокачественного контента. Как и люди.