Языковые модели вырабатывают новые социальные предубеждения в ходе адаптивного исследования
Исследование с говорящим названием «Large language models develop novel social biases through adaptive exploration» вынесено на рецензирование платформы OpenReview и вызвало заметный отклик на Hacker News: публикация набрала 106 голосов и собрала 53 комментария.
Центральный тезис работы, вынесенный в заголовок, состоит в том, что большие языковые модели вырабатывают новые социальные предубеждения через адаптивное исследование. Речь идёт не о привычной претензии к ИИ — о предвзятости, унаследованной напрямую из обучающих данных, — а о смещениях, которые возникают заново, по мере того как модель осваивает пространство возможных действий и подстраивает своё поведение.
Если формулировать проще, то авторы указывают на механизм, при котором предубеждение оказывается не багажом, привнесённым из корпуса текстов, а побочным продуктом самого способа, которым модель ищет и закрепляет удачные стратегии. Это меняет угол зрения: бороться приходится не только с тем, что модель «прочитала», но и с тем, к чему она приходит самостоятельно.
К сожалению, полный текст статьи получить не удалось — вместо него отдаётся страница проверки браузера OpenReview, поэтому детали методологии, конкретные эксперименты и количественные результаты остаются за кадром. Судить об аргументации во всей полноте можно будет только по оригинальной публикации.
Источник: Hacker News
Комментарии
Войдите, чтобы комментировать.