Anthropic показала ИИ, который сам улучшает свою «согласованность»
Обучение одних ИИ-моделей с помощью других постепенно превращается в общую цель для новых лабораторий. В пятницу Anthropic опубликовала статью «Automated Researchers Can Reliably Mitigate Alignment Failures», в которой показывает, как это может выглядеть на практике.
Работу возглавил участник программы Anthropic Fellows Чэнь Юэ-Хань. Описанная система воспроизводит привычный цикл научного исследования, только без человека: каждый автоматический агент изучает доступную литературу, предлагает метод, тренирует модель по нему в течение получаса и затем через несколько итераций постепенно подтягивает результат на выбранном бенчмарке. Удачные методы сохраняются, неудачные отбрасываются — это позволяет вести работу быстро и в большом масштабе.
Результат по всем десяти тестам
Получив десять бенчмарков на конкретные проявления «рассогласованного» поведения, автоматические системы сумели улучшить показатели по каждому из них, не ухудшив при этом общую производительность модели. «В целом эти результаты дают первое свидетельство того, что автоматизированный пост-тренинг для согласованности может стать практичным уже в ближайшей перспективе», — говорится в статье.
Авторы прямо сравнивают своего «автоматизированного исследователя согласованности» (AAR) с живым коллегой — и сравнение выходит не в пользу человека. «Лучший метод AAR в среднем за шесть часов превосходит то, что предлагают опытные люди, — цитирует статью TechCrunch. — Направления исследований, заданные человеком, не приводят к более сильным результатам». Приведён и расчёт стоимости: работа AAR обходится примерно в $4 в час за счёт API, тогда как человеку-исследователю в лаборатории платят $150 в час.
Шаг к рекурсивному самоулучшению
Издание рассматривает работу как шаг к рекурсивному самоулучшению — сценарию, который многие считают следующим крупным этапом развития ИИ. Если модель способна улучшать собственную тренировку на согласованность, логично предположить, что со временем она возьмётся и за обучение в целом — а тогда живые исследователи ИИ рискуют оказаться не у дел.
Впрочем, статья не умалчивает об ограничениях. Метод работает ровно настолько, насколько сами бенчмарки отражают реальные цели по согласованности. А это означает большую отдельную работу: тесты нужно составлять и поддерживать, равно как расширять и обновлять литературу, из которой автоматические исследователи черпают идеи.
Источник: TechCrunch
Комментарии
Войдите, чтобы комментировать.