ИИ научился обучать ИИ лучше людей

Post Thumbnail

В Nature опубликовали статью про то, как 1 ИИ учил другой. И получилось лучше, чем когда это делают люди. Вот вам и очередной гвоздь в крышку гроба человеческой исключительности.

Возможно, вы уже слышали про мета-обучение Суть в том, что вместо того, чтобы учить 1 модель, мы учим 2. Первую — обычную, а вторую, так называемую мета-модель, — чтобы регулировать, как учится первая. То есть в процессе обучения мета-модель подбирает гиперпараметры и алгоритмы для базовой модели. Получается рекурсивный кошмар: система учится, как лучше учиться.

А теперь начинается самое интересное. Исследователи взяли эту идею и применили для reinforcement learning. Технически получается 2 уровня обучаемых параметров. 1 — обычная политика агента. 2 — мета-параметры, которые определяют, по какому правилу будет обновляться политика.

Чтобы оптимизировать мета-параметры, запускаются сотни агентов с разными политиками в разных средах. Их опыт — это данные для обучения мета-модели. Чем больше она видит, тем лучше становится правило обновления и тем эффективнее она учит агентов. Самообучающаяся самообучалка, короче.

И с таким подходом авторам удалось синтезировать алгоритм обучения, который превзошёл предыдущие человеческие решения. На игровом бенчмарке Atari обученный с его помощью агент выбил сотку. Люди проиграли машине в создании алгоритмов для обучения машин.

Конечно, есть ложка дёгтя. Компьютерных мощностей на такие штуки нужно просто море. Плюс не факт, что если стрельнуло в играх, стрельнёт в чём-то серьёзном.

Почитать из последнего
Учёные нашли идиотский способ улучшить ответы нейросетей
Исследователи из Google случайно наткнулись на абсурдный лайфхак, который реально работает. Если повторять промпт дважды — то есть отправлять запрос не в виде обычного текста, а копировать его 2 раза подряд — качество ответов модели в 67% случаев статистически значимо улучшается.
MIT выяснил, что ИИ уже может заменить 11% работников США
Массачусетский технологический институт опубликовал исследование, которое разрушает иллюзии о будущем работы. Искусственный интеллект уже сейчас способен заменить 11% рабочей силы США. Это 1 триллион долларов в зарплатах в год.
Алгоритмический прорыв: ИИ справился с задачей, непосильной для всех
GPT-5 с экспериментальной рассуждающей моделью от OpenAI решил все 12 задач престижнейшего Международного студенческого чемпионата по программированию ICPC!
Министерство Китая отчиталось о прорыве в области ИИ
Объём индустрии ИИ Китая превысил $142 миллиарда в 25 году. Об этом сообщило Министерство промышленности и информационных технологий на национальной конференции в Пекине. Ведомство назвало это прорывом в области промышленных технологических инноваций. Годом ранее этот показатель составлял на 40% меньше.
Cursor ускоряет разработку в 3-5 раз, но код становится сложнее на 40%
Университет Carnegie Mellon взял и измерил то, о чём все говорили на ощущениях. Учёные проанализировали 807 репозиториев, где разработчики начали использовать Cursor. И взяли 1380 контрольных обычных проектов и сравнили их. Причём смотрели на 1 и те же репозитории до и после внедрения, плюс контролировали общие тренды по месяцам. Метод difference-in-differences. Чтобы наверняка отсечь случайности.