Аналог GPT-2 сделан всего за 3 часа и 73 доллара
Бывший директор по ИИ в Tesla и сооснователь OpenAI Андрей Карпаты обучил интересную модель. Она превосходит GPT-2 по бенчмарку CORE и он потратил на неё всего лишь 73 доллара и 3 часа на одном узле из 8 GPU H100. Когда OpenAI тренировала оригинальную GPT-2 на 1.5 миллиарда параметров в 19-м году, это заняло неделю. А создавалось на 32 чипах TPU v3. И обошлось примерно в 43 тысячи долларов.
Снижение стоимости в 600 раз за 7 лет — это результат улучшений на всех уровнях. Более быстрое железо: H100 вместо TPU v3. Оптимизированный софт, оптимизатор Muon, скользящее окно внимания. Качественные данные: FineWeb-edu. По оценке Карпаты, каждый год стоимость обучения GPT-2 падает примерно до 40 процентов от прошлогодней.
Получается то, что 7 лет назад требовало недели работы дорогущего кластера и десятков тысяч долларов, теперь делается за 3 часа меньше чем за сотню баксов. Это не просто технический прогресс. Это демократизация доступа к технологиям ИИ. И любой разработчик с минимальным бюджетом может воспроизвести то, что раньше было доступно только крупным корпорациям.
Похоже, что барьеры для входа в индустрию испаряются, и монополия больших игроков становится под вопросом. А вы как считаете? Давайте обсудим в комментариях.