Post Thumbnail

Новая модель Seed-Coder-8B от ByteDance превосходит более крупных конкурентов

Компания ByteDance, известная как создатель TikTok, выпустила новую языковую модель для программирования под названием Seed-Coder-8B. Это небольшая модель, которая показывает потрясающие результаты в задачах, связанных с кодом. Превосходя даже некоторые гораздо более крупные решения, включая Claude Sonnet 3.7 и o1-mini.

Модель вышла в 3 версиях: базовая, инструктивная и модель с рассуждениями. При этом она имеет контекстное окно в 32000 токенов.

Что делает эту модель особенной — прежде всего, подход к сбору и обработке данных. ByteDance использовали методику, похожую на подход компании DeepSeek, но значительно усовершенствованную. Вместо множества ручных фильтров для очистки исходных данных они создали единый фильтр на основе искусственного интеллекта.

Для этого китайские разработчики специально обучили небольшую модель оценивать качество кода по таким параметрам, как читабельность, модульность, ясность и возможность повторного использования. Затем эту модель применили ко всему набору данных, отбрасывая наиболее проблемные файлы. Таким образом удалось избавиться примерно от 10% исходного набора данных, что представляло собой, по сути, просто мусор.

Специальные фильтры на основе искусственного интеллекта оценивали код из GitHub и других веб-источников, отсеивая низкокачественные примеры. Таким образом разработчики отфильтровали данные объёмом примерно в 2.3 триллиона токенов.

Результат впечатляет! Seed-Coder превосходит аналоги с открытым исходным кодом своего размера на всех тестах, включая генерацию, автодополнение и рассуждения. А в некоторых случаях даже более крупные модели. При этом модели полностью открыты для использования и исследования.

Думаю, именно высокая специализация позволяет достичь превосходных результатов в конкретной области при сохранении компактного размера. Что открывает путь к множеству узкоспециализированных моделей вместо единой универсальной.
Технический отчет, репозиторий и веса модели Seed-Coder-8B — в описании.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.

Latest News

Китайский робот-сфера RT-G весом 150 кг развивает скорость до 35 км/ч

В Китае есть такое уникальное инженерное чудо — сферический робот Rotunbot RT-G. Который может кардинально поменять представление о полицейских технологиях будущего.

22% британских детей 8-12 лет используют ИИ, не зная что это такое

22% британских школьников от 8 до 12 лет уже активно используют инструменты искусственного интеллекта. Несмотря на то, что большинство из них даже не слышали термин "генеративный искусственный интеллект". Это данные исследования Института Алана Тьюринга и Lego Foundation.

Первая реклама на Google Veo 3 показана миллионам во время финала NBA

Миллионы зрителей финальной серии NBA стали свидетелями абсолютно нового этапа в креативной эволюции. Полностью сгенерированной компьютерными алгоритмами рекламы букмекерской платформы Kalshi, созданной с помощью Google Veo 3.

Китайская платформа QiMeng создает процессоры уровня Intel 486 и Arm

Китайские ученые разработали новый искусственный интеллект-платформу, способную самостоятельно проектировать процессоры на уровне человеческих экспертов. Исследователи из Государственной лаборатории по разработке процессоров и Исследовательского центра интеллектуального программного обеспечения представили проект с открытым исходным кодом под названием QiMeng.

Meta AI превращает личные чаты с ИИ в публичные посты без ведома

Приложение Meta AI оказалось настоящей катастрофой для конфиденциальности пользователей. Превращая их личные разговоры с искусственным интеллектом в публичный контент. Представьте себе современный фильм ужасов: вся ваша история запросов оказалась общедоступной, а вы даже не подозревали об этом.