Post Thumbnail

DeepSeek R1 обошла Qwen 3 и сократила разрыв с Gemini 2.5 Pro

Подоспели данные по DeepSeek R1, которая получила серьёзное обновление. И результаты впечатляют. Модель теперь уверенно обходит своего конкурента Qwen 3 размером 235 миллиардов параметров. Хотя она всё ещё отстаёт от таких флагманов как Gemini 2.5 Pro и O3, разрыв существенно сократился. Главное улучшение связано с увеличением глубины размышлений — теперь модель в среднем использует 23000 токенов для решения задач, тогда как предыдущая версия ограничивалась 12000. Эта способность к более глубокому анализу принесла впечатляющие результаты. Например, в тесте AIME точность выросла с 70% до 87,5%. Кроме впечатляющих успехов в бенчмарках, новая версия стала гораздо меньше галлюцинировать и значительно улучшила свои способности в области фронтенд-разработки. Хотя до уровня Claude в этой сфере ей ещё предстоит дорасти.

Думаю, в течение ближайшего года мы увидим новую волну интеграции крупных языковых моделей в системы дистилляции знаний. Где гигантские модели будут выступать в роли “учителей” для компактных версий. Что приведёт к быстрому прорыву в эффективности малых моделей и их внедрению в мобильные устройства.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Latest News
CodeClash показал огромный разрыв между ИИ и человеческим программистом

Представлен CodeClash. Это новый бенчмарк для оценки навыков программирования у больших языковых моделей. И он показал: разрыв с человеческим уровнем огромен.

Майкл Бэрри поставил 1,1 млрд долларов против Nvidia и Palantir

Майкл Бэрри - это легендарный инвестор, который предсказал ипотечный кризис 2008 года. И вот он снова делает громкий ход. Майкл поставил 1,1 млрд долларов в пут-опционах против 2 крупных компаний из сектора искусственного интеллекта. Это Nvidia и Palantir.

XPeng представила первого в мире робота-гуманоида женщину

Китайский производитель электромобилей XPeng представил робота-гуманоида нового поколения IRON. И это 1 женщина гуманоид!

Anthropic проводит интервью с моделями перед отправкой на пенсию

Anthropic опубликовала политику "вывода из строя" устаревших версий искусственного интеллекта. Ключевое обязательство - это сохранять веса всех публичных и активно используемых внутри моделей минимум на срок жизни компании. Чтобы в будущем можно было вернуть доступ при необходимости.

Глава Nvidia считает, что ИИ-пузыря - нет

Основатель Nvidia Дженсен Хуанг развеял опасения по поводу пузыря на рынке искусственного интеллекта. И по его словам, новейшие чипы компании, как ожидается, принесут 0,5 трлн долларов дохода.