DeepSeek выпустил 2 модели с прорывом в агентных системах и ИИ

Post Thumbnail

Китайский стартап DeepSeek выпустил 2 модели, которые претендуют на звание прорыва в агентных системах. И судя по метрикам, это не просто маркетинг.

DeepSeek-V3.2 — это официальный преемник экспериментальной версии. Доступна в приложении, на сайте и через API. DeepSeek-V3.2-Speciale — улучшенная версия с акцентом на продвинутое многошаговое рассуждение. Пока работает только через API.

Обе модели делают упор на глубокие цепочки рассуждений и поведение для агентных сценариев. Это планирование, решение задач, сложные выводы и работа со структурированными данными.

DeepSeek-V3.2-Speciale стала первой опенсорсной моделью, которая выбивает золото в топовых олимпиадах. Золото на 4 авторитетных олимпиадах!. По метрикам Speciale обходит Gemini 3.0 Pro на математике, а менее мощная DeepSeek-V3.2 опережает Claude-4.5 Sonnet в кодинге.

Но есть нюанс. Test-time compute огромен. Speciale совсем не экономит токены, так что инференс получается дорогой. Авторы сами признают, что «оставили оптимизацию на будущие исследования».

Технические причины успеха: это новая архитектура DeepSeek Sparse Attention, масштабный стабильный RL-тренинг и большой пайплайн для агентных задач. И это ключевое изменение архитектуры по сравнению с предыдущим поколением.

Обе модели чрезвычайно хороши во всяких агентских задачах, и особенно в поиске и задачах с браузером. Для этого сгенерировали 1800 синтетических сред, в которых агенты обучались выполнять совершенно разные задачи. Очень крутая модель получилась, респект.

Почитать из последнего
Музыку российских звёзд нашли в открытых датасетах
ИИ учится на миллионах файлов, и иногда в этих массивах обнаруживается контент, который никто не разрешал использовать. Теперь в открытых датасетах для обучения нейросетей нашли тысячи фрагментов музыкального контента российских исполнителей.
Microsoft заставила ИИ просить разрешения на опасные действия
Microsoft предупреждает: Copilot Cowork может ошибиться, неверно понять инструкцию или среагировать на скрытую вредоносную команду. Ответственность за действия остаётся за пользователем, особенно при работе с деньгами и данными.
Claude объединил чат и Cowork в единую среду
Ещё недавно в Claude приходилось выбирать режим: быстрый вопрос - в чат, работа посложнее - в Cowork. Теперь Anthropic убирает эту границу: Claude Cowork и обычный чат объединяются.
Дженсен Хуанг не увидел смысла в новых законах для ИИ
Глава Nvidia Дженсен Хуанг призвал не замедлять развитие ИИ ради безопасности и заявил, что проблему нужно решать прежде всего инженерными методами. Выступая на Dreamforce, он сказал, что новые законы и правила не нужны: по его мнению, компании сами должны выпускать продукт только тогда, когда уверены в его безопасности, а рынок уже создаёт для этого необходимые стимулы.
OpenAI и Anthropic захотели притормозить ИИ, но не сошлись в деталях
Крупнейшие игроки рынка ИИ заговорили о паузе, однако внутри компаний тут же всплыл неудобный вопрос: кого пускать к секретам разработчиков?