Post Thumbnail

DeepSeek открывает код супербыстрых GPU-ядер

Китайская компания DeepSeek, совершившая прорыв в сфере искусственного интеллекта, начала беспрецедентную неделю открытого кода, выпустив первый из пяти обещанных инструментов – FlashMLA. Этот проект представляет собой оптимизированные GPU-ядра, которые компания использует в своих производственных системах.

FlashMLA реализует технологию multi latent attention (MLA), революционный метод, позволяющий существенно сократить потребление памяти в трансформерах за счет эффективного сжатия матриц ключей и значений. Хотя сам метод уже доказал свою эффективность в моделях DeepSeek, до сегодняшнего дня оптимизированных реализаций для него практически не существовало.

Ключевые технические характеристики FlashMLA впечатляют:
– Поддержка формата bfloat16, обеспечивающего оптимальный баланс между скоростью и точностью вычислений
– Страничный кэш KV с размером блока 64
– Рекордная производительность: до 3000 ГБ/с при конфигурации с ограничением по памяти
– 580 терафлопс в конфигурации с ограничением по вычислениям на GPU H800 SXM5 при использовании CUDA 12.6

Инструмент полностью совместим со всей линейкой графических процессоров NVIDIA Hopper, включая H100, H800 и другие модели. FlashMLA особенно эффективен при обработке последовательностей переменной длины, что делает его идеальным решением для современных задач обработки естественного языка.

DeepSeek планирует продолжить публикацию своих внутренних разработок: с 24 по 28 февраля компания обещает выложить в открытый доступ еще четыре репозитория из своей внутренней экосистемы. Это решение может существенно повлиять на развитие всей индустрии ИИ, предоставив разработчикам доступ к передовым оптимизациям, ранее доступным только внутри компании.

Код проекта уже доступен на GitHub (github.com/deepseek-ai/FlashMLA), что позволяет разработчикам со всего мира начать интеграцию этих оптимизаций в свои проекты, потенциально значительно улучшив производительность своих ИИ-систем.

Автор: AIvengo
5 лет я работаю с машинным обучением и искусственным интеллектом. И эта сфера не перестает меня удивлять, восхищать и интересовать.
Latest News
ИИ-чатботы генерируют контент, усугубляющий расстройства питания

Совместное исследование Стэнфордского университета и Центра демократии и технологий показало тревожную картину. Чат-боты с искусственным интеллектом представляют серьёзный риск для людей с расстройствами пищевого поведения. Учёные предупреждают, что нейросети раздают вредные советы о диетах. Предлагают способы скрыть расстройство и генерируют "вдохновляющий контент для похудения", который усугубляет проблему.

OpenAGI выпустил модель Lux, которая обгоняет Google и OpenAI

Стартап OpenAGI выпустил модель Lux для управления компьютером и заявляет, что это прорыв. По бенчмаркам модель на целое поколение обгоняет аналоги от Google, OpenAI и Anthropic. Кроме того, она работает быстрее. Примерно 1 секунда на шаг вместо 3 секунд у конкурентов. И в 10 раз дешевле по стоимости обработки 1 токена.

Альтман объявил красную тревогу в OpenAI из-за успехов Google

Сэм Альтман объявил в OpenAI «красный уровень тревоги», и это не просто корпоративная драма. Это признание, что лидер рынка почувствовал дыхание конкурентов сзади. Согласно внутренней служебной записке, он мобилизует дополнительные ресурсы на улучшение ChatGPT в условиях растущей угрозы со стороны Google.

Пользователи тратят больше времени с Gemini, чем с ChatGPT

OpenAI всё ещё лидирует по числу пользователей, но люди начинают проводить больше времени с конкурентами. И это создаёт серьёзную проблему.

Компании возвращают 5% уволенных из-за провала внедрения ИИ

Многие компании начали возвращать уволенных из-за искусственного интеллекта сотрудников. Аналитическая компания Visier изучила данные о занятости 2,5 миллионов сотрудников из 142 компаний по всему миру. Около 5% уволенных сотрудников впоследствии вернулись к предыдущему работодателю. Этот показатель оставался стабильным несколько лет, но недавно начал расти.