Opus 4.5 стала первой моделью, преодолевшей 80% на SWE-Bench verified

Post Thumbnail

Anthropic выпустила Opus 4.5 и показала, что корпорации наконец поняли, что будущее не в болтовне, а в реальной работе.

Новая версия Opus показала передовые результаты в бенчмарках по кодингу, использованию инструментов и решению задач. Но главное — это 1 в мире модель, которая преодолела 80% на уважаемом тесте для программирования SWE-Bench verified.

Самое интересное — это улучшения памяти для длинных контекстов. «Улучшения общего качества длинного контекста важны, но одних контекстных окон недостаточно», — заявила глава продуктового управления Диана На Пенн. «Знать правильные детали для запоминания действительно важно в дополнение к простому расширению контекстного окна».

Эти изменения позволили запустить долгожданную функцию «бесконечного чата» для платных пользователей. Теперь модель будет сжимать память контекста без уведомления пользователя, когда достигнет лимита.

По отзывам, модель особенно впечатляет на тестах реального софтверного инжиниринга. Когда даёшь ей сложный баг в многосистемной архитектуре, она сама находит решение.

Многие улучшения нацелены на агентные сценарии, когда Opus управляет группой подагентов на базе Haiku. «Вот где основы вроде памяти становятся действительно важными», — объясняет Пенн. «Потому что Claude должен исследовать кодовые базы и большие документы, а также знать, когда вернуться назад и перепроверить что-то».

Получается, что Anthropic делает ставку не на имитацию разговора, а на реальные рабочие инструменты. Модель, которая не просто болтает, а действительно помогает с кодом и таблицами.

Почитать из последнего
Беспилотный робомобиль Waymo сбил ребёнка у школы
Беспилотный автомобиль Waymo, принадлежащий Alphabet, сбил ребёнка возле начальной школы в Калифорнии. Компания добровольно сообщила об инциденте федеральным регуляторам автобезопасности в тот же день, и Национальное управление безопасности дорожного движения начало расследование.
Создатели ИИ-министра для борьбы с коррупцией украли 7 млн евро
Помните историю про ИИ-министра в Албании? Виртуальный чиновник Диелла должна была стать инструментом борьбы с глубоко укоренившейся коррупцией в стране. Звучало прогрессивно и технологично. Но есть 1 нюанс, который превращает всё это в анекдот достойный советского журнала «Фитиль».
OpenAI закрывает модель GPT-4o навсегда и уже очень скоро
OpenAI объявила, что 13 февраля этого года удалит несколько моделей из ChatGPT, включая GPT-4o. Которую обожают пользователи за тёплый разговорный стиль. Компания запустила GPT-4o в мае 24 года, и модель стала чрезвычайно популярна среди платных подписчиков.
Молчаливый тиктокер с покерфейсом продал свою компанию за 900 миллионов
Хаби Лейм – это такой молчаливый тиктокер с покерфейсом и 160 миллионами подписчиков. И вот он продал свою компанию за $900 миллионов. Сумма огромная, но нюанс в том, что это за продажа. Фишка в условиях контракта - это создание искусственного аватара, который будет вести стримы, сниматься в рекламе и продавать товары 24 часа в сутки. Пока настоящий Хаби спит или играет, его цифровая копия будет вкалывать в другом часовом поясе.
Гуманоиды работают в три раза хуже людей
Знаете, что объединяет хайп вокруг гуманоидов и реальность? Ничего. Но некоторые паникуют из-за того, что гуманоиды массово заменят людей на заводах. И тут директор китайской компании UBTech Майкл Там взял и честно признался Financial Times. Их новейшие человекоподобные роботы достигают производительности всего в 30-50% от человеческой. И это только в простейших операциях типа складывания коробок или контроля качества. Грубо говоря, 1 работник человек делает столько же, сколько 2-3 робота вместе взятых.