Anthropic выкатила Claude Opus 5.5

Post Thumbnail

Anthropic открыла новое поколение Claude моделью Opus 5.5. По заявлению компании, в большинстве рабочих задач она не уступает Fable 5.1, но обходится примерно на 40% дешевле Opus 5. Вдобавок новинка ускорилась и обзавелась дополнительными защитными механизмами.

Сильнее всего разница видна там, где ИИ приходится пахать часами. Один из ранних тестировщиков сплавил Opus 5.5 миграцию кодовой базы на 680 тыс. строк и получил готовый результат меньше чем за сутки. В другом испытании модель провела аудит и починила проект на 200 тыс. строк менее чем за три часа — тогда как Opus 5 возился с этим больше 20 часов и сжёг в 2,5 раза больше токенов.

Экономия бьёт и по цене запросов. Миллион входных токенов тянет на $4, выходных — на $20, чтение кэша — на $0,20. Это на 20%, 20% и 60% меньше, чем у Opus 5, а типичная стоимость работы, по прикидкам Anthropic, падает на 40%.

При этом модель не превратилась в удешевлённую копию предшественника. На CursorBench Opus 5.5 обставила GPT-5.6 Sol на 11 пунктов примерно за треть цены, а на Terminal-Bench 4.0 сравнялась с GPT-6 Astra, потратив около 40% её стоимости за задачу.

Отдельно Anthropic напирает на безопасность. По её данным, Opus 5.5 бодрее прошлых моделей проходит автоматический аудит поведения, реже норовит обойти ограничения и крепче держится против prompt injection. Для кибербезопасности и биологии включены дополнительные лимиты, а часть запросов уходит на другие модели.

Дошло и до манеры общения: Opus 5.5 должна сразу бить в главное, поменьше сыпать жаргоном и чётче держаться заданных правил. В ближайшие недели Anthropic обещает Sonnet 5.5 и Haiku 5.5 — так что семейство Claude только разворачивается.

Телеграм про право в IT и AI. IT юристы — PravoWeb.com

Почитать из последнего
Grok 4.7 обставила GPT-5.6 Sol в тестах по программированию
SpaceXAI выпустила Grok 4.7, и новичок сразу ввязалась в сравнение с топовыми системами для кода. На CursorBench 4.0 она выбила на 4,6 процентного пункта больше, чем GPT-5.6 Sol от OpenAI, хотя до Fable 5.1 от Anthropic не дотянула - отставание 5,5 п.п.
Qwen Image 2.1 вплотную подобралась к Nano Banana 2
Alibaba решила выяснить, насколько близко открытая модель может подойти к генераторам картинок от Google. Итог - Qwen Image 2.1, компактная система, которую в компании поставили рядом с Nano Banana 2.0.
«Яндекс» и VK могут объединить корпоративные активы
Российский ИТ-рынок рискует получить нового тяжеловеса. «Яндекс» и VK больше двух месяцев обсуждают совместное предприятие на базе Yandex B2B Tech и VK Tech - об этом РБК рассказали два отраслевых источника. Финального решения по составу активов ещё нет. Один из сценариев такой: в СП уходит VK Tech, а от «Яндекса» - Yandex Cloud, «Яндекс 360» и ИИ-направление из Yandex B2B Tech.
DeepMind открыла институт для изучения AGI
Google DeepMind занялась не только возможностями будущего AGI, но и проблемами, которые приедут вместе с ним. Запущен DeepMind Institute, где исследователи займутся безопасностью таких систем, их влиянием на общество, кибер- и биорисками, а также угрозой потери контроля над самообучающимся ИИ.
Японская игровая индустрия почти поголовно пересела на ИИ
Год назад нейросети применяла примерно половина японских разработчиков. Сейчас всё перевернулось так быстро, что без ИИ работает уже меньшинство.