#AI: Opus 5.5 - СУПЕР ❗️

🔥 22 сентября Anthropic тихо выкатили Opus 5.5 - и я сразу засел работать. Сутки спустя могу сказать честно: это первый раз с Opus 4 и Opus 5 когда чувствуется что модель думает по-другому. Не быстрее. По-другому

Что именно изменилось в Opus 5.5:
Главная фишка не в цифрах - в том как модель ведет себя внутри задачи. Сама решает когда позвать сабагента, сама проверяет результат нетривиальными способами, не ждет что ты ее за ручку поведешь. Я давал задачи и просто уходил работать дальше. Возвращался - готово, без косяков которые надо переделывать. Это ощущение "ок, разберется сама" - которого не было ни в Opus 4, ни в Opus 5

Модель нативно управляет инструментами: запускает тесты, читает логи, редактирует файлы, дергает внешние API - и все это в рамках одного задания без твоего участия. Не просто выполняет шаги, а мониторит процесс и сама корректирует маршрут если что-то пошло не так. Официальный кейс от Anthropic: миграция кодовой базы в 680 000 строк завершена меньше чем за сутки. Я до такого масштаба не добрался, но ощущение автономии - точно узнаю

Бенчмарки Terminal-Bench 4.0 - agentic coding:
🟢 Opus 5.5 - 66.4% - первое место среди всех публичных моделей
🟢 GPT-6 Astra - 57.9% - ближайший конкурент
🟢 Opus 5 - 52.3% - предыдущая версия, для понимания разрыва

OSWorld 2.0 (computer use): 81.8% - тоже лидер. GDPval-AA v2.1 (knowledge work): 1 846 Elo. Решает терминальные задачи примерно на 40% меньшим количеством шагов чем Opus 5 - это ощущается в реальной работе: меньше интервенций, больше автономии

Цена и скорость - тоже подтянули:
💡 Input/Output: $4/$20 за MTok - было $5/$25, минус 20%
💡 Cache reads: $0.20/MTok - было $0.50, минус 60%
💡 Скорость генерации: +30% к Opus 5
💡 Лимиты на Pro/Max/Team/Enterprise повышены - для тех кто гоняет агентов часами, это важно

Доступна на AWS, Google Cloud, Azure. В ближайшие недели обещают Sonnet 5.5 и Haiku 5.5 с теми же ключевыми улучшениями

Важный контекст релиза: накануне выпуска Дарио Амодеи опубликовал открытое письмо с призывом к индустрии замедлить темп разработки ведущих ИИ-систем. Opus 5.5 - именно такой продукт: не радикальный прыжок с воем маркетинга, а тихая глубокая итерация. По внутреннему поведенческому аудиту Anthropic - самый высокий alignment-результат среди всех протестированных моделей компании. Перед выпуском независимую верификацию провели Frontier Design и METR

💻 Alignment-аудит: лучший результат среди всех моделей Anthropic

💭 С Opus 4 я чувствовал мощь. С Opus 5 - скорость. С Opus 5.5 первый раз в истории этих моделей я чувствую что модель думает, а не просто выполняет команды. Поставил задачу, ушел - пришел, сделано. Это разница которую не опишешь скором на бенчмарке, но которую сутки реальной работы передают точно

Instagram | YouTube | Threads