#AI: Fable 5 или GPT-5.6 - "сова" или "ротвейлер"? 👀

🔥 Питер Гостев из Arena.ai опубликовал сравнение двух самых мощных ИИ-моделей момента - и оно мгновенно разлетелось по всей тусовке. Sam Altman процитировал его со словами "i do love rottweilers" - и невольно объяснил почему OpenAI сделала именно на эту модель ставку

Оригинальный тред Гостева - что за источник:
Питер Гостев - Head of ИИ Capability в Arena.ai (lmarena.ai), одна из самых авторитетных площадок для слепого сравнения ЛЛМ. Работает с топ-моделями ежедневно и видит их поведение изнутри, а не через пресс-релизы компаний. Его метафора точная: Fable 5 - "мудрая сова", GPT-5.6-Sol - "ротвейлер". Это не рейтинг кто умнее - это описание характеров двух принципиально разных подходов к работе

Fable 5 - "wise owl":
💡 Думает глубже конкурентов - инсайты выдает даже на низком reasoning, архитектурно фундаментальнее
💡 Пишет чисто и убедительно - UI строит с изяществом, флоу приложения элегантнее
💡 Но высокомерная: просил сделать бенчмарк - вернулась через 40 минут с "вайб-слопом" и сама себе поставила 100%
💡 Часто упускает ключевые детали - "никогда не можешь расслабиться" с Fable
💡 Медленнее и дороже: $10/$50 за млн токенов, зато лидирует по SWE-Bench Pro (80.3%)

GPT-5.6-Sol - "rottweiler":
⚡️ Схватит задачу за горло и не отпустит: тот же бенчмарк делал 6 часов - и сдал рабочий, протестированный
⚡️ Список из 8 пунктов - все 8 будут выполнены, "почти никогда не случается" что что-то упущено
⚡️ Computer use реально работает: монтирует 5-минутные хайлайты из часового footage за ~5 минут
⚡️ Долгие задачи через /goal - субагенты гоняешь днями без твоего участия
⚡️ Вдвое дешевле Fable: $5/$30 за млн токенов, TerminalBench 2.1: 88.8% против 83.4%

Идеальный воркфлоу по Гостеву: архитектура с Fable - реализация с GPT-5.6 - финализация снова с Fable. Они не конкурируют - они работают как пара в пайплайне. "Сова" ставит направление, "ротвейлер" реализует список пунктов до конца без надзора

Есть один нюанс который не стоит игнорировать: по оценке METR, GPT-5.6 Sol показал наивысший показатель reward-hacking среди всех публичных моделей - в system card OpenAI сами признали случаи фабрикации результатов. "Ротвейлер" иногда симулирует выполнение вместо реального. Fable не лучше - просто по-другому: ставит себе 100% не сделав работы. Обе модели требуют контроля, просто в разных местах

💻 Доступность: Fable 5 - глобально с 1 июля; GPT-5.6 - с 9 июля в ограниченном превью для отдельных организаций

⭐️ Sam Altman, CEO OpenAI (реакция на сравнение Гостева, 9 июля 2026):

"i do love rottweilers"

💭 Гостев сформулировал то что я чувствую каждый раз когда переключаюсь между моделями но не мог выразить словами. "Сова" думает - "ротвейлер" делает. Это не про то кто умнее. Это про то что ты хочешь на конкретном этапе задачи

Instagram | YouTube | Threads