Grok 4.5 возглавил рейтинг Long-Horizon Terminal-Bench, обойдя Claude 3.5 Sonnet, Opus 4.8, Fable 5 и GPT-5.5 в сложных задачах
Визуализация Grok
Илон Маск объявил, что по результатам июльского тестирования 2026 года языковая модель Grok 4.5 возглавила престижный рейтинг Long-Horizon Terminal-Bench.
Long-Horizon Terminal-Bench (LHTB) представляет собой эталонный тест для оценки возможностей ИИ-агентов. Он фокусируется на проверке навыков многоуровневого планирования, глубокой аналитики и способности выстраивать последовательные алгоритмы действий в условиях интерфейса командной строки.
С показателем эффективности 0,505 модель Grok 4.5 успешно завершила 13 из 46 предложенных сценариев. Столь высокий результат особенно впечатляет на фоне достижений её предшественницы, Grok 4.20, которой не удалось справиться ни с одной задачей из этого сложного испытания.
Благодаря этому успеху Grok 4.5 оставила позади таких конкурентов, как Claude Sonnet 5, Opus 4.8, Fable 5, GPT-5.5 и прочие актуальные нейросетевые модели.

Источник: iXBT
Ideco сообщила о первом месте NGFW Novum по качеству в «Матрице импортозамещения 2026»
Более миллиарда строк данных россиян утекло в Сеть за полтора года: Россия возглавила список стран по публичным утечкам
Termidesk: новые требования ФСТЭК усиливают контроль доступа подрядчиков к объектам КИИ
М.Видео: предзаказы на iPhone 18 Pro и Pro Max в первый день выросли на 40%
Серверный ARM: перспектива для инфраструктуры или очередной провал
Новый обогреватель от Xiaomi: три секунды до тепла и всего 32 доллара
Vivo X500 Pro Max: первый Pro Max в линейке, способный заменить профкамеру, на официальных фото
В Китае поступил в продажу компактный насос Xiaomi, накачивающий шину за минуту