Grok 4.5 возглавил рейтинг Long-Horizon Terminal-Bench, обойдя Claude 3.5 Sonnet, Opus 4.8, Fable 5 и GPT-5.5 в сложных задачах
Илон Маск объявил, что по результатам июльского тестирования 2026 года языковая модель Grok 4.5 возглавила престижный рейтинг Long-Horizon Terminal-Bench.
Long-Horizon Terminal-Bench (LHTB) представляет собой эталонный тест для оценки возможностей ИИ-агентов. Он фокусируется на проверке навыков многоуровневого планирования, глубокой аналитики и способности выстраивать последовательные алгоритмы действий в условиях интерфейса командной строки.
_large.jpg)
С показателем эффективности 0,505 модель Grok 4.5 успешно завершила 13 из 46 предложенных сценариев. Столь высокий результат особенно впечатляет на фоне достижений её предшественницы, Grok 4.20, которой не удалось справиться ни с одной задачей из этого сложного испытания.
Благодаря этому успеху Grok 4.5 оставила позади таких конкурентов, как Claude Sonnet 5, Opus 4.8, Fable 5, GPT-5.5 и прочие актуальные нейросетевые модели.

Источник: iXBT
Выпуск 36 самолетов МС-21 в год планируют наладить к 2032 году
Мини-ПК Bosgame E6 ECO с Intel Core 3 304 и 12 ГБ ОЗУ оценили в 380 долларов
Инсайдеры раскрыли кодовые названия и камеры будущей линейки Samsung Galaxy S27
Уменьшенный российский лайнер МС-21-210 получил дальность полета в 5000 км
Космические «пули» со скоростью 32 млн км/ч озадачили ученых: телескоп Hubble сделал неожиданное открытие
Серийное производство импортозамещенного лайнера SJ-100 начнется этой осенью
Как молния ударила в китайскую ракету Long March 3B при взлете: видео повторения инцидента с «Аполлоном-12»
Десять лет блогу YADRO на Хабре: праздничный квиз с крутыми призами