Grok 4.5 возглавил рейтинг Long-Horizon Terminal-Bench, обойдя Claude 3.5 Sonnet, Opus 4.8, Fable 5 и GPT-5.5 в сложных задачах

Grok 4.5 возглавил рейтинг Long-Horizon Terminal-Bench, обойдя Claude 3.5 Sonnet, Opus 4.8, Fable 5 и GPT-5.5 в сложных задачах

Прокомментировать Просмотры: 5

Илон Маск объявил, что по результатам июльского тестирования 2026 года языковая модель Grok 4.5 возглавила престижный рейтинг Long-Horizon Terminal-Bench.

Long-Horizon Terminal-Bench (LHTB) представляет собой эталонный тест для оценки возможностей ИИ-агентов. Он фокусируется на проверке навыков многоуровневого планирования, глубокой аналитики и способности выстраивать последовательные алгоритмы действий в условиях интерфейса командной строки.

Grok 4.5 возглавил рейтинг Long-Horizon Terminal-Bench, обойдя Claude 3.5 Sonnet, Opus 4.8, Fable 5 и GPT-5.5 в сложных задачах
Визуализация Grok

С показателем эффективности 0,505 модель Grok 4.5 успешно завершила 13 из 46 предложенных сценариев. Столь высокий результат особенно впечатляет на фоне достижений её предшественницы, Grok 4.20, которой не удалось справиться ни с одной задачей из этого сложного испытания.

Благодаря этому успеху Grok 4.5 оставила позади таких конкурентов, как Claude Sonnet 5, Opus 4.8, Fable 5, GPT-5.5 и прочие актуальные нейросетевые модели.

Динамика показателей в тесте Long-Horizon Terminal-Bench
 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов