Grok 4.6 от Илона Маска превзошел GPT-5.6 Sol и всех соперников в тесте MedAgentBench

Прокомментировать Просмотры: 4

Иллюстрация: сгенерировано нейросетью Grok

По словам Илона Маска, нейросеть Grok 4.6 возглавила рейтинг бенчмарка MedAgentBench. Данная платформа представляет собой специализированную симуляционную среду, предназначенную для всестороннего тестирования больших языковых моделей в качестве автономных медицинских ИИ-ассистентов.

В ходе тестирования, проведенного 17 августа, Grok 4.6 заняла лидирующую позицию, безошибочно решив 95,9% задач с первой попытки (метрика pass@1), тем самым опередив GPT-5.6 Sol, чей результат составил 94,7%.

Бенчмарк MedAgentBench ориентирован не столько на оценку теоретических знаний алгоритмов, сколько на проверку их практических навыков при автономной работе с электронными медицинскими картами пациентов. Комплекс включает в себя 10 категорий заданий, охватывающих 300 разнообразных клинических ситуаций.

Помимо высокой точности, Grok 4.6 продемонстрировала стабильную воспроизводимость результатов в повторных итерациях, улучшив показатели своей предшественницы Grok 4.5 на 2,5 процентных пункта.

 

Источник: iXBT

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов