Grok 4.6 от Илона Маска превзошел GPT-5.6 Sol и всех соперников в тесте MedAgentBench
Иллюстрация: сгенерировано нейросетью Grok
По словам Илона Маска, нейросеть Grok 4.6 возглавила рейтинг бенчмарка MedAgentBench. Данная платформа представляет собой специализированную симуляционную среду, предназначенную для всестороннего тестирования больших языковых моделей в качестве автономных медицинских ИИ-ассистентов.
В ходе тестирования, проведенного 17 августа, Grok 4.6 заняла лидирующую позицию, безошибочно решив 95,9% задач с первой попытки (метрика pass@1), тем самым опередив GPT-5.6 Sol, чей результат составил 94,7%.
Бенчмарк MedAgentBench ориентирован не столько на оценку теоретических знаний алгоритмов, сколько на проверку их практических навыков при автономной работе с электронными медицинскими картами пациентов. Комплекс включает в себя 10 категорий заданий, охватывающих 300 разнообразных клинических ситуаций.
Помимо высокой точности, Grok 4.6 продемонстрировала стабильную воспроизводимость результатов в повторных итерациях, улучшив показатели своей предшественницы Grok 4.5 на 2,5 процентных пункта.
Источник: iXBT
Землю неожиданно накрыла магнитная буря
Фишка как у Galaxy S26 Ultra: в новом Redmi K100 Pro Max модуль NFC работает не только через заднюю панель
Ninkear L20: ультракомпактный мини-ПК на базе Core Ultra 5 с производительностью 97 TOPS и поддержкой трех 4K-дисплеев в корпусе на 0,66 литра
Дрейфовавший почти месяц в океане Starship достиг острова Рождества
Забытая компьютерная арифметика: от тритов «Сетуни» и двух нулей «Аполлона» до HEX-магии Кармака
Развитие отечественной электроники обойдется россиянам в 136 миллиардов рублей
OnePlus 12 массово ломаются из-за проблем с материнской платой
Новый складной Samsung Galaxy Z Fold8 получил всего 4 балла за ремонтопригодность от iFixit