Grok 4.6 от Илона Маска превзошел GPT-5.6 Sol и всех соперников в тесте MedAgentBench
Иллюстрация: сгенерировано нейросетью Grok
По словам Илона Маска, нейросеть Grok 4.6 возглавила рейтинг бенчмарка MedAgentBench. Данная платформа представляет собой специализированную симуляционную среду, предназначенную для всестороннего тестирования больших языковых моделей в качестве автономных медицинских ИИ-ассистентов.
В ходе тестирования, проведенного 17 августа, Grok 4.6 заняла лидирующую позицию, безошибочно решив 95,9% задач с первой попытки (метрика pass@1), тем самым опередив GPT-5.6 Sol, чей результат составил 94,7%.
Бенчмарк MedAgentBench ориентирован не столько на оценку теоретических знаний алгоритмов, сколько на проверку их практических навыков при автономной работе с электронными медицинскими картами пациентов. Комплекс включает в себя 10 категорий заданий, охватывающих 300 разнообразных клинических ситуаций.
Помимо высокой точности, Grok 4.6 продемонстрировала стабильную воспроизводимость результатов в повторных итерациях, улучшив показатели своей предшественницы Grok 4.5 на 2,5 процентных пункта.
Источник: iXBT
В Китае поступил в продажу двухместный летающий «НЛО»-амфибия за $120 000
Игроки смогут сами на лету создавать ремастеры старых игр с помощью нейросетей: представлен проект Uncanny
Создатели системы посадки Falcon 9 из SpaceX удостоены первой в истории премии Нила Армстронга
Аудитория ColorOS превысила 770 млн человек: скоро выйдет обновление ColorOS 17 для Oppo, OnePlus и Realme
Новый фильм Resident Evil стал триумфом и одной из лучших игровых адаптаций в истории с 97% на Rotten Tomatoes
ChatGPT попрощается с GPT-5.5 уже 14 октября
Опубликовано первое сравнение камер iPhone 18 Pro Max и Samsung Galaxy S26 Ultra
Закат легенды: Emirates меняет гиганты Airbus A380 на более тесные Boeing 777X