Почему нельзя просто загрузить данные с фитнес-браслета в нейросеть для оценки здоровья
Исследовательские группы из Meta и KAIST задались целью проверить очевидную гипотезу: если предоставить передовой языковой модели реальную телеметрию за полгода — статистику сна, динамику пульса и суточную активность, — сможет ли она интерпретировать эти сведения столь же филигранно, сколь уверенно оперирует общими медицинскими терминами? Итоги эксперимента оказались парадоксальными. Нейросети справлялись с базовыми арифметическими вычислениями по сырым массивам данных в разы хуже, чем с последующей клинической оценкой этих же показателей. Так, GPT-4o безошибочно определяла тренды и аномалии лишь в 25% случаев, тогда как делать масштабные выводы о потенциальных рисках на основе тех же цифр ей удавалось с куда большей уверенностью.
Здравый смысл подсказывает обратное: медицинская аналитика — это вершина экспертной экспертизы, требующая глубоких профильных компетенций, тогда как банальный расчет среднего арифметического или поиск пиковых значений в числовом ряду выглядит сугубо технической рутиной. Тем не менее, для современных LLM алгоритм работает иначе. Подобный дисбаланс навыков носит системный характер, что и зафиксировали авторы бенчмарка WearableQA, протестировавшие сразу 14 актуальных моделей. Давайте разберем, к чему это обязывает каждого, кто задумывается о передаче личных медицинских метрик на откуп искусственному интеллекту.

Почему «сырые» графики с гаджетов ставят ИИ в тупик
Концепция интеграции LLM в экосистему носимых гаджетов развивается стремительно, однако методология их тестирования до сих пор вызывала вопросы. Большинство существующих бенчмарков опирается на лабораторные, искусственно смоделированные ряды, а не на хаотичную живую биометрию. Разница колоссальна: синтетический датасет стерилен и предсказуем, словно задача из школьного учебника. В то же время лог реального пользователя полон артефактов датчиков, пропущенных дней, индивидуальных физиологических особенностей и фонового шума, воспроизвести которые в искусственных условиях невозможно.
Создатели WearableQA подошли к задаче фундаментально. Они проанализировали лог-файлы двухсот реальных людей, собранные за период вплоть до полутора лет. К каждому профилю добавили лабораторные панели (уровень инсулина, гликированный гемоглобин и еще полтора десятка биомаркеров), а также базово-демографический контекст: возраст, антропометрию и этнос. В итоге сформировался массив из 4084 вопросов с десятью вариантами ответа каждый — именно с такими вызовами сталкивается виртуальный ассистент, получая доступ к вашей персональной медицинской карте.

Верификация фактов в контексте живой физиологии
Для создания валидных тестовых вопросов требовался безупречный эталонный ответ. Опираться на интуицию здесь нельзя — требовалась строгая опора на авторитетную медицинскую литературу либо неоспоримые статистические корреляции.
Исследователи объединили оба подхода. База знаний формировалась на основе 11 рецензируемых трудов из ведущих изданий вроде Nature Medicine и PNAS. Каждая публикация проходила верификацию по идентификаторам DOI, PMID и PMCID, а зафиксированная закономерность должна была подтверждаться как минимум двумя независимыми исследованиями сонаправленного характера.
Вторая часть вопросов формировалась эмпирически из пользовательских профилей: алгоритмы искали устойчивые паттерны, скачки и взаимосвязи метрик. Однако простая корреляция не становилась фактом без трехступенчатой фильтрации.
Первый фильтр — сила связи: коэффициент корреляции не ниже 0,5 с неизменным знаком на обеих половинах временной шкалы. Второй — робастность: паттерн обязан был сохраняться при пересэмплировании (минимум в 80% из 30 итераций) и не исчезать при исключении произвольных суток. Третий — семантическая чистота: гипотезы тестировались на перемешанных парах случайных пользователей для отсеивания математических артефактов, маскирующихся под реальную физиологию.
В финальный пул вошли лишь те маркеры, что преодолели все барьеры. Дистракторы (неправильные варианты) конструировались так, чтобы исключить угадывание по лингвистическим подсказкам без обращения к фактическим данным.
Дихотомия мыслительных процессов в новом бенчмарке
Все задания разделены на две перпендикулярные оси. Первая определяет когнитивный характер задачи. Часть вопросов требует прямого математического анализа числовых рядов: вычисления трендов, амплитуды скачков, времени восстановления или поиска максимальной кросс-корреляции. Другие задачи нацелены на интерпретацию — прогнозирование, оценку рисков и выдачу рекомендаций на стыке клинических знаний и персональной статистики.
Вторая ось классифицирует сложность по числу задействованных метрик. Одни кейсы оперируют единственным сигналом (например, исключительно пульсом), тогда как другие требуют синтеза нескольких параметров — скажем, комплексной оценки взаимосвязи между двигательной активностью и динамикой сердечного ритма в состоянии покоя.

Подобная таксономия образует 16 уникальных категорий, позволяющих точно локализовать когнитивные сбои модели: понимание профильной теории, вычислительные способности или дефицит навыков агрегации разнородных данных.
Ключевые инсайтинговые открытия
Тестирование 14 систем (от флагманских GPT-4o и Gemini 2.5 Pro до легковесных Llama и Gemma) показало разброс точности от 19,6% до 72,9% при базовой вероятности случайного попадания в 10%. И если превосходство более массивных архитектур закономерно, то качественное распределение ошибок преподнесло сюрприз.
Практически у всех протестированных участников точность интерпретационных задач оказалась существенно выше аналитической работы с сырыми рядами. У GPT-4o этот разрыв составил 25,3% против 53,5%, у компактной Gemma-4-26B — 33,8% против 59,8%, у Mistral-Small — 20% против 47,9%. Исключением стала лишь Gemini 3.1 Pro, продемонстрировавшая зеркальные результаты: 75,4% в вычислениях против 67,8% в интерпретации.
Причина кроется не в легковесности клинической логики, а в механизме генерации ответов. Вынося суждение о рисках, нейросеть опирается на параметрическую память — массив заученных в процессе обучения медицинских фактов. Это напоминает отличника, успешно сдающего экзамен за счет зубрежки теории без погружения в практическую часть билета. Однако для поиска локальных аномалий в персональном архиве общих знаний недостаточно — требуется реальная обработка специфического цифрового массива.
Эту гипотезу подтвердил дополнительный эксперимент. Исследователи сопоставили пары метрик с очевидной (например, шаги и сожженные калории) и скрытой (пульс в покое и уровень стресса) связью при равных коэффициентах корреляции. Преимущество на очевидных парах оказалось ошеломляющим: у Gemini 2.5 Pro разница составила почти 52 процентных пункта, у GPT-5.4 — около 48. Модели предпочитают воспроизводить знакомые паттерны, нежели производить детекцию неочевидных зависимостей.
Мертвая зона: мультимодальный синтез показателей
Второй блок изысканий, посвященный перекрестному анализу нескольких метрик, выявил аналогичные уязвимости. Продуктивность большинства коммерческих моделей на одиночных сигналах стабильно превосходила мультимодальные сценарии. У GPT-5.4 этот разрыв зафиксирован на отметке 59,1% против 45,7%, у Gemini 2.5 Pro — 58,1% против 45,3%.
Особо проблемной зоной стало прогнозирование динамики одного показателя через корреляцию с другим (cross-signal prediction). Здесь показатели упали до критических значений: от 8,3% у Llama-3.1-8B до 40,5% у Claude Opus 4.6 (при случайном попадании в 10%). Лучшие образцы индустрии превосходят слепой жребий всего в 4 раза, тогда как на базовых тестах этот отрыв достигает восьмикратного превосходства.
Визуализация вредит, а Python спасает положение
Авторы изучили влияние формата представления информации. Сравнение текстовых представлений (строковых дампов, таблиц, Markdown и CSV) продемонстрировало минимальные колебания в пределах 1–2%. А вот графическое представление данных дало неожиданный откат: точность обвалилась с 51,2% (на обычном тексте) до 36,6% при раздельной подаче графиков и до 34,1% при их группировке.
Кардинальный перелом произошел в момент предоставления моделям интерпретатора Python с возможностью программного просчета метрик. В этом сценарии общая точность взлетела с 51,2% до 71,3%, прибавив почти 20 процентных пунктов. Проблема кроется не в неспособности ИИ оперировать временными рядами как концептом, а в несостоятельности ментальной арифметики при работе с объемными цифровыми массивами. Предоставление полноценной вычислительной среды стирает грань между теоретическими познаниями и техническим анализом.
Интересным курьезом обернулся эксперимент с отключением пошаговых рассуждений (Chain-of-Thought). Принудительный перевод в режим мгновенной выдачи ответов провоцировал у компактных моделей сильную статистическую предвзятость. Так, Llama-3.2-3B выбирала одну и ту же букву в 51,5% случаев независимо от контекста задания. Включение цепочки рассуждений нивелировало этот перекос, снизив долю до 13,5%. Аналогичные, хоть и менее выраженные склонности к выбору определенных вариантов прослеживались и у проприетарных флагманов.
Резюме
Результаты WearableQA формируют трезвый взгляд на перспективы внедрения ИИ-консультантов в персональную медицинскую практику. Уверенные формулировки языковой модели относительно вашего самочувствия далеко не всегда базируются на скрупулезном аудите персональных биометрических логов. С высокой долей вероятности система просто воспроизводит правдоподобные общие концепции физиологии, абстрагируясь от специфики вашей индивидуальной статистики. Распознать эту подмену визуально практически невозможно, поскольку оба типа ответов звучат одинаково авторитетно.
Главный практический инсайт для разработчиков медицинского ПО очевиден: опираясь на опыт интеграции Python-песочниц, единственный надежный способ приучить модель анализировать, а не имитировать бурную деятельность — обеспечить ее специализированными инструментами математических расчетов.
А вы сохранили бы прежний уровень доверия к своему фитнес-трекеру, если бы достоверно знали, что его интеллектуальный ассистент руководствуется усредненными медицинскими постулатами, а не вашими личными показателями?


Один бильярдный шар теоретически способен произвести любое вычисление
Снятся ли трехмерному андроиду четырехмерные овцы?
Энергия на тысячу лет: как работают ядерные реакторы IV поколения
Почему контакт с природой жизненно необходим: что говорят научные исследования
Пленники чужого разума: что принесет нам сверх-ИИ?
Бактерии на заброшенном заводе в Питтсбурге начали питаться промзооходами