WearableQA: как LLM читают данные фитнес-трекеров

WearableQA: как LLM читают данные фитнес-трекеров

Ваши часы знают о вас больше, чем семейный врач. Пульс в покое за полтора года, вариабельность сердечного ритма, доля глубокого сна, каждая тренировка, каждая бессонная ночь. Логичный следующий шаг индустрии: подключить к этой истории языковую модель и спросить: «Ну как я себя чувствую?» Авторы бенчмарка WearableQA (arXiv:2609.05405, сентябрь 2026) решили проверить, способны ли современные LLM вообще на такое рассуждение. Ответ получился трезвящим: лучшая модель набирает 72.9% правильных ответов, большинство не дотягивает до 60%, а слабые отвечают почти на уровне случайного выбора.

Что такое WearableQA

WearableQA это бенчмарк из 4084 вопросов с множественным выбором, построенный на реальных данных 200 пользователей носимых устройств: до 500 дней ежедневных измерений, панель из 17 биомаркеров крови и демография. Он проверяет, может ли модель не просто процитировать медицинские знания, а вычислить ответ из зашумленного лонгитюдного ряда конкретного человека и правильно его интерпретировать.

Ключевое слово здесь «реальных». Похожие попытки вроде PHIA опирались на симулированные траектории пользователей, а медицинские бенчмарки вроде MedQA, MedMCQA и HealthBench вообще текстовые: они проверяют знание медицины, а не умение работать с данными. WearableQA сохраняет всю «грязь» настоящих носимых устройств: пропуски, шум датчиков, межличностную вариабельность. Именно поэтому случайный уровень в 10% (вопросы с десятью вариантами ответа) оказывается не таким уж смешным ориентиром: Llama-3.2-3B набирает 19.6%.

Из чего собран бенчмарк

Каждый из 200 пользователей представлен 16 ежедневными метриками из четырёх физиологических доменов. Это кардио-фитнес (пульс в покое, HRV, VO2max), активность и энергия (шаги, активные калории, базовый метаболизм, количество и длительность тренировок, средний пульс на тренировке, METs), сон (длительность, эффективность, доля глубокой и REM-фазы, регулярность отбоя) и средний уровень стресса. К этому добавляется панель крови с инсулином, HbA1c и другими биомаркерами, возраст, пол, ИМТ и этничность, а также перцентили по более крупной когорте для пяти опорных метрик, чтобы модель могла сравнить человека со сверстниками.

Вопросы организованы по таксономии 2×2. Первая ось делит их на data reasoning (вычислить что-то из самих измерений: тренд, аномалию, время восстановления после нагрузки) и health reasoning (интерпретировать результат физиологически: оценка риска, рекомендация, фенотипирование). Вторая ось отделяет вопросы об одном сигнале от вопросов, требующих связать два и более сигнала, например активность и пульс в покое. Получается 16 типов вопросов: примерно 2.7 тысячи на рассуждение по данным, 1.4 тысячи на интерпретацию, 1.7 тысячи односигнальных и 2.4 тысячи кросс-сигнальных.

Как сделать вопросы, которые нельзя вызубрить

Самая интересная часть работы это конструкция бенчмарка. Авторы называют подход dual grounding: каждый вопрос привязан либо к научной литературе, либо к статистически проверенному паттерну в самой когорте.

Литературная ветка строгая. Из пула рецензируемых исследований потребительских носимых устройств оставили только 11 опорных работ из журналов уровня Nature Medicine и PNAS, каждую прочитали в полном тексте и сверили идентификаторы по DOI, PMID и PMCID. Каждая физиологическая связь обязана подтверждаться минимум двумя независимыми исследованиями с одинаковым направлением эффекта. Пороговые значения из статей сознательно не переносили: они зависят от когорты и плохо переносятся между популяциями.

Популяционная ветка добывает паттерны прямо из данных: тренды, аномальные эпизоды, динамику восстановления, кросс-сигнальные связи в 28-дневном окне. Кандидат становится вопросом, только если проходит серию статистических ворот: корреляция не слабее |ρ| ≥ 0.5 с одинаковым знаком в обеих половинах окна, отрыв правильного ответа от второго варианта не меньше 0.15, устойчивость при бутстрепе (воспроизводится минимум в 80% из 30 ресемплов) и при удалении любого отдельного дня. Наконец, кросс-юзерный нулевой тест: ту же статистику считают на намеренно перепутанных парах пользователей, и паттерн отбрасывают, если эмпирический уровень ложных открытий выше 0.20.

Ответ при этом не утверждается заранее, а перевычисляется детерминированной программой из сырых измерений конкретного человека (подход discover-then-label). Например, вопрос о «сильнейшей паре» сигналов запускает lagged_correlation с лагами до трёх дней по всем кандидатным парам и берёт argmax. Это делает бенчмарк устойчивым к запоминанию: даже если модель видела похожий вопрос, ответ зависит от данных конкретного юзера.

Результаты: один лидер и длинный хвост

В бенчмарке прогнали 14 моделей, проприетарных и открытых, в едином протоколе: 500 дней истории построчным текстом, chain-of-thought, температура 0.

Модель Данные Здоровье Один сигнал Кросс-сигнал Среднее
Gemini 3.1 Pro 75.4 67.8 72.4 73.2 72.9
Claude Opus 4.6 57.1 66.3 64.9 56.8 60.2
Claude Sonnet 4 47.1 65.2 59.8 48.5 53.2
GPT-5.4 45.0 63.5 59.1 45.7 51.2
Gemini 2.5 Pro 47.5 56.8 58.1 45.3 50.6
GPT-4o 25.3 53.5 32.3 36.4 34.7
Gemma-4-26B-A4B (open) 33.8 59.8 41.0 43.5 42.5
Llama-3.2-3B (open) 13.6 31.7 16.2 22.1 19.6

Gemini 3.1 Pro обгоняет ближайшего конкурента, Claude Opus 4.6, на 12.7 процентных пункта и при этом единственная модель, у которой рассуждение по данным сильнее медицинской интерпретации (75.4% против 67.8%). У всех остальных картина зеркальная, и разрыв бывает огромным: у GPT-4o 53.5% на health reasoning против 25.3% на data reasoning, у Mistral-Small-3.1 47.9% против 20.0%. Среди открытых моделей лучшая, Gemma-4-26B-A4B, обходит GPT-4o на 7.8 пункта, но отстаёт от лидера на 30.4.

Разбивка по типам вопросов показывает, где именно модели ломаются. Gemini 3.1 Pro набирает 94.4% на подсчёте выходов метрики за порог, но всего 35.9% на вопросах о времени восстановления. Сильные проприетарные модели превышают 80% на оценке рисков и фенотипировании, однако кросс-сигнальное предсказание (вывести один сигнал из связи с другим) проваливают почти все: от 8.3% у Llama-3.1-8B до максимум 40.5% у Claude Opus 4.6.

Модели угадывают знакомое вместо того, чтобы читать данные

Самый диагностический эксперимент статьи сравнивает два вида пар сигналов. Дефиниционные пары связаны по построению (шаги и активные калории), их связь модель знает заранее. Эмпирические пары вроде «пульс в покое и уровень стресса» нужно реально прочитать из ряда. Оба набора подобраны с одинаковой силой связи, так что разница в точности это чистая мера опоры на приоры.

Разрыв у многих моделей огромный: Gemini 2.5 Pro даёт +51.5 пункта в пользу дефиниционных пар, GPT-5.4 +48.2, GPT-4o +36.0. И только три модели почти не различают два режима: Claude Opus 4.6 и Gemini 3.1 Pro с разрывом +4.0 и Claude Sonnet 4 с +4.4. Проще говоря, большинство моделей узнают знакомую физиологию, но не умеют обнаружить такую же по силе связь в конкретных измерениях конкретного человека.

Похожую картину даёт анализ позиционных смещений. Ответы в бенчмарке равномерно размазаны по десяти позициям, но Llama-3.2-3B в режиме прямого ответа выбирает одну и ту же букву в 51.5% случаев. Chain-of-thought снижает этот перекос до 13.5% и вообще заметно помогает проприетарным моделям: Claude Opus 4.6 выигрывает до 27 пунктов на односигнальных вопросах. Открытые модели от CoT выигрывают мало, в среднем 2-3 пункта, что само по себе говорит о качестве их рассуждений.

Практический вывод: не формат данных, а инструмент

Для тех, кто строит health-ассистентов, самая ценная часть статьи это абляции по представлению входа. Авторы скармливали GPT-5.4 одни и те же данные в разных форматах. Построчный текст даёт 51.2%, колоночный 50.3%, CSV 51.5%, Markdown 49.9%, Markdown со статистической сводкой 51.9%. То есть формат почти ничего не решает. А вот превращение рядов в картинки активно вредит: отдельные графики по каждому сигналу роняют точность до 36.6%, сгруппированные до 34.1%. Мультимодальность здесь не помощник.

Решает другое. Доступ к Python в агентном режиме поднимает ту же GPT-5.4 с 51.2% до 71.3%, то есть +20.1 пункта. Причём право агента самому выбирать представление данных ничего сверху не даёт (69.7%): вычисление важнее визуализации. Вывод напрашивается сам: LLM плохо считает по временным рядам «в уме», но отлично планирует вычисления. Архитектура «модель рассуждает, код считает» здесь не опция, а необходимость.

Отдельно авторы проверили, что бенчмарк вообще измеряет то, что заявляет. Если убрать из контекста длинную историю, точность на вопросах, зависящих от истории, падает с 75.9% до 39.8%, а на вопросах про текущее окно не меняется. Если убрать все временные ряды целиком, общая точность Claude Opus 4.6 обваливается с 60.2% до 17.3%. Значит, отвечать «по здравому смыслу» в WearableQA не получается, данные действительно нужны.

Часто задаваемые вопросы

Чем WearableQA отличается от MedQA и HealthBench?

Те бенчмарки текстовые: они проверяют знание медицины по экзаменационным вопросам и клиническим сценариям. WearableQA проверяет другое умение: вычислить ответ из 500 дней зашумленных измерений реального человека и интерпретировать его физиологически. Модель может отлично знать медицину и при этом провалить бенчмарк.

Почему Gemini 3.1 Pro так выделяется?

Это единственная модель, у которой точность на вычислениях по данным выше, чем на медицинской интерпретации (75.4% против 67.8%), и единственная без перекоса в пользу «знакомых» связей. Причины в статье не раскрываются, но разрыв в 12.7 пункта с ближайшим конкурентом говорит о качественно другом уровне работы с длинными числовыми контекстами.

Можно ли доверять ChatGPT анализ данных своих часов?

В чистом виде нет. Даже сильные модели ошибаются в 30-50% случаев, когда ответ нужно вычислить из ряда. Если сервис даёт модели инструмент для вычислений (агентный режим с Python), картина резко улучшается: в эксперименте это дало +20 пунктов. Спрашивайте у своего приложения, как именно оно считает.

Итог

WearableQA впервые честно измерил то, о чём индустрия говорит уже пару лет: персонального health-ассистента на базе LLM. Измерил и обнаружил, что до него далеко. Модели цитируют медицину лучше, чем читают данные, узнают знакомые связи вместо того, чтобы находить новые, и решают десятую часть задачи за счёт позиционных уловок. Хорошая новость в том, что главное лекарство уже известно и измерено: дайте модели Python, и точность вырастет на 20 пунктов. Если строите продукт на данных носимых устройств, начните с того, что отнимете у модели право считать в голове.

← Все записи