Evo 2 + линейные зонды: точная детекция антибиотикорезистентности без дообучения

Evo 2 + линейные зонды: точная детекция антибиотикорезистентности без дообучения

Обычно, чтобы использовать фундаментальную модель для новой задачи, её нужно дообучать. Для 7-миллиардной геномной модели Evo 2 это означает часы на GPU-кластере, тонны размеченных данных и риск катастрофического забывания. Но исследование из AIxBio Hackathon 2026 показывает обратное: замороженные эмбеддинги 26-го слоя Evo 2 уже содержат биобезопасностный сигнал, и его достаточно извлечь однослойным линейным зондом. Результат: ROC-AUC 0.888 для детекции антимикробной резистентности (AMR), рост до 0.977 при добавлении attention-пулинга и стабильные 0.898 на симулированных коротких прочтениях Illumina без какого-либо переобучения.

Это не академический артефакт. Метатеномный бионадзор: область, где скорость критична: вспышка резистентной инфекции или попытка скрытно синтезировать патоген требуют детекции за часы, а не дни. Если эмбеддинги генетической модели действительно хранят сигнал об устойчивости к антибиотикам, открываются пути к быстрым screening-пайплайнам там, где классические методы выравнивания по базам CARD или ResFinder требуют трудоёмкой сборки контигов.

Что такое Evo 2 и почему взяли именно его

Evo 2: это 7-миллиардная фундаментальная модель для ДНК от Arc Institute (Brixi et al., 2026, Nature). Модель обучена предсказывать следующий токен на последовательностях полного дерева жизни: от бактерий и архей до эукариот и вирусов. Контекстное окно: 262 тысяч нуклеотидов, что позволяет захватывать дальние геномные взаимодействия и структурные мотивы.

Интересный факт: Evo 2 можно использовать не как генератор, а как извлекатель признаков. Подаёте последовательность ДНК на вход, делаете один forward pass и забираете внутренние активации из residual stream на любом слое. Для слоя 26 каждая позиция (нуклеотид) получает 4096-мерный вектор, описывающий её в контексте всей последовательности. Этот вектор, и есть эмбеддинг, с которым уже можно работать.

Почему именно слой 26? Предыдущая работа Goodfire Sparse Autoencoder показала, что на этом слое модель уже различает кодирующие последовательности (CDS), промоторы и другие базовые биологические элементы. Команда из AIxBio выдвинула гипотезу: если слой уже разбирается в фундаментальных биологических структурах, он, вероятно, хранит и более специфический биобезопасностный сигнал: устойчивость к антибиотикам, факторы вирулентности.

Методология: минимум параметров, максимум эффективности

Исследователи обучали два типа зондов на замороженных активациях 26-го слоя. Первый: классический линейный зонд (single-layer perceptron), который для каждой позиции последовательности выдаёт логит, а затем усредняет по региону через mean-pooling. Второй: attention-зонд, который обучается непосредственно на region-level objective: он сам учится взвешивать позиции через механизм внимания и выдавать один агрегированный логит на весь регион.

Оба зонда имеют порядка 4096 обучаемых параметров, в сотни тысяч раз меньше, чем базовая модель. Это не дообучение в обычном смысле: это буквально матрица весов + bias. Обучение занимает минуты на одном GPU, а не часы.

Данные для обучения брались из трёх источников. MGnify (816 MAG из куриного кишечника, 255 MAG с кожи человека, 901 вид бактерий), для CDS-последовательностей с аннотациями AMR. VFDB (Virulence Factor Database, 34 вида), для вирулентности. SynGenome (сгенерированные Evo 1.5 последовательности длиной до 5 kb), для проверки, сохраняются ли AMR-ассоциированные сигналы в синтетических геномах.

Критически важный момент: сплит данных делался по MAG-уровню или по виду. Это значит, что тестовая выборка содержала абсолютно новые организмы, не встречавшиеся при обучении. Зонд не запоминает конкретные гены: он учится извлекать общий сигнал об устойчивости.

Результаты: от бинарной детекции до классов препаратов

На основной задаче: бинарная классификация «AMR или не AMR», линейный зонд показал region-level ROC-AUC 0.888 при mean-pooling. Attention-зонд поднял планку до 0.977. Для сравнения: это уровень лучших специализированных моделей, обученных на конкретных генах резистентности, но здесь мы говорим о замороженных эмбеддингах фундаментальной модели общего назначения.

Более впечатляюще выглядят результаты по отдельным классам препаратов. Команда обучила пять отдельных зондов: по одному на каждый из наиболее распространённых классов: гликопептиды, макролиды, бета-лактамы, аминогликозиды и фениколы. В режиме «one-vs-rest» (отличить свой класс от четырёх остальных AMR-классов) все пять зондов показали in-distribution ROC-AUC выше 0.98. Бета-лактам достиг 0.998.

Но настоящая проверка: transfer-оценка. Каждый зонд тестировали на негативных примерах, которых он не видел при обучении: стресс-реакции (STRESS), вирулентность (VIRULENCE) и общий негативный пул MGnify. Идея в том, чтобы проверить: действительно ли зонд детектирует именно устойчивость к препаратам, или он просто реагирует на любой функциональный ген? Результаты почти везде выше 0.95: сигнал действительно специфичен. Единственное исключение: бета-лактам против вирулентности (0.783), что, по мнению авторов, может отражать биологическое пересечение между этими классами генов.

Вирулентность детектировалась слабее: ROC-AUC 0.833. Это не удивительно: факторы вирулентности более разнообразны по структуре и функции, чем гены резистентности, и сигнал в эмбеддингах распределён менее компактно. Тем не менее, 0.833: это всё равно работоспособный screening-уровень для первой пробы.

Synthetic reads: когда сборка невозможна

Один из самых практически ценных результатов: работа зондов на симулированных коротких прочтениях Illumina. Исследователи сгенерировали synthetic reads с моделью ошибок MiSeq из длинных MAG-последовательностей и подали их в те же самые линейные зонды, не переобучая.

Результат: read-level ROC-AUC 0.898: практически то же, что и на длинных регионах (0.888 mean-pool). Это означает, что зонды могут работать в режиме real-time biosurveillance: вы получаете поток коротких прочтений с секвенатора, прогоняете их через эмбеддер Evo 2, и зонд помечает потенциальные AMR-фрагменты: ещё до сборки контигов. В реальных условиях сборка занимает часы и часто ненадёжна для низких концентраций патогена; embedding-based подход снимает этот шаг.

Важная оговорка: симулированные reads: это оптимистичная модель. Настоящие клинические образцы содержат смесь организмов, разную глубину покрытия, химерные последовательности и артефакты ПЦР. Авторы прямо указывают, что следующий необходимый шаг: валидация на реальных лабораторных образцах.

SynGenome: проверка сгенерированных геномов

Отдельный эксперимент касался SynGenome: базы данных последовательностей, сгенерированных моделью Evo 1.5 (предшественницей Evo 2) с промптами, ассоциированными с AMR. Задача: могут ли зонды отличить «AMR-ассоциированные» сгенерированные последовательности от «не AMR-ассоциированных» по меткам промпта?

Результат: слабая сепарабельность (см. Figure 1(d) в статье). Это не означает, что сгенерированные последовательности функционально не обладают резистентностью: wet-lab валидация необходима. Возможно, промпт-метки плохо соответствуют реальным функциям ORF, или что зонд теряет сигнал при работе на синтетических последовательностях.

Это согласуется с выводами Ikonomova et al. (2025): последовательности, удовлетворяющие in silico структурным ограничениям, не всегда сохраняют заявленную биологическую функцию. Но именно поэтому SynGenome-эксперимент важен: он показывает границы применимости подхода и напоминает, что prompt-based labeling: не замена функциональной валидации.

Sparse Autoencoders: альтернативный путь интерпретации

Параллельно с зондами команда экспериментировала с Goodfire Sparse Autoencoder: методом, который раскладывает высокоразмерные эмбеддинги на разреженные интерпретируемые признаки. В отличие от зондов (которые обучаются supervised на целевую задачу), SAE: unsupervised метод, и его применили к активациям без дообучения.

Результаты смешанные: SAE действительно восстановил некоторые макролид-ассоциированные признаки с консистентной активацией по датасетам, но общая производительность оказалась ниже, чем у supervised-зондов. Это ожидаемо: SAE обучался на другом распределении и применялся out-of-distribution. Тем не менее, подход показал принципиальную возможность: если обучить SAE прямо на биобезопасностных данных, он может давать более интерпретируемые результаты, чем чёрный ящик зонда.

Что это значит для практики

Исследование позиционирует себя как proof-of-concept для embedding-based biosurveillance. Основные практические выводы:

Скорость. Зонды работают на замороженных активациях: никаких итераций с фундаментальной моделью. Это открывает путь к parallel training множества зондов на разные биобезопасностные задачи: резистентность, вирулентность, токсины. Каждая проверка занимает минуты на одном GPU.

Масштабируемость. Поскольку веса зонда: это просто матрица 4096×N, добавление новой категории сводится к обучению новой матрицы на размеченных данных. Сама Evo 2 не трогается, что экономит вычислительные ресурсы и избавляет от рисковcatastrophic forgetting.

Двойственное использование. Тот же подход можно применять для скрининга заказов на синтез ДНК: если компания получает заказ на сборку последовательности, она может прогнать её через Evo 2 + зонды и автоматически отфлажить потенциально опасные элементы (токсины, عوامل вирулентности, гены резистентности).

Авторы подчёркивают, что их работа: часть более широкой экосистемы biosafety. SecureBio's Outward Assembly, CARD/ResFinder/AMRFinderPlus alignment pipelines, и другие подходы не заменяются зондами, а дополняются: embedding-скрининг может работать как первый, быстрый pass, а alignment-методы, как подтверждающая стадия.

Ограничения и следующие шаги

Исследование не лишено ограничений. Simulated reads: это идеализированные данные, не учитывающие химерность клинических образцов. Transfer AUC на вирулентности проседает (0.783 для бета-лактама), что требует дальнейшего изучения. SynGenome эксперимент показал слабую сепарабельность: значит, подход не панацея для скрининга сгенерированных последовательностей. И, что критически, сам код и данные пока остаются приватными по биобезопасностным соображениям: воспроизводимость ограничена.

Следующие очевидные шаги: валидация на реальных клинических метатеномных образцах, расширение attention-зондов на per-drug-class и read-level задачи (где они предположительно также улучшат метрики), обучение domain-specific SAE, и: самое важное: парное тестирование с лабораторно подтверждёнными синтетическими геномами, чтобы превратить SynGenome-амбицию в количественный бенчмарк.

Часто задаваемые вопросы

Почему ROC-AUC 0.977: это много или мало?

В медицинских диагностических тестах ROC-AUC выше 0.9 обычно считается отличным результатом, выше 0.95: выдающимся. Значение 0.977 означает, что случайно взятая положительная последовательность получит выше порогового значения с вероятностью 97.7%. Для скрининга на уровне первой пробы (triage) это более чем достаточно: метод годится для отсева явно безопасных образцов и направления подозрительных на углублённый анализ.

Не опасна ли публикация такого исследования?

Это классический dual-use вопрос. С одной стороны, знание о том, что эмбеддинги хранят AMR-сигнал, может использоваться для обхода скрининга. С другой: именно эта работа закладывает основы для защитных систем: быстрый embedding-based screening заказов на синтез ДНК. Авторы осознанно не публикуют код и данные, что отражает текущий баланс между открытостью и биобезопасностью.

Можно ли применить этот подход к другим геномным моделям?

Принципиально: да. Paradigm «замороженные эмбеддинги + линейный зонд» универсален и применяется в NLP уже много лет (Alain & Bengio, 2016). Для DNABERT, Nucleotide Transformer, HyenaDNA или METAGENE-1 можно провести аналогичные эксперименты. Выбор Evo 2 был обусловлен его открытостью и масштабом, но подход работает на любой фундаментальной модели с достаточно выразительными промежуточными представлениями.

Итог

Исследование из AIxBio Hackathon 2026 показывает, что биобезопасностный сигнал уже закодирован в промежуточных слоях больших геномных моделей, и его можно извлечь практически бесплатно. Линейные и attention-зонды на замороженных эмбеддингах Evo 2 демонстрируют ROC-AUC до 0.977 на задаче детекции антибиотикорезистентности, работают на симулированных коротких прочтениях и различают отдельные классы препаратов с точностью выше 0.98. Это не замена классическим alignment-пайплайнам, а скорее быстрый первый слой защиты в метатеномном бионадзоре, способный работать там, где сборка контигов невозможна или нецелесообразна. Следующий шаг: лабораторная валидация на реальных клинических образцах и обучение domain-specific SAE для интерпретируемого анализа.

← Все записи