Google создал карту из 9 миллиардов мутаций: зачем наука исследует весь геном человека

Прокомментировать Просмотры: 4

Привет, SE7EN! Сегодня поговорим о перекрестке генетики и передовых технологий. Обе сферы развиваются стремительно, но крайне неравномерно. Человеческий геном успешно расшифровали более двух десятилетий назад, однако постичь его до конца так и не удалось. Знать последовательность из трех миллиардов нуклеотидов — это одно, а понимать функционал каждого из них — совершенно иное. В этой запутанной структуре легко заблудиться. Взять хотя бы некодирующие участки, лишенные инструкций по синтезу белков. В студенческие годы их пренебрежительно именовали «мусорной» ДНК. Между тем на них приходится порядка 98% всего генома, а последствия происходящих там мутаций остаются terra incognita.

Специалисты Google DeepMind решили внести ясность в этот вопрос, запустив масштабную инициативу AlphaGenome Atlas. В рамках проекта они задались целью просчитать потенциальный эффект от любой возможной точечной мутации человеческой ДНК. Общее число таких комбинаций достигло примерно девяти миллиардов. О том, почему возникла такая цифра и как она получена, пойдет речь далее.

Что представляет собой этот атлас

Стандартный геном человека содержит чуть более трех миллиардов пар оснований (А, Т, Г, Ц). Для каждой конкретной позиции предусмотрено три варианта замены. Путем несложного умножения трех миллиардов на три мы получаем те самые девять миллиардов возможных одиночных мутаций. Именно их эффекты и смоделировали создатели AlphaGenome Atlas.

Каким образом? Эксперты DeepMind проанализировали весь массив теоретически возможных одиночных вариаций генома. Разумеется, не обошлось без ограничений: ради оптимизации вычислительных ресурсов исследователи сознательно исключили комбинированные мутации, сосредоточившись исключительно на заменах единичных нуклеотидов. Иначе проект затянулся бы на неопределенный срок, хотя и текущая задача оказалась колоссальной по сложности.

Источник
Источник

Главная сложность заключалась в том, что протестировать девять миллиардов вариантов экспериментальным путем физически невозможно. Для каждого случая потребовалось бы редактировать геном живых клеточных культур, культивировать их и фиксировать массу молекулярных параметров. При этом результаты варьировались бы в зависимости от типа тканей: одна и та же последовательность ведет себя совершенно иначе в нейронах, гепатоцитах или лимфоцитах. Подобная работа потребовала бы вечности.

Именно поэтому разработчики задействовали модель AlphaGenome, представленную Google DeepMind годом ранее, в 2025-м. Инструмент справился с задачей, сгенерировав колоссальный объем информации. Результирующий датасет весит около 1 ПБ, что примерно в тридцать раз превосходит базу данных AlphaFold с прогнозами белковых структур. Чтобы сделать этот проект реальным, инженерам пришлось ускорить вычисления примерно в 80 раз благодаря дистилляции модели, глубокой оптимизации работы с GPU и устранению избыточных операций.

Как именно AlphaGenome оценивает мутации

Стоит сразу оговориться: нейросеть не выносит медицинских диагнозов. Она лишь с определенной долей вероятности прогнозирует, как замена конкретного нуклеотида отразится на функционировании клетки. К примеру, мутация может снизить активность гена или спровоцировать сбой в транскрипции, из-за чего клетка синтезирует дефицитный либо дефектный белок. Подобные нарушения способны дестабилизировать работу систем организма и спровоцировать патологию.

Для прогнозирования последствий AlphaGenome сканирует протяженные участки ДНК, достигающие миллиона пар оснований. Зачем такой масштаб? Регуляторные элементы, управляющие экспрессией гена, могут располагаться на огромном удалении от него. Сопоставляя исходную последовательность с мутантной, алгоритм улавливает даже отдаленные эффекты, которые остались бы незамеченными при анализе локальной зоны.

Более того, система оценивает специфику проявления мутаций в различных типах тканей и клеточных структурах. В частности, она мониторит уровень экспрессии и корректность сплайсинга РНК — процесса, в ходе которого из транскрипта удаляются лишние фрагменты. Ошибки на этом этапе приводят к сборке некорректных белков, что губительно сказывается на жизнедеятельности клетки.

Источник
Источник

На выходе модель выдает массив метрик, разобраться в котором без подготовки непросто. Чтобы облегчить экспертам задачу, команда DeepMind внедрила сводный рейтинг AlphaGenome Variant Impact (AVI), позволяющий мгновенно ранжировать мутации по степени значимости. Если изменения затрагивают белок-кодирующие зоны, Атлас задействует аналитику родственной системы AlphaMissense. Помимо интегральной оценки, искусственный интеллект указывает вероятный механизм дисфункции — например, сбой транскрипции или аномальное изменение генной активности.

Зачем акцентировать внимание на оставшихся 98%

На белок-кодирующие участки приходится лишь около двух процентов генома человека. С ними ситуация относительно прозрачна: повреждение такой инструкции позволяет напрямую отследить изменения в структуре белка. Но как быть с остальными девяноста восемью процентами?

Относительно недавно выяснилось, что львиная доля этой «темной материи» выполняет регуляторные функции, запуская, останавливая или модулируя работу генов. Большинство точечных замен здесь нейтральны, однако порой даже единичное изменение нуклеотида способно нарушить тонкую настройку генетического аппарата. Классические методы диагностики фиксируют сам факт мутации, но ее патогенный потенциал теряется в потоке безопасного фонового шума.

Получая результаты расшифровки генома пациента, врачи сталкиваются с тысячами отклонений от референсного образца. Отделить патологию от нормы — задача титаническая. Часть вариаций сразу отсеивается по базам данных, однако оставшийся пул по-прежнему велик, а лабораторная верификация каждого случая слишком дорога и медленна.

Традиционно генетики фокусируются на кодирующих зонах, где проще выявить поломку. Однако этот подход часто дает сбой, если истоки болезни кроются в некодирующих регионах, не затрагивающих структуру белка напрямую. Внешне безобидная замена остается незамеченной, изнуряя пациента бесконечными обследованиями без постановки точного диагноза. Интегральный рейтинг AVI призван перевернуть этот подход, позволяя переосмыслить списки вариантов и выявить скрытые угрозы.

Источник
Источник

Ярким примером практического применения служат исследования в рамках программы GREGoR, нацеленной на расшифровку редких недиагностированных патологий. Специалисты из Broad Institute применили Atlas и выявили мутацию, затрагивающую ген DNM1. Связь этого гена с эпилептической энцефалопатией была известна ранее, но конкретный вариант оставался вне поля зрения. Модель предсказала, что аномалия формирует ложный сайт сплайсинга, внедряя в белок лишний сегмент. Лабораторный эксперимент полностью подтвердил гипотезу, после чего аналогичные механизмы были обнаружены у ряда соседних мутаций.

Эффективность Атласа протестировали и на массиве данных 54 тысяч участников проекта UK Biobank в поиске редких вариаций, влияющих на концентрацию белков в плазме крови. Подобные корреляции традиционно сложно уловимы из-за низкой частотности мутаций в популяции. Использование AlphaGenome позволило сгруппировать схожие по эффекту варианты, увеличив число выявленных закономерностей на 22%. Аналогичным образом исследователи вычленили мутации, потенциально коррелирующие с индексом массы тела, выделив 19 перспективных локусов.

Подобные инсайты бесценны и для фармацевтической отрасли. Понимая, какая именно генная сеть или клеточный процесс нарушены из-за мутации, разработчики лекарств получают четкий ориентир для поиска терапевтических мишеней, экономя время, бюджеты и помогая пациентам.

Каковы практические результаты на данный момент

В ходе бенчмарк-тестов AlphaGenome продемонстрировала производительность на уровне лучших узкоспециализированных аналогов, а в ряде сценариев превзошла их. Ключевое преимущество модели заключается в ее мультизадачности: она способна оценивать влияние мутации на экспрессию, особенности сплайсинга и доступность хроматина одновременно. Это избавляет исследователей от необходимости комбинировать разрозненные программные продукты. Тем не менее, определенные ограничения пока сохраняются.

Источник
Источник

Главный нюанс кроется в специфике обучающей выборки. Поскольку модель тренировали преимущественно на смешанных образцах тканей, ей сложнее интерпретировать процессы в редких клеточных популяциях или на специфических этадах онтогенеза. Кроме того, миллионного диапазона пар оснований не всегда достаточно для захвата удаленных энхансеров. Наконец, Atlas рассматривает каждую мутацию изолированно, в то время как реальные патологии зачастую обусловлены синергетическим эффектом множества изменений.

Существует и риск ложноотрицательных прогнозов, когда опасная мутация получает заниженную оценку. Следовательно, низкий индекс AVI не гарантирует абсолютной безопасности варианта. Высокие баллы более надежны, но также требуют лабораторного подтверждения. Важно помнить: метрики отражают цитологический эффект мутации, а непрямой риск развития клинического заболевания у отдельного человека.

Резюмируя сказанное: AlphaGenome Atlas пока не прошел этап клинической валидации и не применяется в рутинной диагностике. Система моделирует клеточный отклик, но окончательный вердикт о заболевании выносится только на основе комплексных лабораторных изысканий и сопоставления с клинической картиной.

А что вы думаете о перспективах этого масштабного начинания? Делитесь мнением в комментариях.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов