Genomic databases: Russian and foreign experience

Cover Page

Cite item

Full Text

Abstract

Technological progress allows today to sequencing and forming databases, not only a separate section of the genome, but also the whole genome (WGS). Thanks to this, genomic databases of genetic profiles are appearing and are being actively replenished. Currently, there are many publicly available and local databases. Each of them has its own format of data storage, different degree of redundancy, and interrelationships with related or similar databases. Databases facilitate both basic research in genetics and diagnostic procedures in clinical practice. A DNA profile database can be used to analyze genetic diseases, genetic fingerprinting in forensics, or genetic genealogy. DNA databases may be public or private. In 2018, the Decree of the President of the Russian Federation No. 680 dated 28.11.2018 “On the development of genetic technologies in the Russian Federation” was issued and since that time the Federal Scientific and Technical Program for the development of genetic technologies has been launched in our country. Over the past years, genomic, post-genomic, epigenetic, and multi-omics research areas have been significantly developed. the gene pools of the population of different regions of Russia are genetically significantly different not only from the population of Western Europe, but also from each other. This review article analyzes the experience of the largest operating foreign and domestic human databases.

Full Text

Геномные базы данных (БД) – это онлайн-ресурсы, содержащие информацию о геномах различных организмов, а также инструменты для их анализа. Они используются в биоинформатике и геномике для решения научных и медицинских задач. Каждая из этих баз данных имеет свои уникальные особенности и направленность, способствуя как фундаментальным исследованиям в области генетики, так и диагностическим процедурам в клинической практике. База профилей ДНК может использоваться для анализа генетических заболеваний, генетической дактилоскопии в криминалистике или генетической генеалогии. Базы данных ДНК могут быть государственными или частными. Технологический прогресс позволяет в настоящее время секвенировать и формировать базы, не только отдельный участок генома, но и весь геном (WGS).

В 2014 году были опубликованы результаты международного проекта Exome Aggregation Consortium (ЕхАС), в ходе которого были проанализированы участки генома, которые кодируют белки более 60 тысяч человек. Результаты этих исследований позднее вошли в состав единой БД gnomAD, в настоящее время включающей результаты статистической обработки последовательностей ДНК более 800 тысяч индивидуумов1.

При всей масштабности этой и других баз данных следует отметить, что разные популяции представлены в них неравномерно. В частности, российская популяция, несмотря на свою многочисленность и многонациональность, в выборках ЕхАС и gnomAD практически не представлена.

В ДНК-идентификации личности используемые базы можно разделить на два типа – базы, содержащие ДНК-профили лиц, установленные при расследовании преступлений, и популяционные базы данных, характеризующие ДНК-профили населения различных стран, географических регионов, этнотерриториальных групп. Последние созданы для научных целей, но помогают следствию сузить круг подозреваемых. В Российской Федерации проводится государственная геномная регистрация граждан Российской Федерации, а также иностранных граждан и лиц без гражданства, проживающих или временно пребывающих на территории Российской Федерации. Согласно действующему законодательству, государственная геномная регистрация проводится добровольно, а в установленных законом случаях обязательно.

Используемые отечественными учеными сведения из зарубежных источников информации и баз данных, как правило, не отражают в полной мере генетических особенностей многонационального населения нашей страны. Это существенно ограничивает возможности для создания эффективно действующих прецизионных средств диагностики и персонализированной терапии заболеваний для россиян.

Однако, важно учитывать, что генофонд населения России представляет большее генетическое разнообразие по сравнению с генофондами коренного населения локальных популяций других регионов мира. При этом генофонды населения разных регионов России генетически значительно отличаются не только от населения Западной Европы, но и друг от друга. В частности, в локальных популяциях груз наследственной патологи высокий, поэтому особое внимание следует уделить локальным изолированным популяциям.

Цель работы

Провести обзор наиболее значимых зарубежных и российских баз данных геномной информации.

Зарубежные базы данных

GenBank. Эта БД открытого доступа, которая содержит все аннотированные последовательности ДНК и РНК, а также последовательности закодированных в них белков (URL: http://www.ncbi.nlm.nih.gov/genbank/index.html/). GenBank поддерживается Национальным центром биотехнологической информации США (NCBI), входящим в состав Национальных институтов здоровья в США. Доступен на бесплатной основе исследователям всего мира. Получает и объединяет данные генетических последовательностей, полученные в разных лабораториях, для более чем 100 000 различных организмов. Обновление происходит каждые два месяца. GenBank является частью международного сотрудничества по БД нуклеотидных последовательностей, который включает в себя Банк данных ДНК Японии (DDBJ), Европейский архив нуклеотидов (ENA) и GenBank в NCBI. Эти три организации ежедневно обмениваются данными.

База данных Ensembl. Один из главных мировых ресурсов для исследований в области генома, ресурс, на основе которого ученые могут получить доступ к геному человека, а также к моделям геномов других организмов (URL: http://www.ncbi.nlm.nih.gov/genbank/index.html/). Из-за сложности генома и множества различных способов, которыми ученые хотят исследовать его, Ensembl предоставляет различные уровни доступа с высокой степенью гибкости. С помощью вебсайта Ensembl ученые-исследователи могут, например, выполнять поиск BLAST по хромосомной ДНК, скачать геномную последовательность или выполнить поиск для всех членов данного белкового семейства. Ensembl также является всесторонним программным обеспечением и БД, которая может быть установлена локально, чтобы служить потребностям геномного центра или подразделению биоинформатики в фармацевтической компании.

База данных Human Gene Mutation Database (HGMD). Содержит информацию обо всех опубликованных повреждениях генов, приводящих к наследственным заболеваниям у человека (URL: https://www.hgmd.cf.ac.uk/ac/index.php). Документы базы аннотируют все гены, находящиеся в ядре, гены митохондриального генома и соматические мутации исключены. Мутации, выявленные на уровне белкового сиквенса, не входят в базу, чтобы избежать ошибок из-за отсутствия анализа на уровне ДНК. Молчащие мутации, не приводящие к изменению аминокислотной последовательности, тоже исключены. С марта 1999 года включены данные о полиморфизме, связанном с болезнями. Данные берутся из тех же самых журналов, что и данные о мутациях (> 250). Сопровождается Институтом медицинской генетики (University of Wales, Cardiff, UK).

Отечественные базы данных

RUSeq. Это проект по объединению генетической информации между клиническими лабораториями и геномными центрами России (URL: RUSeq Browser). Проект создан с целью создания базы данных генетических вариантов, встречающихся у жителей РФ, охарактеризовать частоту их встречаемости в популяции в целом и в отдельных ее частях.

На данный момент в проекте участвуют две крупнейшие генетические лаборатории Москвы и Санкт-Петербурга – Генетико и СербаЛаб, а также Городская больница № 40 Курортного района Санкт-Петербурга.

В текущей версии в выборку образцов включены данные секвенирования 6 тыс. образцов полноэкзомного и клинического экзомного секвенирования (большая часть образцов – полные экзомы). Выборка разделена на две части – пациенты с наследственными патологиями (преимущественно, моногенной природы) и здоровые доноры (719 человек). Во всех случаях частоты аллелей приведены как для здоровых, так и для больных участников исследования.

База данных популяционных частот генетических вариантов населения Российской Федерации (GDB). БД содержит полностью деперсонализированную информацию о частотах встречаемости более 550 млн. герминальных генетических вариантов (однонуклеотидных вариантов, коротких вставок и делеций), полученных на основе данных полногеномного секвенирования более 120 тысяч образцов жителей РФ (URL: https://gdbpop.nir.cspfmba.ru/).

В 2018 году издан Указ Президента Российской Федерации от 28.11.2018 № 680 «О развитии генетических технологий в Российской Федерации», и с этого времени в нашей стране начата реализация Федеральной научно-технической программы развития генетических технологий (URL: https://www.kremlin.ru/acts/bank/43794). За прошедшие годы существенное развитие получили геномные, постгеномные, эпигенетические, мультиомиксные направления исследований. Выборка GDB сформирована из образцов условно здоровых людей, проживающих на территории Российской Федерации из 120 тысяч людей, Федеральным медико-биологическим агентством (URL: https://gdbpop.nir.cspfmba.ru/). Она является одной из крупнейших в мире БД популяционных частот генетических вариантов.

С 14 октября 2024 года БД популяционных частот генетических вариантов доступна специалистам организаций, осуществляющих соответствующие виды деятельности. Образцы секвенированы в ФГБУ «ЦСП» ФМБА России на платформе NovaSeq 6000 (Illumina, США), набор реагентов для подготовки библиотек Nextera DNA Flex (Illumina, США). В базу включены полногеномные данные с высоким покрытием (30×). Все образцы удовлетворяют критериям контроля качества. Сформированный перечень вариантов отфильтрован в соответствии со следующими критериями: глубина покрытия референсного и альтернативного аллелей (показатель allele depth, AD) в сумме находится в диапазоне от 20 до 200, точность определения генотипа (показатель genome quality, GQ) более 30. Использованные пороговые значения показателей качества вариантов определены согласно международным рекомендациям для проведения популяционных генетических исследований, а также на основании результатов популяционных исследований, выполненных в ФГБУ «ЦСП» ФМБА России.

Однако важно учесть, что генофонд населения России представляет большее генетическое разнообразие по сравнению с генофондами коренного населения локальных ареалов других регионов мира. При этом генофонды населения разных регионов России генетически значительно отличаются не только от населения Западной Европы, но и друг от друга [1].

100 000+Я. Национальная генетическая инициатива «100 000+Я» является научно-исследовательским (не медицинской) проектом, в рамках которого будет проведена расшифровка 100 тысяч геномов россиян с целью улучшения методов диагностики и лечения наследственных и онкологических заболеваний (URL: https://biotechcampus.ru). Инициатива реализуется в рамках исполнения Указа Президента Российской Федерации от 28.11.2018 г. № 680 «О развитии генетических технологий в Российской Федерации» и реализации Федеральной научно-технической программы развития генетических технологий. Компания ОО «Биотехнологический кампус» под руководством д. б. н. К.В. Северинова отвечает за практическую реализацию части программы по сбору данных, их обработке и безопасному хранению.

На базе центра при финансировании ПАО «НК «Роснефть» идет секвенирование ДНК и биоинформатический анализ геномов здоровых добровольцев, пациентов с генетическими заболеваниями и представителей разных этнических групп.

Проект будет завершен и будет представлен в конце 2025 г. Основными партнерами выступают ФГБНУ «МГНЦ», Томский НИМЦ, УФИЦ РАН и т.д. Предварительные данные, которые получены в рамках проекта, были представлены на докладах конференции XI Съезда Российского общества медицинских генетиков (URL: https://romgcon-ference.ru/event/xi-sezd-rossiyskogo-obshchestva-meditsinskikh-genetikov/), в частности по данным локальных этнических популяций России.

Заключение

В настоящее время создаваемые базы данных при поддержке программ Российской Федерации достигают мирового уровня. Однако, важно учитывать, что генофонд населения России представляет большее генетическое разнообразие по сравнению с генофондами коренного населения локальных ареалов других регионов мира. Таким образом, успехи в области анализа генома человека на основе технологий WGS открывают новые горизонты не только для научно-практических направлений (ДНК-диагностика, фармакогенетика, персонализированная медицина, криминалистика), но и фундаментальных, среди которых – даже по числу публикаций в высокорейтинговых изданиях мира – одну из лидирующих позиций занимает популяционно-генетическое направление.

Дополнительная информация

Вклад авторов. Автор подтверждает соответствие своего авторства международным критериям ICMJE (автор внес существенный вклад в разработку концепции, проведение исследования и подготовку статьи, прочел и одобрил финальную версию перед публикацией).

Источник финансирования. Работа выполнена в рамках научно-исследовательской работы Государственного задания «Музей антропологии и этнографии им. Петра Великого (Кунсткамера) Российской академии наук».

Конфликт интересов. Автор декларирует отсутствие явных и потенциальных конфликтов интересов, связанных с публикацией настоящей статьи.

Additional information

Author contribution. Author mades a substantial contribution to the conception of the work, acquisition, analysis, interpretation of data for the work, drafting and revising the work, final approval of the version to be published and agree to be accountable for all aspects of the work.

Funding. The work was carried out as part of the research work of the State Assignment "Museum of Anthropology and Ethnography named after Peter the Great (Kunstkamera) of the Russian Academy of Sciences".

Conflict of interests. The author declares the absence of obvious and potential conflicts of interest related to the publication of this article.

1 Genome Aggregation Database. URL: https://gnomad.broadinstitute.org/ (accessed: 31.09.2025).

×

About the authors

Roza A. Skhalyakho

Museum of Anthropology and Ethnography named after Peter the Great (Kunstkamera)

Author for correspondence.
Email: shalyaho.roza@yandex.ru
ORCID iD: 0000-0002-4005-1887

Candidate of Sciences in Biology, Senior Research Associate

Russian Federation, St. Petersburg

References

  1. Jeong C., Balanovsky O., Lukianova E., Kahbatkyzy N., Flegontov P., Zaporozhchenko V. et al. The genetic history of admixture across inner Eurasia. Nature Ecology & Evolution. 2019;3(6):9662976. doi: 10.1038/s41559-019-0878-2.

Supplementary files

Supplementary Files
Action
1. JATS XML

Copyright (c) 2026 Skhalyakho R.A.

Creative Commons License
This work is licensed under a Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License.