Лучшая генетическая компьютерная программа в мире
«Разрезая и перекраивая» геном человека
Что отличает геномы простых организмов, таких как морские анемоны и медузы, от человека? У людей примерно такое же количество генов, кодирующих белки, как и у этих «низших» существ,1 однако мы значительно более сложные организмы. Если не учитывать духовные аспекты человечества, это различие в сложности должно быть закодировано в наших геномах, но где именно? Поскольку мы разделяем многие гены со многими более простыми организмами, ответ не заключается только в содержании генов. Скорее, различия находятся в некодирующих участках генома (так называемой «мусорной ДНК»2) и в том, как гены используются для создания белков.
Несколько десятилетий назад была популярна гипотеза «один ген – один фермент». Казалось очевидным, что один ген белка кодирует один белок. У прокариотических организмов (бактерий) это было легко показать. Известные бактериальные гены имели четкое начало и конец, а последовательность ДНК между ними задавала определённую последовательность аминокислот. У эукариот (организмов с ядром; сюда относятся дрожжи, растения и люди) структура генов намного сложнее. Наши гены белков разбиты на серию «экзонов» (участков, кодирующих белок) и «интронов» (некодирующих промежуточных последовательностей). Чтобы получить белок, ген сначала транскрибируется в РНК, затем интроны вырезаются, экзоны сшиваются, и оставшаяся последовательность переводится в белок. Несмотря на сложность, гипотеза «один ген – один фермент» все еще применялась к эукариотическим генам белков.
Со временем, однако, стало ясно, что жизнь устроена не так просто, особенно у эукариот. Гипотеза «один ген – один фермент» оказалась особенно проблемной для высших (более сложных) эукариот. Например, примерно 20 000-25 000 белок-кодирующих генов в человеческом геноме3 используются для создания 100 000-300 000 различных белков (точное число неизвестно). Небольшое количество генов в человеческом геноме вызывало вопросы по нескольким причинам.4 Во-первых, это означало, что у нас не намного больше генов, чем у гораздо более простых организмов. Во-вторых, требовался механизм, позволяющий создавать множество белков из небольшого числа генов, и никто не знал, как это может происходить в таком масштабе. И в-третьих, сложность «геномной программы» достигала ещё более неудобного уровня для тех, кто считал, что мы возникли в результате случайных процессов.
Ещё до завершения проекта «Геном человека»5 было известно, что некоторые белки создаются в процессе, называемом «альтернативный сплайсинг», при котором экзоны из разных участков генома комбинируются, образуя множество различных белков. В рамках проекта ENCODE6 мы узнали, что альтернативный сплайсинг настолько широко распространён, что само определение слова «ген» в настоящее время является предметом научных дискуссий.7 Таким образом, гипотеза «один ген – один фермент» оказалась грубым упрощением. Однако слово и концепция «гена» настолько удобны, что далее в этой статье автор будет использовать «гены» в классическом смысле – как непрерывный участок ДНК с началом и концом, содержащий набор интронов и экзонов, который потенциально может быть транскрибирован, подвергнут сплайсингу и переведён в один белок. При этом каждый ген состоит из частей, которые могут рекомбинироваться с частями других генов в разных участках генома, создавая белки, не закодированные каким-либо конкретным геном.
Альтернативный сплайсинг – это блестящая концепция организации, которая позволяет создать более компактную генетическую программу, занимающую значительно меньше места по сравнению с программой, где каждый белок кодировался бы независимо. Однако эта дополнительная сложность имеет свою цену. Было консервативно оценено, что каждый интрон добавляет примерно столько же сложности, сколько около 30 дополнительных букв ДНК.8 Таким образом, «мишень для мутаций» в гене увеличивается с добавлением каждого интрона. Если учесть, что в среднем белок-кодирующий ген содержит 7-10 интронов и что суммарная длина интронов часто превышает длину кодирующей части ДНК, становится понятно, почему это может быть проблемой. Поддержание такой системы требует больших затрат, и её сложность затрудняет натуралистические теории происхождения. Фактически значительная часть генетических заболеваний человека связывается с мутациями в местах сплайсинга на границах интронов и экзонов.9 Интроны обычно относят к категории «мусорной ДНК», однако на их концах находятся специфические последовательности, которые указывают механизму сплайсинга, где именно разрезать и соединять РНК, поэтому они не лишены функции. (Экзоны также содержат сигналы сплайсинга на своих концах. Таким образом, часть информации для вырезания интронов находится внутри самой белок-кодирующей области генома. Кодирующие участки ДНК одновременно задают и последовательность белка, и паттерны сплайсинга!)
Проект ENCODE сделал важное открытие: почти весь геном в какой-то момент жизни клетки транскрибируется в РНК, и из одного и того же участка ДНК часто образуются несколько перекрывающихся РНК. Это стало серьёзным ударом по теории «мусорной ДНК».10
Однако, возможно, ещё важнее то, что результаты ENCODE также зафиксировали огромное количество альтернативного сплайсинга. Итак, мы пришли к пониманию, что большая часть генома активна и что белок-кодирующие участки используются в сложных комбинациях, но по-прежнему не понимаем, как всё это согласуется в единую систему. В связи с этим ученые начали искать в геноме так называемый «сплайсинговый код», который управляет процессами разрезания и сборки белковых генов. Этот сплайсинговый код должен объяснять: 1) сложные комбинации экзонов, необходимые для создания сотен тысяч белков из десятков тысяч белок-кодирующих генов; 2) различия в сплайсинге от клетки к клетке, обеспечивающие разные наборы белков в разных типах клеток; и 3) изменения паттернов сплайсинга во времени, по мере развития организма от оплодотворённой яйцеклетки до взрослой стадии (поскольку не все гены активны на всех этапах жизненного цикла). Вся эта информация должна быть закодирована в геноме, но при этом не должна нарушать белок-кодирующие области. Следовательно, большая часть этой информации, по-видимому, должна находиться в интронах и в промежутках между генами.
Недавно в журнале Nature появилась статья, в которой авторы заявили, что им удалось обнаружить начало «сплайсингового кода». То, что они нашли, представляет собой удивительную сложность. Лаборатории по всему миру накопили огромные объёмы данных и смогли использовать эти новые знания в масштабном анализе данных (data mining). В частности, были созданы обширные базы данных, показывающие, какие гены активны в разных клеточных линиях и на разных стадиях развития. Также известны многие ДНК-связывающие факторы и их специфические последовательности-мишени (обычно это короткие последовательности из нескольких очень точных букв, которые распознаются белками с причудливыми названиями вроде «Star», «Nova» и «Quaking-like»). Используя эти данные, исследователи смогли статистически подойти к задаче и выявить значимые особенности, которые помогают регулировать альтернативный сплайсинг. Они обнаружили множество «мотивов» (коротких «слов» ДНК длиной 5–10 букв), расположенных до и после многих экзонов, которые сильно связаны с определёнными типами клеток. В целом, им удалось объяснить около 60% паттернов альтернативного сплайсинга в человеческом геноме только наличием или отсутствием этих мотивов. Многие из этих мотивов уже были известны ранее и являются сайтами связывания известных ДНК-связывающих белков. Однако многие другие мотивы оказались новыми для науки.
Медианное число (серединное значение) тканеспецифичных мотивов, связанных со сплайсингом, на один экзон составляло от 12 для центральной нервной системы до 19 для эмбриона.11 Помимо этого, существовали дополнительные тканеинвариантные признаки, связанные с большинством или всеми экзонами, а также дополнительные и многочисленные короткие мотивы, которые не были учтены в приведённых выше подсчётах. Это означает, что «сплайсинговый код» является сложным, и для управления тем, как многочисленные экзоны объединяются, формируя разнообразие белков в организме человека, требуются сложные комбинации инструкций.
Также были обнаружены признаки, связанные со сплайсингом, расположенные гораздо дальше от белок-кодирующих участков, чем ожидалось. Из-за технических ограничений большинство исследований регуляции транскрипции исторически фокусировались на нескольких десятках букв непосредственно перед или после целевой последовательности. В данном случае исследователи выявили признаки, находящиеся значительно дальше в некодирующих областях, чем считалось ранее (до 300 букв от соответствующего участка).
Таким образом, ещё больше «мусорной ДНК» было отнесено к функциональной категории ДНК.
Но это лишь начало. Они только слегка коснулись поверхности и уже обнаружили поразительную сложность. Им удалось достичь точности предсказания лишь в 60%. Следовательно, многое ещё предстоит открыть. Где находится недостающая информация? Возможно, она будет найдена глубже в некодирующей ДНК. Возможно, поскольку они не учитывали трёхмерную архитектуру ДНК внутри ядра, дополнительные особенности могут обнаружиться гораздо дальше – или даже на других хромосомах! Возможности здесь безграничны, и мы, безусловно, будем обновлять информацию по мере появления новых данных.
Есть еще одно следствие этой работы, которое я хотел бы обсудить. В геноме существует множество «псевдогенов», которые выглядят как функциональные гены, но содержат «мутации», из-за которых они не могут быть превращены в белки. Наличие псевдогенов остаётся загадкой с момента их открытия, однако эта идея в целом использовалась для критики креационистов и других сторонников концепции дизайна. Я считаю такие аргументы несостоятельными,12 и мы уже подробно обсуждали их в предыдущих статьях.13
Хотя для многих псевдогенов действительно были обнаружены функции, верно, что если они транскрибируются и подвергаются сплайсингу, псевдоген не может быть переведён в белок. Однако теперь, когда мы знаем об альтернативном сплайсинге, будущие исследования могут показать, что многие экзоны псевдогенов включаются в функциональные белки. Если это окажется так, весь аргумент о псевдогенах рухнет, как карточный домик. Но время покажет.
Пока же давайте просто поразимся удивительно «инженерному» устройству человеческого генома. Бог написал генетическую компьютерную программу, которая на сегодняшний день не имеет себе равных среди любых человеческих технологий. Мудрость и дальновидность, вложенные в неё, поистине поражают. Он создал цепочку ДНК длиной с человеческий рост, способную выдерживать тысячи ошибок (мутаций), адаптироваться к меняющимся условиям среды (за счёт самопереписывающегося кода, который включает и выключает разные гены в зависимости от условий), и при этом упаковываться в микроскопическую клетку без образования узлов! Теперь мы узнаем, что эта программа является чудом сжатия данных и эффективности. Она более сложна, чем все, что мы когда-либо могли представить.
-
назад
Putnam, N.H., et al., Sea anemone genome reveals ancestral Eumetazoan gene repertoire and genomic organization, Science 317:86–94.
-
назад
Carter, R.W., The slow, painful death of junk DNA.
-
назад
Pennisi, E., Gene counters struggle to get the right answer, Science 301:1040–1041, 2003.
-
назад
Claverie, J. Gene number. What if there are only 30,000 human genes? Science 291:1255–1257, 2001.
-
назад
International Human Genome Sequencing Consortium, Initial sequence and analysis of the human genome, Nature 409(6822):860–921, 2001.
-
назад
ENCODE Project Consortium, Identification and analysis of functional elements in 1% of the human genome by the ENCODE pilot project, Nature 447:799–816.
-
назад
Gerstein, M.B., What is a gene, post-ENCODE? History and updated definition, Genome Research 17:669–681, 2007.
-
назад
Lynch, M., Rate, molecular spectrum, and consequences of human mutation, Proceedings of the National Academy of Sciences USA 107(3):961–968, 2010.
-
назад
Barash, Y., et al., Deciphering the splicing code, Nature 465:53–59, 2010.
-
назад
Williams, A., Astonishing DNA complexity update.
-
назад
Использование данных человеческих эмбрионов вызывает у меня глубокое беспокойство, однако эта статья не посвящена этическим, моральным или духовным последствиям «смелого» нового мира современной науки, поэтому я воздержусь от дальнейших комментариев.
-
назад
Для списка статей о псевдогенах см. Junk DNA section of the Vestigial Organs Questions and Answers page.