Что такое биоинформатика?Банк SwissProtС.А.Спирин7, 8,10 февраля 2006 г., ФББ МГУ
Что такое биоинформатика?Исследование информационных процессов в биологических системах (клетках, органах, организме, популяции). Изучение и внедрение в компьютерную науку «биологических» методов анализа информации (нейросетей, генетических алгоритмов, нечеткой логики и др.). Применение компьютерных методов для решения биологических задач. Телепатия, парапсихология, информационные поля и т.п.
БиоинформатикаИсследование информационных процессов в биологических системах (клетках, органах, организме, популяции).Изучение и внедрение в компьютерную науку «биологических» методов анализа информации (нейросетей, генетических алгоритмов, нечеткой логики и др.).Применение компьютерных методов для решения биологических задач.Телепатия, парапсихология, информационные поля и т.п.
Примеры задач биоинформатикиРазработка алгоритмов для анализа большого объема биологических данныхАлгоритм поиска генов в геномеАнализ и интерпретация биологических данных таких, как нуклеотидные и аминокислотные последовательности, структура молекул белков, структура комплексов молекул белков с другими молекулами.Изучение структуры активного центра белкаРазработка программного обеспечения для управления и быстрого доступа к биологическим данным Создание банка данных аминокислотных последовательностей
Что понимать под биоинформатикой?Как видим, смысл термина ещё ỳже...Применение компьютерных методов для решения биологических задачПрименение компьютерных методов для решения задачмолекулярной биологии... и еще ỳже...Компьютерный анализ экспериментальных данных о структурах биологических макромолекул (белков и нуклеиновых кислот) с целью получения биологической информации
Итак...Биоинформатика = вычислительная молекулярная биологияПочему так сузился смысл термина?
В конце 1970-х годов был изобретён относительнобыстрый и дешёвый метод экспериментального определения последовательности оснований в ДНК
Для хранения все возрастающей информации о последовательностях ДНК в 1982 году был основан GenBankGenBank — хранилище последовательностей нуклеиновых кислот в виде компьютерных файлов Объем GenBank’а:1982: 680 338 букв в 606 последовательностях1992: 101 008 486 букв в 78 608 последовательностях2002: 28 507 990 166 букв в 22 318 883 последовательностях 2004: 44 575 745 176 букв в 40 604 319 последовательностях 2005: 56 037 734 462 букв в 52 016 762 последовательностях (из ~165 000 организмов)Размер файлов — 196 Gb
Пионеры биоинформатикиЛайнус ПолингАнализ аминокислотных последовательностей глобинов нескольких позвоночныхГипотеза молекулярных часовZuckerkandl, E., and L. Pauling. 1962. Molecular disease, evolution, and genic heterogeneity. Horizons in Biochemistry, Academic Press, New York, 189-225.Zuckerkandl, E., and L. Pauling. 1965. Evolutionary divergence and convergencein proteins. Evolving Genes and Proteins, Academic Press, New York, 97-166.
Пионеры биоинформатикиМаргарет ДейхоффОднобуквенный код аминокислотA,C,D,E,F,G,H…Матрицы аминокислотных замен PAM (Point Accepted Mutation)Атлас последовательностей белков и их структур (1965)
Первый “банк данных”Атлас белковых последовательностей и их структурПервая версия атласа содержала описание 65 (!) последовательностей белков
Банки данныхАрхивные (примеры: PDB, GenBank)за содержание каждой записи отвечает её автор-экспериментатор Курируемыеза содержание записей отвечают специальные люди — кураторы Автоматическиезаписи генерируются компьютерными программами
Банк данных Swiss-ProtSwiss-Prot – база знаний о белковых последовательностях Курируемая база данных “Золотой стандарт” аннотации
Банк данных Swiss-ProtС 1987 поддерживается в сотрудничестве между Swiss Institute of Bioinformatics (SIB)European Bioinformatics Institute (EBI)Амос Байрох Руководитель группы Swiss-Prot в Швейцарском Институте Биоинформатики
Банк данных Swiss-ProtСтатистика роста количества документовТекущий релиз 48.9 (24 января 2006) содержит 206586 документов
Банк данных TrEMBLTrEMBL (Translated EMBL) Формальная трансляция всех кодирующих нуклеотидных последовательностей из банка EMBLАвтоматическая классификация и аннотацияТекущий релиз 31.9 (24 января 2006) содержит 2 586 884 документа
Тенденция объединения
Банк данных UniProtUniProt (Universal Protein Resource) UniProt Knowlegebase – SwissProt+TrEMBLUniProt Archive – UniParcUniProt Reference – UniRef
Соотношение числа белков,представленных в разных банкахПоследовательностей во много раз больше, чем структур!Большинство последовательностей не аннотированы!
Документ банка данных Swiss-ProtОписание документа: идентификатор, имя, дата создания и модификации Аннотация последовательностиПоследовательность
Основные поля записи SwissProtIDACDEOSOCИ сама последовательность, конечно.