3.1 Сборка de-novo и предсказание унигенов
Рис. 1
Показывает распределение длин транскриптов, где диапазон транскриптов отложен по оси X, а количество транскриптов отложено по оси Y.
Рис. 2
Показывает распределение длин унигенов, где диапазон унигенов отложен по оси X, а количество унигенов отложено по оси Y.
3.2 Прогнозирование CDS по унигенам
Всего было предсказано 61 122 CDS из унигенов, на которые тратится сумма 55 287 699 нуклеотидов. Средняя длина наблюдаемого CDS составляет 904 нуклеотида с диапазоном от 255 до 15 303 нуклеотидов, а соответствующий белок CDS находится в диапазоне от 85 до 5101 аминокислоты, в среднем 302 аминокислоты. Анализ распределения в сочетании с наблюдаемыми длинами указывает на пик между 1000 и 5000 нуклеотидов, при этом заметное количество составляет около 300–400 нуклеотидов. Принимая во внимание, что только 167 CDS имели длину более 5000 нуклеотидов. Подробная информация о распределении CDS представлена на рис. 3.
Рис. 3
Показывает распределение длин CDS, где диапазон длин CDS отображается по оси X, а количество CDS — по оси Y.
3.3 Функциональная аннотация прогнозируемой CDS
Функциональная аннотация CDS, оцененная по базе данных NR, выявила совпадения для 57 554 CDS, тогда как для 3568 CDS не было обнаружено ни одного совпадения. Распределение наиболее пораженных видов показывает, что большинство попаданий было против Малус домашнийс Малус наткнулся следом следом (рис. 4). Аналогично, результаты blastP из трех других баз данных, а именно UniProt, KOG и Pfam, дали совпадения для 45 874, 29 523 и 29 689 последовательностей соответственно. Статистические данные по взрывным воздействиям показаны в Таблице 1. Кроме того, сравнительная аннотация CDS по всем базам данных проиллюстрирована с помощью диаграммы Венна (рис. 5).
Рис. 4
Показывает функциональную аннотацию CDS к различным видам NR-баз данных NCBI.
Таблица 1. Сводка результатов blastp по различным базам данныхРис. 5
Диаграмма Венна для аннотированных белков в другой базе данных
Рис. 6
Показывает классификацию KOG для CDS.
Более того, анализ Pfam выявил 3237 семейств белков в CDS, наибольшее количество которых принадлежит семейству протеинтирозинкиназ, за которым следует мотив узнавания РНК (RRM). Все идентифицированные домены семейства белков перечислены в дополнительном материале S4.
3.4 Анализ онтологии генов
Анализ онтологии генов (GO) сопоставил 1671 CDS из 57 554 CDS, аннотированных NR, в 7781 термин GO, демонстрируя наличие нескольких терминов GO для каждого CDS. Онтология генов (GO) разделена в основном на три основных аспекта: клеточные компоненты, молекулярные функции и биологические процессы. Наш GO-анализ выявил наибольшее количество кодирующих последовательностей (CDS), отнесенных к категории «Молекулярная функция» (1430), за которыми следуют биологические процессы (1282) и клеточные компоненты (901) (дополнительный материал S5).
3.5 Анализ путей
Кроме того, анализ путей с использованием KAAS выявил в общей сложности 7057 CDS из 61 122 CDS (таблица 2). Большинство из этих идентифицированных кодирующих последовательностей (CDS) связаны с метаболическими путями ключевых биомолекул, таких как углеводы, липиды, нуклеотиды, аминокислоты, гликаны, кофакторы, витамины, терпеноиды, поликетиды и многое другое. транскрипты охватывали гены, связанные с метаболизмом, обработкой генетической информации, обработкой информации об окружающей среде и клеточными процессами.
Таблица 2. Статистика путей KEGG для CDS
3.6 Идентификация микросателлитных маркеров
Всего в 3401 кодирующей последовательности (CDS) было обнаружено 3933 повтора простых последовательностей. Кроме того, 447 CDS имели более одного микроспутника. Сложные SSR были выявлены в 326 случаях. Примечательно, что наибольшее количество SSR было обнаружено в мотивах тринуклеотидных повторов (2558), за которыми следуют динуклеотиды (1338), пентануклеотиды (28), гексануклеотиды (26) и тетрануклеотиды (9) (табл. 3).
Таблица 3. Подробная информация об идентифицированных микросателлитных маркерах
3.7 Анализ дифференциальной экспрессии
Сравнительный анализ экспрессии генов выявил 52 326 транскриптов, из которых 27 919 были подавлены, а 24 407 — повышены. Примечательно, что у 11 544 наблюдалось значительное понижение уровня регуляции, а у 5 403 – значительное усиление. Кроме того, дифференциальная экспрессия генов между листьями и плодами была визуально изображена с помощью графика МА на рис. 7а. Более того, биологическая и статистически значимая экспрессия транскриптов была проиллюстрирована с помощью графического графика вулкана на рис. 7b.
Рис. 7
а Иллюстрирует дифференциально экспрессируемые транскрипты между фруктами и листьями, в то время как б показано распределение экспрессируемых транскриптов в плодах и листьях с использованием графика вулкана.
3.8 Транскрипционный факторный анализ
Рис. 8
Иллюстрирует распределение семейств транскрипционных факторов.
#Обогащение #геномных #ресурсов #дикой #яблони #Docynia #indica #Wall #помощью #тканеспецифического #профилирования #транскриптома
Читайте также
