이전 블로그에서 우리는 Illumina 5-base 솔루션을 소개했습니다. 이 솔루션은 빠르고 자동화에 적합한 워크플로우로서 단일 샘플에서 유전 및 후성유전학 정보를 모두 캡처합니다. 이번 두 번째 블로그에서는 유전 질환 연구, 암 감지 및 모집단 후성유전학을 포함한 다양한 애플리케이션에서Illumina 5-base 데이터를 해석하는 방법을 살펴봅니다.
이 소프트웨어 파이프라인은 다음으로 구성됩니다.
BCL Convert: 시퀀싱 및 원시 리드 출력.
DRAGEN 2차 분석: 정렬된 리드를 출력하고 변이를 호출하고 메틸화를 보고합니다 . DRAGEN 보고서는 샘플 전반의 주요 QC 메트릭스를 요약합니다.
Illumina Connected Multiomics: 복잡한 데이터 세트 시각화, 차등 메틸화 콜, 변이-메틸화 조인트 분석, 그리고 고급 멀티오믹 분석을 통한 삼차 분석 및 바이오마커 발견.
클라우드에서 소프트웨어 파이프라인(DRAGEN on BaseSpace Sequencing Hub, Illumina Connected Analytics, Illumina Connected Multiomics)을 실행하고 시퀀싱 시스템에서 파이프라인을 자동으로 시작할 수 있습니다. 또한 DRAGEN Server에서 DRAGEN 2차 분석을 실행할 수도 있습니다.
DRAGEN에서는 표준 DRAGEN DNA 워크플로우 에 메틸화 인식 논리를 핵심 알고리즘에 통합해 구축하고 메틸화 출력을 기존의 표준화된 데이터 형식 에 통합하는 새로운 5-base 2차 분석 모드를 개발했습니다[1](그림 1).
그림 1: DRAGEN 5-base 2차 분석
알고리즘 모델이 해시 테이블 빌더, 맵/정렬, UMI 축소, 변이 콜 및 메틸화 보고로 업데이트됩니다. 통합된 소규모 변이 콜과 대립유전자별 메틸화 보고가 gVCF 에서 출력됩니다. 레거시 메틸화 보고도 지원됩니다(CX-보고서 형식). 품질 관리 메트릭스 (예: M-편향, 대조 유전체 메틸화)는 성공적인 시퀀싱 및 분석을 확인합니다.
실행이 완료된 후 DRAGEN 보고서는 품질 관리(QC) 메트릭스에 대한 포괄적인 요약을 제공합니다 (그림 2). 이러한 QC 메트릭스에는 다음과 같은 추가 메틸화 특이적 메트릭스가 포함됩니다.
메틸화/비메틸화 대조군 유전체에서의 메틸화 %: 작은 박테리아 유전체(Lambda/pUC19)를 5-base 라이브러리 프렙에 첨가하여 메틸화 수치가 알려진 대조군으로서 사용합니다. Lambda 유전체는 메틸화가 0%이며, pUC19 유전체는 CpG 위치에서 97%를 초과하도록 합성 방식으로 메틸화됩니다.
샘플에서 CpG/CpH 맥락의 메틸화%: 포유류 유전체 내 메틸화는 주로 CpG 사이토신 맥락에서 발생합니다.
두 DNA 가닥에 대한 리드 정렬 비율: 5-base 리드는 동일한 비율로 원래의 상단 (OT, +로도 표시됨) 또는 원래의 하단 (OB, −로도 표시됨) DNA 가닥에 정렬되어야 합니다 .
그림 2: DRAGEN 보고서의 새로운 메틸화 메트릭스는 간편한 품질 관리 기능을 제공합니다.
(왼쪽) 포유류 유전체의 경우, CpG 맥락에서의 전반적인 메틸화 백분율은 높은 반면(40~60%) ,비-CpG 맥락은 메틸화되지 않습니다. 스파이크-인 메틸화 및 비메틸화 대조 유전체는 CpG 맥락에서 예상되는 메틸화 수치를 나타냅니다. (오른쪽) 리드는 동일한 비율로 예상되는 DNA 가닥 OT 또는 OB 에 매핑됩니다.
그림 3: 사이토신 메틸화는 시퀀스 변이와 구별되는 가닥 시그니처를 생성합니다.
(A) 메틸화 CpG 다이뉴클레오티드를 함유하는 DNA 절편은 라이브러리 프렙에서 C>T 변환을 거칩니다. 시퀀싱 및 참조 유전체 (+) 가닥 시퀀스에 대한 정렬 후, 절편은 (+) 가닥 리드의 C>T 돌연변이 또는 (−) 가닥 리드의 G>A 돌연변이로 나타납니다.
(B) 비메틸화 대립유전자 A-C-G-T는 표준 DNA 라이브러리 프렙과 유사하게 시퀀싱됩니다. 매칭 대립유전자 염기는 (+) 및 (−) 가닥 모두에 존재합니다.
(C) 메틸화 CpG 디뉴클레오티드 및 C>T 이형접합 변이를 함유하는 영역의 도면. 리드는 기원의 DNA 가닥(+, −)에 의해 그룹화됩니다. 메틸화 CpG 다이뉴클레오티드는 한 번에 하나의 가닥에만 존재하는 돌연변이로 표시되는 반면, C>T 시퀀스 변이는 두 가닥 모두에서 동시에 돌연변이를 보유합니다.
사용자는 유전체 브라우저에서 정렬된 리드를 검사하여 관심 영역의 변이 및 메틸화 상태에 대한 정보를 수집할 수 있습니다. 예를 들어, 가부키 증후군 환자에서는 KMT2D 유전자의 변이(chr12:49,024,720 G>C) 와 가부키 증후군과 관련이 있는 것으로 알려진 관심 영역의 고유한 episignatures 또는 hyper/hypomethylation 을 확인합니다.
그림 4: 가부키 증후군 환자의 변이 및 메틸화 상태 시각화
(A) 가부키 증후군을 나타내는 것으로 나타난 영역 전반에서 건강한 대조군에 비해 시험대상자에서차등 메틸화가 관찰됩니다[2].
(B) KMT2D 리신 메틸트랜스퍼레이스 유전자에서의 스플라이싱 변이 (chr12:49,024,720 G>C)는 가부키 증후군과 관련이 있는 것으로 알려져 있습니다. 이 변이는 Integrative Genomics Viewer(IGV) 브라우저에서 이형접합체로 볼 수 있으며, 이는 하나의 대립유전자에만 존재합니다. 또한, 이 영역은 주변 CpG 부위에서 과메틸화됩니다. 메틸화 사이토신은 티민으로 판독됩니다. 이는 ( +) 가닥에서 분홍색 리드에 C>T로 나타나며 − 가닥에서 파란색 리드에 G>A로 나타납니다. 리드 가닥은 (제1쌍 가닥에 대한 IGV 리드 착색을 사용하여) 리드 배향으로 암호화됩니다.
DRAGEN Germline 런에서 변이 콜러는 작은 변이 VCF 파일에서 출력되는 G>C 이형접합 변이를 호출합니다.
| #Chrome | Pos | 참조 | 대체 | 품질 | 필터 |
|---|---|---|---|---|---|
| chr12 | 49024720 | G | C | 50 | Pass |
gVCF(또는 레거시 CX-리포트 형식)에서는 관심 영역에서 사이토신 당 메틸화 수준을 쿼리하고 이를 유전체 브라우저에서 시각화를 위한 bedGraph 형식으로 변환할 수 있습니다. 이제 Illumina 5-base 솔루션을 통해 gVCF 파일에 메틸화 보고를 직접 도입하여 단일 파일에서의 정확한 전장 유전체의 작은 변이 및 메틸화 보고와 높은 파일 압축을 가능하게 합니다. 이 압축 기능은 소규모 단일 샘플 분석에서 대규모 모집단 규모 연구까지 모두를 지원합니다. gVCF 출력은 새로운 메틸화 필드를 도입하는 VCF 4.5사양과 일치합니다.
M5mC: 사이토신 대립유전자당 메틸화 백분율
DPM5mC: 사이토신 대립유전자당 커버리지
INFO:M5mC: 사이토신 대립유전자 맥락
5-베이스 데이터에서 변이 검출은 매우 정확합니다. 이는 Illumina 5-base 솔루션의 높은 데이터 품질 (높은 커버리지 균일성, 낮은 오류율)과 5-base 데이터에 대해 조정한 최첨단 DRAGEN 알고리즘을 사용하기 때문입니다. 예를 들어, 작은 변이 검출에서 5-base 파일업에서 사용할 수 있는 정보를 최대화하도록 콜러를 조정했습니다. 구체적으로, 우리는 콜러 모델을 확장하여 (+) 가닥 리드에서의 티민이 특정 확률로 메틸화된 사이토신일 수 있도록 했습니다 (이는 − 가닥 리드 내의 아데닌의 경우에도 유사합니다). 중요한 점은 (+) 및 (−) 가닥 모두에 걸친 리드 증거를 사용함으로써 유전자형을 정확하게 해석할 수 있다는 것입니다(그림 5). 또한 DRAGEN은 호출된 변이 대립유전자의 각 사이토신에서의 메틸화 수준을 결정할 수 있습니다 . 결과적으로 Illumina 5-base 솔루션은 CpG를 CpH 맥락으로 변경하거나 그 반대로 변경함으로써 메틸화 수준을 국소적으로 변화시키는 C>G 또는 G>C 변이와 같이 변이와 메틸화 간의 미묘한 국소 상호작용을 감지합니다(그림 5).
그림 5: 변이 대립유전자에서 사이토신당 작은 생식세포 변이 검출 및 메틸화 수치 추정
(상단) 메틸화된 C 대립유전자를 포함할 수 있는 3개의 이형접합 유전형의 예. 모든 경우에, DRAGEN 5-base 지노타입 콜은 두 DNA 가닥에 걸친 정보를 사용하여 두 대립유전자를 모두 호출합니다. 유전자형 분석 후, C 또는 G 기준 대립유전자당 메틸화 수준은 각각 (+) 또는 (−) 가닥에서 과량의 C>T 또는 G>A 돌연변이를 정량화함으로써 산출됩니다. (왼쪽 하단) NA12878에 대한 Illumina 5-base 솔루션의 생식세포 SNV 검출 정확도는 WGS(EM-seq 및 Bisulfite는 Bis-SNP로 처리, 5-base 및 WGS는 DRAGEN으로 처리)와 유사합니다. (오른쪽 하단) NA12878에서 C>G 또는 G>C 변이를 발견하여, 대립유전자 사이토신 맥락(CpG를 CpH로 또는 그 반대로 변경)에 변화를 일으킴으로써(자주색, 오렌지색) 메틸화 상태의 대립유전자 특이적 변화를 유도하는 이형접합 변이를 탐지합니다. 예를 들어, G>C 변이는 CGH 대립유전자를 CCH 대립유전자로 변환하며, 여기서 CpG 맥락은 대안적인 CCH 대립유전자에서 소실됩니다.
그림 6: DRAGEN 5-base는 체세포의 작은 변이 검출도 지원하며 큰 변이를 호출할 수 있습니다.
(상단) 다양한 대립유전자 빈도에서 체세포 SNV 검출의 민감도. (하단) 루빈스타인-타이비 증후군이 있는 개인의 CREBBP 유전자에서 병원성 복제수 결실이 검출됩니다 .
그림 7: BAM XM 태그를 사용한 메틸화 상태별 리드 분류의 초고정확도
(왼쪽) 비메틸화 Lambda 파지 DNA는 Illumina 5-base DNA Prep으로 처리되고 시퀀싱됩니다. 저빈도 C>T 오류로 인해 사이토신 염기가 BAM XM 태그에서 메틸화로 잘못 표시될 수 있습니다. (오른쪽) 소수의 Lambda 파지 DNA 절편만 메틸화로 분류됩니다 (2+ CpG 다이뉴클레오티드가 있는 리드 쌍의 경우 백만 당 10파트 미만). 절편은 리드 쌍에서 CpG 사이토신 염기의 70%를 초과하여 메틸화될 때 메틸화된 것으로 분류됩니다.
멀티오믹스 해석 및 통합
Illumina Connected Multiomics는 5-base 메틸화 및 유전체 멀티오믹 분석을 간소화할 수 있는 강력한 데이터 과학 플랫폼을 제공합니다. 이 플랫폼을 통해 팀은 DRAGEN에서 실행 가능한 생물학적 인사이트로 원시 데이터를 변환하는 복잡한 워크플로우를 사용자 지정할 수 있습니다. 여러 사용자가 분석 진행 상황을 추적하고, 데이터 사이언스 실험을 동시에 공동으로 수행하고, 결과를 전달하기 위한 대화형 대시보드를 생성할 수 있습니다.
이 플랫폼은 DRAGEN의 출력을 수집하고 코호트 수준에서 간소화된 분석을 가능하게 하는 다중 샘플 데이터 구조를 생성합니다. 이 아키텍처는 데이터 품질 필터링, 비지도 클러스터링 및 차등 메틸화 분석과 같은 일반적인 작업을 단순화합니다. 다음의 대표 분석 워크플로우는 급성 골수성 백혈병 (AML) 환자 코호트와 함께 Connected Multiomics의 기능을 보여줍니다. Connected Multiomics의 보다 자세한 쇼케이스는 이후 블로그 게시물에서 제공됩니다.
데이터 품질 관리
플랫폼은 먼저 DRAGEN의 출력을 수집하고 다중 샘플 코호트 수준에서 데이터 세트를 요약하여 품질 관리 메트릭스로 데이터 필터링과 같은 작업을 간소화합니다. 그림 8은 코호트 전반에 걸쳐 공통 전장 유전체 시퀀싱 품질 관리 메트릭스의 분포를 시각화하는 대시보드를 보여줍니다.
그림 8: 품질 관리 대시보드
지도 및 비지도 클러스터링
샘플 코호트가 생성된 후 사용자는 코호트의 전반적인 차이를 시각화하기 위해 클러스터링과 같은 탐색적 분석을 수행할 수 있습니다. Connected Multiomics는 사용자가 CpG 위치를 기반으로 클러스터링할 수 있을 뿐만 아니라 CpG 메틸화가 해당 특징 전반에서 평균화되는 프로모터 영역과 같은 더 큰 특징을 기반으로도 클러스터링할 수 있도록 해줍니다. 분석의 생물학 또는 임상적 맥락에 맞춤화된 사용자 지정 기능 세트를 사용하여 클러스터링 성능을 향상시킬 수도 있습니다. 그림 9는 사용자 또는 팀이 다양한 UMAP 파라미터에서 클러스터링 성능을 탐색하는 방법을 보여줍니다.
그림 9: UMAP 클러스터링에 대한 일반적인 파라미터 스크리닝
차등 메틸화 영역 호출
Connected Multiomics는 시퀀싱 데이터(DSS)의 분산 축소에 널리 사용되는 DMR 콜러를 대화식 샌드박스 환경에 직접 통합하여 차등 메틸화 영역(DMR)의 식별을 간소화합니다. 샘플 그룹화는 PCA/UMAP 작업의 메타데이터 또는 클러스터 레이블에서 생성할 수 있습니다. DSS는 CpG 위치 메틸화를 베타 이항 분포로 모델링하고, 샘플군 간에 통계적으로 유의한 차등 메틸화 위치를 함께 스티칭하여 DMR을 생성합니다[3]. 그림 10 은 다운스트림 분석을 위해 DMR을 쉽게 시각화하고 필터링할 수 있는 방법을 보여줍니다. IDH 돌연변이를 가진 AML 환자는 일반적으로 과메틸화 표현형을 가지며, 이는 더 많은 수의 과메틸화 DMR에 의해 반영됩니다. diff.Methy는 특정 유전체 영역에 걸친 두 샘플 그룹 간의 평균 메틸화 차이를나타내고, 길이는 DMR의 염기쌍 길이입니다. areaStat 는 DMR 길이와 가장 상관관계가 강한 DMR 내의 모든 CpG 위치의 통합 통계적 유의성입니다. 메틸화 차이가 큰 DMR이 클수록 areaStat 절대값이 더 커집니다. 유의성 레이블은 사용자가 DMR을 해석하는 데 도움이 되는 지침으로 제공됩니다. 그러나 사용자는 궁극적으로 특정 연구의 맥락 내에서 각 DMR의 생물학적 관련성을 평가해야 합니다.
그림 10: 일반적으로 유용한 DMR 메트릭스를 기반으로 한 DSS DMR 콜 결과 화산 플롯
결론
Illumina 5-base 솔루션과 DRAGEN 파이프라인은 유전 및 후성유전학적 인사이트를 하나의 효율적인 워크플로우로 결합하여 유전체학의 가능성을 재정의합니다. 우리는 유전 질환, 암 생물학 및 인구 규모 연구를 포함한 다양한 애플리케이션 전반에서 샘플에서 인사이트 도출에 이르기까지의 과정을 단순화하고 가속화하기 위한 소프트웨어 솔루션을 설계했습니다.
Illumina 5-base 솔루션에 대한 자세한 내용은 유전체 및 메틸롬 시퀀싱 | 메틸롬 분석 및 DNA 변이 분석을 참조하십시오.
참고 문헌
[1] To run DRAGEN 5-base on cloud, see https://help.connected.illumina.com/dragen-5-base. To run DRAGEN 5-base from a local server, see https://help.dragen.illumina.com/product-guide/dragen-v4.4/dragen-recipes.
[2] Aref-Eshghi, E., Schenkel, L. C., Lin, H., Skinner, C., Ainsworth, P., Paré, G., … Sadikovic, B. (2017). The defining DNA methylation signature of Kabuki syndrome enables functional assessment of genetic variants of unknown clinical significance. Epigenetics, 12(11), 923–933. https://doi.org/10.1080/15592294.2017.1381807
[3] Feng, H. & Wu, H. (2019). Differential methylation analysis for bisulfite sequencing using DSS. Quant Biol. https://doi.org/10.1007/s40484-019-0183-8