Cyrius: 전장 유전체 시퀀싱 데이터를 사용한 정확한 CYP2D6 유전형 분석

Xiao Chen and Michael Eberle; January 19, 2021

소개

많은 수의 임상적으로 처방된 약물에 대한 약물 대사 속도에는 개인 간에 유의한 차이가 있습니다. 약물 대사의 이러한 변동성에 크게 기여하는 인자는 약물 대사 효소의 유전적 조성이며, 따라서 이러한 효소를 암호화하는 유전자(즉, 약리유전자)의 유전형을 분석하는 것은 개인 맞춤 의학의 중요한 구성 요소입니다1. 시토크롬 P450 2D6(CYP2D6)은 가장 중요한 약물 대사 효소 중 하나를 암호화하며, 이는 임상적으로 사용되는 약물의 약 21%의 대사를 담당합니다2. CYP2D6 유전자는 다형성이 높으며, 약물유전자 변이(PharmVar) 컨소시엄3에 의해 정의된 100개 이상의 스타 대립유전자가 있습니다. 스타 대립유전자4는 작은 변이체(SNV 및 Indel) 및 구조적 변이(SV)의 조합에 의해 정의된 유전자 일배체형이며, 상이한 수준의 효소 활성, 즉, 불량, 중간, 정상, 또는 초고속 대사자에 상응합니다.5~7

유전형 분석 CYP2D6은 CYP2D6의 흔한 결실 및 중복과 CYP2D6과 그 유사유전자 파라로그인 CYP2D74,8,9 사이의 하이브리드로 인해 어려움이 있으며, 이들은 몇 개의 거의 동일한 영역을 포함하여 94%의 시퀀스 유사성을 공유합니다8,10. 전통적으로, CYP2D6 유전형 분석은 PharmacoScan과 같은 어레이 기반 플랫폼 또는 TaqMan 분석, ddPCR 및 장거리 PCR과 같은 중합효소 연쇄 반응(PCR) 기반 방법을 사용하여 낮은 처리량이나 중간 처리량으로 수행됩니다. 이러한 분석은 이들이 조사하는 스타 대립유전자(변이) 수가 다르므로, 분석 전반에서 유전형 분석 결과의 변동성을 초래합니다8,11,12. SV를 검출하기 위해, 이러한 assay 또는 검사 플랫폼은 알려진 유전자 복제수 변이(CNV) 하위 집합의 검출로 제한될 수 있는 CNV assay로 보완될 필요가 있을 수 있습니다4,9.

최근 차세대 시퀀싱이 발전함에 따라, 이제 높은 처리량과 임상적으로 관련된 기간 내에 전체 유전체를 프로파일링할 수 있습니다. 이러한 발전에 힘입어 많은 국가들이 대규모 집단 시퀀싱 프로젝트를 수행하고 있으며13–15, 여기서 약물유전체학(PGx) 검사는 이러한 노력의 임상적 유용성을 크게 증가시킬 것입니다. 이러한 연구 내에서 PGx를 가능하게 하기 위해, 우리는 CYP2D6 콜러 Cyrius16을 개발했으며, 이는 CYP2D6과 CYP2D7 사이의 상동성 문제를 극복하는 새로운 WGS 특이적 CYP2D6 유전형 분석 도구입니다. 여기에서는 WGS에서 지원하는 PGx 애플리케이션에 대한 Cyrius 및 향후 방향에 대한 개요를 제공합니다. 

Cyrius에서 사용하는 CYP2D6 유전형 분석 방법

CYP2D6에서 판독 정렬 정확도는 CYP2D7과의 상동성 때문에 감소하며(그림 1), 이는 변이 검출을 어렵게 만들고 오류를 발생시킬 수 있습니다. Cyrius는 이러한 어려움을 극복하기 위해 새로운 접근법을 사용하며, 상세한 워크플로우는 그림 2에서 Coriell 샘플 NA12878(*3/*68+*4)을 하나의 예시로 보여주고 있습니다. 먼저, Cyrius는 CYP2D6 및 CYP2D7에 매핑된 모든 리드를 사용하여 WGS 정렬 BAM 파일에서 리드 뎁스를 계산함으로써 CYP2D6 또는 CYP2D7에 매핑된 모든 리드를 기반으로 두 유전자의 총 복제수를 식별합니다. 다음으로 Cyrius는 완전한 CYP2D6 유전자 수를 결정하고, 모집단에서 CYP2D6와 CYP2D7 간에 차이가 있는 것으로 입증된 117개 염기를 근거로 하이브리드 유전자를 식별합니다. 하이브리드는 이러한 염기에서 측정된 CYP2D6의 복제수(CN)가 유전자 내에서 변할 때 식별됩니다. 예를 들어, 그림 2B에 표시된 샘플 NA12878은 CYP2D6의 완전한 본제본 2개와, 엑손 1이 CYP2D6에서 유래하고 엑손 2-9가 CYP2D7에서 유래하는 하이브리드 1개를 가집니다(즉,  *68). 다음으로 Cyrius는 리드 정렬을 파싱하여 스타 대립유전자를 정의하는 단백질 변화를 일으키는 작은 변이를 식별합니다(그림 2C). 마지막으로, Cyrius는 스타 대립유전자 정의와 SV 및 작은 변이를 대조하여, 호출된 변이와 일치하는 유전형을 생성합니다.

그림 1. CYP2D6/CYP2D7 영역에서의 WGS 데이터 품질.
평균 맵핑 품질(빨간색 선)은 CYP2D6/CYP2D7 영역(GRCh38)의 각 위치에 대해 도표화된, 1000 유전체 프로젝트(1kGP)의 2504개 샘플 전반에서 평균화됩니다. 중앙값 필터는 200bp 창에 적용됩니다. CYP2D6/CYP2D7의 9개 엑손은 주황색(CYP2D6) 및 녹색(CYP2D7) 상자로 표시되어 있습니다. CYP2D6 및 CYP2D7의 두 개 2.8kb 반복 영역(REP1 및 REP2) 다운스트림은 거의 동일하며 본질적으로 정렬이 불가능합니다. 보라색 점선 상자는 CYP2D7과 REP7 사이의 고유한 스페이서 영역을 나타냅니다. 유전자 내 두 개의 주요 상동 영역이 분홍색으로 음영 처리되어 매핑 정확도가 낮은 영역을 강조 표시합니다.
그림 2. 하나의 예시로 NA12878(*3/*68+*4)을 사용한 Cyrius 워크플로우.

A. CN(CYP2D6+CYP2D7)은 CYP2D6 또는 CYP2D7에 정렬되는 모든 리드를 계수하고 모델링하여 도출합니다. 히스토그램은 1kGP 샘플에서 표준화된 CYP2D6+CYP2D7 뎁스의 분포를 나타내며, CN2, 3, 4, 5, 6 및 7에서 피크를 나타냅니다. 빨간색 수직선은 NA12878의 값을 나타내며, 이는 추가 복제를 나타내는 CN5에 해당합니다(CYP2D6 또는 하이브리드일 수 있음). B. SV는 CYP2D6/CYP2D7 차등 염기의 CN을 검사하여 호출됩니다. 엑손은 노란색 상자로 표시됩니다. 파란색 점은 원시 CYP2D6 CN을 나타내며, 이는 CYP2D6에서 CYP2D6 근거 리드와 CYP2D7 근거 리드의 비율을 CN(CYP2D6+CYP2D7)에 곱하여 계산됩니다. 적색 다이아몬드는 3’ 말단에서 CYP2D6 유래 유전자의 CN(완전한 CYP2D6 또는 CYP2D7-CYP2D6 하이브리드일 수 있음)을 나타내며, 이는 CN(CYP2D6+CYP2D7)에서 CN(스페이서)을 뺀 값으로 계산됩니다. CYP2D6 CN은 각 CYP2D6/CYP2D7 차등 부위에서 호출되며, 유전자 내 CYP2D6 CN의 변화는 하이브리드의 존재를 나타냅니다. NA12878에서 CYP2D6 CN은 엑손 2와 엑손 1 간에 2에서 3으로 변화하며, 이는 CYP2D6-CYP2D7 하이브리드(*68)를 나타냅니다. C. 단백질 변화를 일으키는 작은 변이를 정의하는 스타 대립유전자의 근거 리드 수는 각 변이의 CN 호출에 사용됩니다. y축은 쿼리된 모든 작은 변이 위치에 대한 리드 수를 보여줍니다. NA12878에서 6개의 변이가 호출되며, 그 중 하나인 g.100C>T는 두 개의 복제본으로 호출됩니다(하나의 복제본은 *4에 속하고 다른 하나는 스타 대립유전자 정의에 근거하여 *68에 속함). 마지막으로, 스타 대립유전자는 검출된 SV 및 작은 변이에 근거하여 호출됩니다.

성능 검증

CDC 유전자 검사 참조 물질 프로그램(GeT-RM)11,17에서 제공하는 참조 샘플 패널의 가용성은 주요 약물유전자의 합의 유전자형을 여러 유전자형 분석 플랫폼을 사용해 도출함으로써, 새로 개발된 방법에 대한 유전자형 분석 정확도 평가를 가능하게 했습니다. 우리는 Cyrius에서 생성된 CYP2D6 콜을 138개의 GeT-RM 샘플과 PacBio HiFi 시퀀스 리드를 사용하여 생성된 8개의 샘플을 포함한 144개의 truthset 샘플에 대해 평가했습니다(2개의 샘플은 GeT-RM과 PacBio 간에 중첩됨). Cyrius는 처음에 144개의 진리 샘플에서 5건의 불일치 콜을 생성했으며, 이는 96.5%의 일치를 보여줍니다. 이후에 우리는 원인을 파악하고 Cyrius를 개선하여 이 5개 샘플 중 4개를 정확하게 호출하여 99.3%(144개 샘플 중 143개)의 ‘학습된’ 일치에 도달할 수 있었습니다. Cyrius의 정확성은 두 개의 기존 CYP2D6 콜러인 Aldy18(86.8%) 및 Stargazer19(84.0%)보다 높습니다16.

종합적으로, 본 연구에 사용된 검증 샘플은 40개의 스타 대립유전자는 물론, 중복 및 *13+*2, *68+*4, *36+*10 및 *36+*36+*10을 포함한 탄덤 배열과 같은 여러 SV 구조를 포함한 47개의 서로 다른 하플로타입에서 우리의 CYP2D6 호출 정확도를 확인해 주었습니다. 이 40개의 스타 대립유전자는 PharmVar에서 131개의 스타 대립유전자의 30.5%(2020년 7월 기준) 및 기능이 알려진 스타 대립유전자의 51.7%(60개 중 31개)를 나타냅니다. 다섯 개의 서로 다른 모집단(유럽인, 아프리카인, 동아시아인, 남아시아인 및 혼합 미국인)을 대표하는 1000개 유전체 프로젝트(1kGP)20의 샘플에 Cyrius를 적용하면, 이들 40개의 검증된 스타 대립유전자가 범유전체 집단에 존재하는 스타 대립유전자의 96%를 차지함을 보여줍니다.

다음으로 597 1kGP 트리오의 시퀀싱 데이터에서 Cyrius 호출의 멘델 일관성을 평가했습니다. 진리 유전형에 대한 상기 비교는 상이한 하플로타입 페이징을 허용하지만, 멘델 일관성 검사는 CYP2D6의 복제본이 두 개 이상 존재할 때 스타 대립유전자의 페이징에 대한 보다 엄격한 검증을 수행합니다. 3명의 가족 구성원 모두에서 콜이 있었던 572건의 트리오 중 561건(98.1%)은 멘델의 법칙에 부합합니다. 일관되지 않은 모든 트리오는 페이징을 변경함으로써 해결될 수 있었습니다. 즉, 어떤 발단자도 양쪽 부모에서 존재하지 않는 스타 대립유전자를 갖지 않았습니다. 불일치 증례의 대다수(8/11)는 트리오에서 CYP2D6의 동일한 복제본 두 개가 서로 같은 일배체형에 있어야 하고 다른 일배체형에는 CYP2D6 복제본이 없어야 함을 확인한 경우입니다(즉, Cyrius 콜은 *1/*1인 반면 트리오 기반 페이징은 *5/*1x2임). 이 멘델 일관성 검사는 혈통 전반에서 유전자형의 일관성을 확인하지만, 호출된 스타 대립유전자의 정확성은 확인하지 않습니다. 트리오 일치도 검사를 진리 유전자형에 대해 위에서 수행된 정확도 검사와 결합하면 Cyrius에서 생성한 유전자형의 전체 정확도에 대한 신뢰도를 제공합니다.

5개 민족 집단 전반에서 실행 가능한 약물유전학적 변이

Cyrius에서 사용되는 방법은 다른 약물유전자 CYP2B6을 포함하여 동일한 상동성 문제를 겪는 다른 동종간 상동체 문제를 해결하는 데 적용할 수 있습니다. 보다 완전한 약물유전체학 그림을 제공하기 위해, 우리는 CPIC21 수준 A 지침(https://cpicpgx.org/genes-drugs/)이 있는 19개 약물유전자의 유전형을 결정하기 위한 추가 파이프라인을 개발했으며, 여기에서 영향을 받은 약물의 처방을 변경하는 데 유전 정보를 사용해야 합니다. 이러한 19개 유전자에는 CACNA1S, CFTR, CYP2B6, CYP2C19, CYP2C9, CYP2D6, CYP3A5, CYP4F2, DPYD, G6PD, IFNL3, NUDT15, RYR1, SLCO1B1, TPMT, UGT1A1, VKORC1, HLA-A 및 HLA-B가 포함되며, 이 중 우리는 CYP2D6/CYP2B6(Cyrius) 및 HLA-A/HLA-B(DRAGEN HLA 콜러)의 유전형을 분석하기 위해 특수 콜러를 사용합니다. 작은 변이 및 CNV를 스타 대립유전자 및 활성 점수로 변환함으로써, 1kGP 샘플에서 상이한 대사자 상태의 분포를 평가하고, 변형된 약물 처방이 필요한 유전자형을 갖는 유전자를 식별할 수 있었습니다. 이 분석에 기반하여, 우리는 범유전체 모집단의 99.2%가 실행 가능한 변이가 있는 최소 1개의 약리유전자를 가지고 있는 것으로 추정하며(그림 3), 이는 WGS가 거의 모든 건강한 개인에게 귀중한 약리유전학 정보를 제공할 수 있음을 나타냅니다.

그림 3. 범유전체 모집단에서 개인당 실행 가능한 변이가 있는 약물유전자 수의 분포.

요약

고도로 복잡한 CYP2D6 영역에 대해 정확한 유전형 분석을 제공하는 새로운 소프트웨어 도구인 Cyrius를 소개합니다. 144개의 검증 샘플에서, 우리는 범유전체 집단에서 스타 대립유전자의 대략 96%를 나타내는 40개의 상이한 스타 대립유전자에 걸친 Cyrius의 정확도를 확인할 수 있습니다. Cyrius에 대해 더 자세히 알고 싶은 독자는 이 방법을 설명하는 원고를 읽어보실 것을 권장합니다16. 기존 유전형 분석과 비교하여 WGS는 CNV를 포함한 모든 변이를 분석하고 올바른 소프트웨어와 결합하여 알려진 모든 스타 대립유전자를 정확하게 규명할 수 있기 때문에 모집단 전반에서 보다 정확한 대립유전자 빈도 데이터베이스를 구축하기 위한 유망한 옵션을 제공합니다. WGS 기반 PGx 도구 및 Cyrius와 같은 보다 표적화된 방법의 지속적인 개발을 통해 우리는 약물유전체학을 가속화하고 맞춤형 의료 실현에 한 걸음 더 다가설 수 있습니다.

자세한 정보 또는 학술용 DRAGEN 평가판 라이선스는 dragen-info@illumina.com으로 문의하십시오.

감사의 말

합의 유전자형을 생성하기 위한 CDC 유전자 검사 참조 물질 프로그램(GeT-RM)에 감사드립니다. 1kGP WGS 데이터를 생성하고 공개해 주신 New York Genome Center와 Coriell Institute for Medical Research에 감사드립니다. 공동 저자인 Fei Shen, Nina Gonzaludo, Alka Malhotra, Cande Rogert, Ryan Taft 및 David Bentley에게 감사드립니다. DRAGEN HLA 콜러를 제공해 주신 Bochao Zhang에게 감사드립니다.

참고 문헌
  1. Evans WE, Relling MV. Moving towards individualized medicine with pharmacogenomics. Nature.2004;429(6990):464-468. doi:10.1038/nature02626
  2. Zhou S-F. Polymorphism of human cytochrome P450 2D6 and its clinical significance: Part I. Clin Pharmacokinet.2009;48(11):689-723. doi:10.2165/11318030-000000000-00000
  3. Gaedigk A, Ingelman-Sundberg M, Miller NA, et al. The Pharmacogene Variation (PharmVar) Consortium: Incorporation of the Human Cytochrome P450 (CYP) Allele Nomenclature Database. Clin Pharmacol Ther.2018;103(3):399-401. doi:10.1002/cpt.910
  4. Nofziger C, Turner AJ, Sangkuhl K, et al. PharmVar GeneFocus: CYP2D6. Clin Pharmacol Ther.2020;107(1):154-170. doi:10.1002/cpt.1643
  5. Gaedigk A, Simon SD, Pearce RE, Bradford LD, Kennedy MJ, Leeder JS. The CYP2D6 activity score: translating genotype information into a qualitative measure of phenotype. Clin Pharmacol Ther.2008;83(2):234-242. doi:10.1038/sj.clpt.6100406
  6. Gaedigk A, Sangkuhl K, Whirl-Carrillo M, Klein T, Leeder JS. Prediction of CYP2D6 phenotype from genotype across world populations. Genet Med.2017;19(1):69-76. doi:10.1038/gim.2016.80
  7. Caudle KE, Sangkuhl K, Whirl-Carrillo M, et al. Standardizing CYP2D6 Genotype to Phenotype Translation: Consensus Recommendations from the Clinical Pharmacogenetics Implementation Consortium and Dutch Pharmacogenetics Working Group. Clin Transl Sci.2020;13(1):116-124. doi:10.1111/cts.12692
  8. Nofziger C, Paulmichl M. Accurately genotyping CYP2D6: not for the faint of heart. Pharmacogenomics.2018;19(13):999-1002. doi:10.2217/pgs-2018-0105
  9. Yang Y, Botton MR, Scott ER, Scott SA. Sequencing the CYP2D6 gene: from variant allele discovery to clinical pharmacogenetic testing. Pharmacogenomics.2017;18(7):673-685. doi:10.2217/pgs-2017-0033
  10. Gaedigk A. Complexities of CYP2D6 gene analysis and interpretation. Int Rev Psychiatry Abingdon Engl.2013;25(5):534-553. doi:10.3109/09540261.2013.825581
  11. Pratt VM, Everts RE, Aggarwal P, et al. Characterization of 137 Genomic DNA Reference Materials for 28 Pharmacogenetic Genes: A GeT-RM Collaborative Project. J Mol Diagn JMD.2016;18(1):109-123. doi:10.1016/j.jmoldx.2015.08.005
  12. Bousman CA, Jaksa P, Pantelis C. Systematic evaluation of commercial pharmacogenetic testing in psychiatry: a focus on CYP2D6 and CYP2C19 allele coverage and results reporting. Pharmacogenet Genomics.2017;27(11):387-393. doi:10.1097/FPC.0000000000000303
  13. Ashley EA. The Precision Medicine Initiative: A New National Effort. JAMA.2015;313(21):2119-2120. doi:10.1001/jama.2015.3595
  14. The Genome of the Netherlands Consortium, Francioli LC, Menelaou A, et al. Whole-genome sequence variation, population structure and demographic history of the Dutch population. Nat Genet.2014;46(8):818-825. doi:10.1038/ng.3021
  15. Turnbull C, Scott RH, Thomas E, et al. The 100 000 Genomes Project: bringing whole genome sequencing to the NHS. BMJ. 2018;361:k1687. doi:10.1136/bmj.k1687
  16. Chen X, Shen F, Gonzaludo N, et al. Cyrius: accurate CYP2D6 genotyping using whole-genome sequencing data. Pharmacogenomics J.Published online January 18, 2021:1-11. doi:10.1038/s41397-020-00205-5
  17. Gaedigk A, Turner A, Everts RE, et al. Characterization of Reference Materials for Genetic Testing of CYP2D6 Alleles: A GeT-RM Collaborative Project. J Mol Diagn JMD.Published online August 9, 2019. doi:10.1016/j.jmoldx.2019.06.007
  18. Numanagić I, Malikić S, Ford M, et al. Allelic decomposition and exact genotyping of highly polymorphic and structurally variant genes. Nat Commun.2018;9(1):1-11. doi:10.1038/s41467-018-03273-1
  19. Lee S, Wheeler MM, Patterson K, et al. Stargazer: a software tool for calling star alleles from next-generation sequencing data using CYP2D6 as a model. Genet Med.2019;21(2):361. doi:10.1038/s41436-018-0054-0
  20. The 1000 Genomes Project Consortium. A global reference for human genetic variation. Nature.2015;526(7571):68-74. doi:10.1038/nature15393
  21. Relling MV, Klein TE. CPIC: Clinical Pharmacogenetics Implementation Consortium of the Pharmacogenomics Research Network. Clin Pharmacol Ther.2011;89(3):464-467. doi:10.1038/clpt.2010.279