HLAscan: 차세대염기서열분석 데이터를 이용한 HLA 영역 유전형 분석.
저자: Sojeong Ka, Sunho Lee, Jonghee Hong, Yangrae Cho, Joohon Sung, Han-Na Kim, Hyung-Lae Kim, Jongsun Jung.
소속: Syntekabio R&D center 및 Main office, Seoul National University School of Public Health, Ewha Womans University School of Medicine 등.
초록
배경: 최근 여러 연구는 NGS 기반 human leukocyte antigen(HLA) typing이 다형성이 매우 높은 영역의 variant calling에 실현 가능하고 유망한 기술임을 보여주었다. 그러나 충분한 read depth를 갖추고 allele phasing 문제를 완전히 해결한 방법은 아직 없었다. 본 연구에서는 NGS 데이터를 이용한 HLA genotyping 방법인 HLAscan을 개발했다.
결과: HLAscan은 read를 international ImMunoGeneTics project/human leukocyte antigen(IMGT/HLA) 데이터베이스의 HLA 서열에 정렬한다. 정렬된 read의 분포를 이용해 점수 함수를 계산하고, false-positive allele을 단계적으로 제거해 올바르게 phased allele을 결정한다. 1000 Genomes Project와 International HapMap Project의 공개 데이터셋을 활용한 비교 HLA typing 시험에서 HLAscan은 HLAreporter, PHLAT 등 기존 NGS 기반 방법보다 더 정확한 HLA typing을 수행했다.
또한 NextGen으로 생성한 데이터에서 HLAscan의 HLA-A, -B, -DRB1 typing 결과는 Sanger sequencing 기반 방법의 결과와 동일했다. Illumina HiSeq X-TEN 플랫폼에서 다양한 coverage depth로 생성한 가족 데이터셋에도 적용했으며, 90x 이상 depth의 서열에서 HLA-A, -B, -C, -DQB1, -DRB1 allele type을 100% 정확도로 식별했고 전체 정확도는 96.9%였다.
결론: HLAscan은 read distribution을 고려해 실제 allele type을 결정하는 alignment 기반 프로그램으로, 기존 HLA typing 도구보다 우수한 성능을 보였다. 따라서 whole-genome, exome, target sequence 전반에서 HLA type 결정에 신뢰성 있게 적용할 수 있다.
키워드: HLA typing, next-generation sequencing, phasing issue, HLAscan.