3bmGPT™: 체계적 3D 결합 모드 탐색을 위한 대규모 언어 모델
1. 3bmGPT란 무엇인가?
3bmGPT(3D Binding Mode GPT)는 3D 단백질-리간드 결합 상호작용을 텍스트 표현으로 변환하는 생성형 사전학습 트랜스포머 모델이다. 3D 기하 데이터를 'binding words'와 'binding sentences'로 변환해 분자 결합의 복잡성을 다루며, 대규모 언어 모델(LLM)이 문맥 추론을 통해 화학적 인식 패턴을 학습할 수 있게 한다.
2. 기존 구조 기반 모델 대비 차별적 장점
동적 결합 표현: 정적인 도킹 스냅샷과 달리 다양한 상호작용 포즈로 학습해 더 넓은 결합 문맥을 포착한다.
3D 데이터의 선형화: 기존 모델이 3D 좌표 처리에 어려움을 겪는 반면, 3bmGPT는 공간 상호작용을 안정적이고 학습 가능한 문자열 형식으로 토큰화하는 방법을 제시한다.
기능적 문맥: 단순 구조 예측을 넘어 상호작용의 '의미'에 집중해 서로 다른 단백질 사이의 기능적 유사성을 식별한다.
3. 핵심 기술: 3bmGPT가 분자 상호작용을 해석하는 방식
3D 기하를 'binding words'로 인코딩: 3bmGPT는 공간 좌표를 단순히 읽는 것이 아니라 분자 인식의 근본 메커니즘을 포착한다. 각 상호작용은 약리단 역할, 상호작용 파트너, 거리·각도·방향 같은 기하 기술자를 통합한 상징 단위로 인코딩된다.
'binding sentences' 구성: 개별 binding word를 단백질 포켓 내 전체 결합 모드를 나타내는 문장으로 배열한다. 이를 통해 모델은 단순 물리적 거리보다 분자 인식의 문법과 상호작용의 기능적 흐름을 해석한다.
압도적 학습 규모: 모델의 견고성과 범용성을 확보하기 위해 CrossDocked2020 데이터셋을 대폭 증강했다. 단일 정적 포즈가 아니라 단백질-리간드 쌍당 120개의 다양한 도킹 포즈로 학습했으며, 6천만 개 이상의 binding sentences를 확보해 특정 구조 스냅샷에 치우치지 않고 다양한 결합 환경에 일반화하도록 했다.
GPT-2와 토큰화 기반 최적화 아키텍처: 3bmGPT는 분자 데이터에 맞게 최적화된 검증된 GPT-2 기반 구조를 활용한다. 토큰화를 통해 복잡한 상호작용 패턴을 효율적인 토큰으로 분해하고, 기능적 연속성과 분자 유사성을 높은 계산 효율로 학습한다.
4. 과학적 검증과 성능
화학-결합 상관성: 공유 binding word 비율이 화학적 유사도(Tanimoto coefficient)와 상관관계를 보임을 확인했다.
비교 성능: Rebastinib-ABL1 상호작용 예측에서 3bmGPT는 AUC 0.8486을 달성해 BERT 기반 모델(AUC 0.66~0.77)을 상회했다.
기능적 클러스터링: 10,000개 결합 임베딩의 UMAP 시각화에서 23개의 뚜렷한 클러스터가 나타났고, Kinase, Protease, Nuclear Receptor 등 생물학적 기능별로 단백질을 정확히 묶었다.
5. 사례 연구: EGFR(PDB ID: 5EDQ)
타깃 분류: 새로운 EGFR 구조가 주어졌을 때 모델은 이를 protein kinase로 정확히 식별하고 Tyrosine Kinase(TK) 계열 클러스터에 배치했다.
리간드 유사성과 재창출: Merestinib, Brigatinib처럼 유사한 결합 문맥을 가진 리간드를 찾아냈으며, 결합 모드 유사성을 기반으로 약물 재창출 후보를 식별하는 데 활용 가능함을 보였다.
6. 논문에서 강조한 주요 활용 분야
가상 스크리닝 강화: 분자 형태만이 아니라 상호작용 문맥을 기준으로 LLM 임베딩 공간을 활용해 대규모 화합물 라이브러리를 탐색한다.
Scaffold hopping: 핵심 결합 상호작용(binding signatures)을 유지하는 새로운 화학 스캐폴드를 식별한다.
타깃 비의존 탐색: 명시적 단백질 타깃 라벨이 없더라도 결합 유사성을 분석한다.
오프타깃 식별: 관련 없는 단백질 계열 사이에서도 유사한 binding sentences를 찾아 잠재적 교차 반응성을 감지한다.
결론: 신약개발의 새로운 패러다임
3bmGPT는 3D 생물학적 상호작용을 언어처럼 다루는 프레임워크를 제시한다. 텍스트화된 결합 데이터로 학습함으로써 모델은 분자 인식의 '문법'을 포착하고, 리드 발굴, 안전성 프로파일링, 단백질-리간드 인터랙톰의 체계적 탐색을 위한 과학적으로 견고한 도구를 제공한다.