paper-radar 주간 다이제스트
2026-W35
바이오인포·임상ML·신약AI 논문 주간 요약. 모든 해석은 preprint 단계에서의 분석임.
팬-암 공간 전사체 파운데이션 모델(GITIII-scale)과 다중 모달 분자 표현 모델(Mol-JEPA)이 같은 주에 코드를 공개했다 — 재현 가능한 기반 기술이 종양 미세환경(TME) 해석과 신약 ADMET 예측 양쪽에서 동시에 층을 쌓은 한 주였다. IVT 수율을 10만 개 서열 스크리닝과 CNN으로 예측한 연구는 제조 공정 자체를 딥러닝 대상으로 삼아 이번 주 가장 뚜렷한 산업 신호를 냈다. 조혈줄기세포 Perturb-seq과 뇌 장독취 RNA-seq 파이프라인은 실험·데이터 생성 단계의 새로운 접근으로 각각 혈액암 타깃 발굴과 신경질환 전사체 인프라의 토대를 다졌다.
Xiao Xiao (1저자·교신저자 추정) | Yale University / University of Pennsylvania / University of Michigan, Ann Arbor
arXiv (q-bio.QM) · 2026-08-26 · [preprint(미동료심사)] · DOI · code
Dinghai Zheng (1저자) | Vikram Agarwal (교신저자 추정, 원문 확인 필요) | 소속 미기재(산업 연구진 추정)
arXiv · 2026-08-24 · [preprint(미동료심사)] · DOI · 코드 미공개 — 재현 불가
Joseph S Bowness (1저자) | Lars Velten (교신저자) | Centre for Genomic Regulation, Barcelona; Deutsches Krebsforschungszentrum / 핀란드 기관 포함 다국적 컨소시엄
bioRxiv · 2026-08-27 · [preprint(미동료심사)] · DOI · 코드 공개 여부 미확인 (bioRxiv 직접 접근 불가 환경)
Cedric Kouam (1저자) | Fritz Sedlazeck, Luigi Ferrucci (교신저자 추정) | 다기관 컨소시엄 (국립노화연구소·Baylor College of Medicine 등)
bioRxiv · 2026-08-26 · [preprint(미동료심사)] · DOI · 코드 미공개 — 재현 불가
Florian Rottach (1저자) | Carsten Eickhoff (교신저자) | University of Tübingen / Boehringer Ingelheim / University of Texas at Austin / Brown University
arXiv (cs.LG / q-bio.BM) · 2026-08-23 · [preprint(미동료심사)] · DOI · code
공간 전사체 파운데이션 모델이 등장한 것은 어제오늘 일이 아니다. scGPT, GeneFormer, HEST-1k 기반 모델들이 줄지어 나왔고, 공통 전략은 단일세포 유전자 발현 패턴을 트랜스포머로 학습하는 것이었다. 그런데 여기에는 한 가지 구조적 공백이 있었다. 세포 하나의 상태는 그 세포 주변을 어떤 세포들이 둘러싸고 있는가에 따라 결정된다. 리간드-수용체 신호(ligand-receptor signaling)가 세포 상태를 규정하는데, 기존 파운데이션 모델은 이 공간적 맥락 — 즉 이웃 세포들과의 상호작용 — 을 제대로 포착하지 못했다.
GITIII-scale은 이 공백을 정면으로 겨냥했다. NLP 방식의 설계 직관—세포를 단어, 이웃 세포군을 문맥으로 취급하는—을 공간 전사체에 그대로 이식했다. 구체적으로는 세 수준으로 쌓인다. 가장 아래 레이어는 CCI 해석 레이어로, 수용 세포의 각 유전자가 발신 세포에 의해 어떻게 영향받는지를 분해 가능한 형태로 표현한다. 중간은 이웃 세포군 전체의 임베딩을 생성하는 니치 임베딩 레이어, 그 위에 팬-암 사전학습이 쌓인다. 특히 1-레이어 그래프 트랜스포머에 feed-forward network를 두지 않은 선택이 눈에 띈다. 해석 가능성을 높이려는 의도적 단순화다.
평가 방식도 중요하다. 이 논문은 훈련 시 보지 않은 암종에서 얼마나 니치 관련 세포 상태 변화를 포착하는지를 기준으로 삼았다. 특정 암종에 맞춰 따로 학습하지 않아도 TME 구조를 표현할 수 있는지 물은 것이다. 초록 기준으로 "기존 공간 전사체 파운데이션 모델 대비 우수"하다고 기술하지만, 비교 대상 모델명과 구체 수치는 원문 방법 섹션에서 직접 확인이 필요하다.
재현성 측면에서 이번 주 다섯 편 중 가장 문이 열려 있다. 코드·체크포인트·사전학습 데이터 모두 GitHub에 공개되어 있고, PyPI 패키지(`gitiii`)도 배포된 것으로 확인된다. 단, 영상 기반 공간 전사체 데이터(MERFISH·Xenium 수준)와 scRNA-seq 매칭 데이터를 직접 보유하지 않은 연구팀이라면 완전한 재현에 상당한 컴퓨팅·데이터 접근 비용이 따를 것이다.
이 논문을 어떻게 쓸 것인가. 면역항암 연구자라면 CCI 해석 레이어를 통해 특정 리간드-수용체 쌍이 어떤 세포 상태 변화를 유도하는지 추적할 수 있다. 코드가 공개된 만큼 scRNA-seq + 공간 전사체 매칭 데이터를 보유한 연구라면 임베딩 추출부터 시작할 수 있다. 임베딩 품질이 면역항암제 반응 예측으로 곧바로 이어지지는 않는다. 이 논문이 남긴 가장 중요한 열린 질문은 하나다: 계산 벤치마크에서 포착된 TME 패턴이 환자 코호트에서 임상 결과와 얼마나 상관하는가.
분자 표현 학습(molecular representation learning)의 오랜 숙제는 다중 모달리티를 어떻게 통합하느냐였다. 구조(2D 그래프)만 쓰는 모델에서 출발해, 세포 표현형 이미지를 더하고, ADMET 측정값을 더하고, 양자화학 계산값까지 더하려는 시도가 반복됐다. 주류는 대조 학습(contrastive learning)이었다. 모달리티 두 쌍을 가져다 표현 공간에서 가깝게 당기는 방식. 그런데 이 접근에는 두 가지 구조적 문제가 있었다. 하나는 모달리티 붕괴(modality collapse) — 어느 한 모달리티가 표현 공간을 지배하면 나머지가 사실상 무시된다. 다른 하나는 화학적으로 부자연스러운 증강(chemically invalid augmentation) — 원자 교란이나 결합 변형이 화학 의미를 파괴한다.
Mol-JEPA는 이 두 문제를 정면 돌파하지 않고 우회한다. LeCun이 제안한 JEPA(Joint Embedding Predictive Architecture) 프레임워크를 분자 도메인에 이식하는 방식이다. 핵심 직관은 이렇다: 픽셀이나 토큰을 직접 재구성하는 대신, 잠재 공간(latent space) 내에서 마스킹된 모달리티의 표현을 예측하도록 학습한다. 검토필요: 14개 모달리티(GitHub README 기준 12개) 중 일부를 마스킹하고, 나머지로부터 마스킹된 모달리티의 잠재 표현을 예측하는 예측 네트워크(predictor)를 학습한다는 것이 모달리티 마스킹(modality masking)의 핵심이다. 화학적으로 무의미한 저수준 노이즈를 암기할 이유가 없으므로 부자연스러운 증강 문제가 원천적으로 사라진다.
평가는 OpenADMET, ASAP-Polaris(COVID 표적 결합 + ADMET), Biogen ADME 세 벤치마크로 이루어졌다. 저데이터(low-data) 설정에서 기존 GNN 기반 모델과 기술자(descriptor) 기반 모델 대비 낮은 MAE를 달성했다고 보고하지만, 구체적 수치는 원문 결과 테이블에서 확인해야 한다.
이 논문에서 가장 먼저 점검해야 할 위험 요인은 데이터 누수(data leakage)다. 약 469만 분자(4.69M)로 사전학습할 때 OpenADMET·Polaris 챌린지의 평가 분자가 포함되어 있다면 성능이 과대평가된다. 이 논문을 인용하기 전, 원문에서 decontamination 처리 여부를 먼저 확인해야 한다.
이 논문을 내 연구에 어떻게 쓸 것인가. 자체 ADMET 측정값이 수십~수백 개 수준의 소규모 데이터셋이라면, Mol-JEPA의 사전학습 임베딩을 출발점으로 파인튜닝하는 전이학습이 가장 빠른 진입 경로다. HuggingFace 통합으로 진입 장벽이 낮다. Boehringer Ingelheim 공식 GitHub에서 코드가 나왔다는 사실이 이 논문의 가장 강한 신호다. 내부 약물 개발 파이프라인에 이 아키텍처를 실제로 통합하려는 방향성이 거기서 읽힌다.