paper-radar 주간 다이제스트
2026-W29
바이오인포·임상ML·신약AI 논문 주간 요약. 모든 해석은 preprint 단계에서의 분석임.
단일세포 전사체 파운데이션 모델 경쟁에서 scVision이 비전 트랜스포머 방식을 처음으로 파운데이션 모델 규모로 적용했다 — 유전자를 언어 토큰이 아닌 2D 이미지 픽셀로 표현해 6개 독립 보류 연구에서 zero-shot SOTA를 보고했다. 이번 주 유일한 동료심사 논문인 Corgi는 RNA-seq만으로 후성유전체 신호를 예측하는 경로를 코드와 함께 공개해, 즉시 재현이 가능한 가장 완성도 높은 결과물이다. Evo 2 게놈 파운데이션 모델의 동결 레이어 프로빙으로 AMR ROC-AUC 0.977을 달성한 사례는, 범용 생물서열 파운데이션 모델이 임상·생물안전 문제에 직접 닿기 시작한 신호다.
저자: Ridvan Yesiloglu, Sakib Mostafa (공동 1저자); James Zou (교신저자 추정) | Stanford University (Adeli, Islam, Alizadeh, Wu, Xing 그룹)
저자: Ekin Deniz Aksu (1저자), Martin Vingron (교신저자) | Max Planck Institute for Molecular Genetics
저자: Jagan Mohan Reddy Dwarampudi (1저자), Tania Banerjee (교신저자 추정) | University of Houston + MD Anderson Cancer Center
저자: Guntoro 외 (교신저자 미확인) | AIxBio Hackathon 2026 참가팀
저자: Ashka Shah (1저자), Rick Stevens (교신저자) | University of Chicago
왜 지금 이 문제인가
DNA 서열로부터 유전자 조절 신호를 예측하는 서열-기능 모델은 Enformer(DeepMind, 2021), Borzoi(2024)를 거치며 예측 정확도가 빠르게 높아졌다. 그러나 이 모델들은 공통적으로 학습에 쓰인 세포 유형에 묶인다는 근본 제약을 벗어나지 못했다. 새로운 세포 유형의 크로마틴 접근성(chromatin accessibility)이나 히스톤 변형(histone modification)을 예측하려면 그 세포의 ATAC-seq·ChIP-seq 실험이 반드시 선행돼야 했다. 희귀 세포 유형, 환자 고유의 세포 상태, 임상 샘플처럼 실험이 제한된 환경에서는 이 모델들이 작동하지 않았다. "기존 서열-기능 모델은 세포 유형을 학습 데이터 안에 고정해 넣는다"는 문제의식에서 Corgi가 출발했다.
핵심 설계 아이디어: FiLM과 trans-regulator 컨텍스트
Corgi는 이 병목을 트랜스-조절 인자(trans-regulator) 발현 벡터를 두 번째 입력으로 받는 방식으로 우회한다. 2,891개의 전사인자·공활성인자·크로마틴 수식 효소·RNA 결합 단백질 발현값으로 구성된 컨텍스트 벡터를, FiLM(Feature-wise Linear Modulation) 레이어를 통해 DNA 서열 표현에 feature-wise로 곱하고 더하는 선형 변조로 결합한다. 세포 유형의 정체성을 레이어 안에 하드코딩하는 대신, RNA-seq에서 얻은 trans-regulator 발현 프로파일로 추론 시점에 조건을 건다. 학습에서 한 번도 본 적 없는 세포 유형이라도 RNA-seq 데이터만 있으면 크로마틴 접근성·히스톤 변형·유전자 발현 커버리지를 예측할 수 있다. 보류 세포 유형 기준 DNase-seq 예측 평균 Pearson r = 0.84라는 수치가 이 접근법의 성능을 뒷받침한다(원문 결과 기준).
Corgi+: 실험 없이 에피게놈 트랙을 얻는 경로
확장 모델 Corgi+는 여기서 한 발 더 나간다. RNA-seq 입력만으로 후성유전체 트랙을 대리(imputation)하는 기능을 추가해 기존 방법 중 SOTA를 달성했다고 보고했다. ATAC-seq·ChIP-seq 없이 RNA-seq 데이터만 보유한 연구자가 크로마틴 프로파일을 1차 스크리닝할 수 있는 경로가 Nature Communications 게재와 코드 공개로 즉시 활용 가능해졌다. `pip install .` 수준의 설치, 단일 서열 추론 스크립트, BigWig 출력 예시가 GitHub에 포함돼 있어 NVIDIA Ampere 이상 GPU만 있으면 재현 장벽이 낮다.
핵심 가정과 한계
Corgi가 작동하는 전제는 세포 유형의 기능적 정체성이 2,891차원 trans-regulator 발현 프로파일로 충분히 표현된다는 것이다. 이 가정이 상피·면역처럼 극단적으로 다른 세포 유형 사이에서도 성립하는지, 낮은 감도의 scRNA-seq에서 trans-regulator 입력 품질 저하가 예측 성능에 언제부터 영향을 주는지는 이번 논문에서 체계적으로 다루지 않는다. 3D 크로마틴 구조(enhancer-promoter looping) 같은 공간 게놈 정보가 모델 입력에 포함되지 않는다는 구조적 한계도 있다. 임상적으로 중요한 특정 조절 요소(enhancer)의 예측 정확도는 genome-wide bins 수준 지표와 다를 수 있어 별도 확인이 필요하다.
R&D 관점 관전 포인트
외부 맥락: 유전자 치료 분야(BioMarin, uniQure, Spark Therapeutics)는 조직 특이적 인핸서 선택에 서열-기능 모델을 이미 탐색 중이다. Corgi의 세포 유형 일반화 능력은 이 방향과 직접 닿는다. 또한 임상 2·3상 샘플에 에피게놈 레이어를 소급 추가하는 레트로스펙티브 바이오마커 분석이 실질적인 적용 시나리오가 될 수 있다 — 기존에 bulk RNA-seq만 확보된 샘플에서 Corgi+로 에피게놈 신호를 1차 복원하고, 비반응 환자의 에피게놈 특성을 사후 분석하는 방향이다. Max Planck Institute 비상업 학술기관 산출물로 코드가 오픈소스이므로, 제약사 계산생물학팀의 내부 파이프라인 통합이 직접 상업화보다 현실적인 도입 경로다. 추정: Corgi+의 imputation 성능이 외부 코호트에서 지속적으로 재현된다면, 고비용 ATAC-seq·ChIP-seq 서비스의 일부 수요가 계산 방법으로 대체되는 경쟁 압력이 생길 수 있다.
Inkling — 오픈웨이트 975B 멀티모달 MoE 모델 (Thinking Machines Lab)
SEED — 에이전트 강화학습을 위한 자기 진화 온-폴리시 증류 (Tsinghua · Zhejiang · CUHK 외)