paper-radar paper-radar 주간 다이제스트 2026-W35

바이오인포·임상ML·신약AI 논문 주간 요약. 모든 해석은 preprint 단계에서의 분석임.

At a Glance

팬-암 공간 전사체 파운데이션 모델(GITIII-scale)과 다중 모달 분자 표현 모델(Mol-JEPA)이 같은 주에 코드를 공개했다 — 재현 가능한 기반 기술이 종양 미세환경(TME) 해석과 신약 ADMET 예측 양쪽에서 동시에 층을 쌓은 한 주였다. IVT 수율을 10만 개 서열 스크리닝과 CNN으로 예측한 연구는 제조 공정 자체를 딥러닝 대상으로 삼아 이번 주 가장 뚜렷한 산업 신호를 냈다. 조혈줄기세포 Perturb-seq과 뇌 장독취 RNA-seq 파이프라인은 실험·데이터 생성 단계의 새로운 접근으로 각각 혈액암 타깃 발굴과 신경질환 전사체 인프라의 토대를 다졌다.

This Week's Top 5

#1 preprint

암 종양 미세환경의 해석 가능한 표현 학습 (Learning Interpretable Tumor Microenvironment Representations by Fitting Pan-Cancer Cell State-Niche Correlation)

Xiao Xiao (1저자·교신저자 추정) | Yale University / University of Pennsylvania / University of Michigan, Ann Arbor

arXiv (q-bio.QM) · 2026-08-26 · [preprint(미동료심사)] · DOI · code

KEY POINT
GITIII-scale은 scRNA-seq과 영상 기반 공간 전사체(spatial transcriptomics) 매칭 팬-암 데이터베이스로 계층적 그래프 트랜스포머를 사전학습해, 훈련 시 보지 않은 암종에서도 세포 상태-니치(cell state-niche) 상관관계를 기존 공간 파운데이션 모델보다 정확하게 포착한다고 보고한다. 리간드-수용체(ligand-receptor) 경로까지 역추적 가능한 해석 레이어(1-레이어 그래프 트랜스포머, feed-forward network 없음)가 핵심 신규성이며, 선행 연구 GITIII(Nature Machine Intelligence, 2025)를 팬-암 스케일로 확장한 것이다.
💡 인사이트
"세포를 단어, 이웃 세포군을 문맥"으로 취급한다는 설계 직관은 NLP에서 이미 검증된 논리다. 공간 단백질체학 데이터가 급증하는 시점에 코드까지 갖춘 TME 특화 파운데이션 모델이 나왔다. 면역항암 타깃 발굴 파이프라인에 즉시 통합을 검토할 수 있는 드문 시점이다.
🔬 Method: 영상 기반 공간 전사체 + scRNA-seq 3단 계층(CCI 해석 레이어 → 니치 임베딩 레이어 → 팬-암 사전학습). 비교 대상 베이스라인 모델명과 구체 수치는 초록 기준 미제공 — 원문 방법 섹션 확인 필요. 🩺 Clinical: TME 패턴과 면역항암제 반응(ORR)을 연결하는 환자 코호트 검증이 아직 없다. in silico 계산 POC 단계다. 🏭 Industry: 10x Genomics·Akoya Biosciences 등 공간 생물학 플랫폼 기업의 데이터에서 더 깊은 TME 해석을 원하는 빅파마 R&D팀이 즉각적 관심 대상. 코드 공개로 파인튜닝 경로가 열렸다.
검증 수준: in silico (팬-암 벤치마크 훈련 외 암종 포함)
#2 preprint 코드 미공개 — 재현 불가

대규모 병렬 스크리닝과 딥러닝으로 RNA 생산량 최적화 (Optimizing RNA yield using deep neural networks coupled to massively parallel screening)

Dinghai Zheng (1저자) | Vikram Agarwal (교신저자 추정, 원문 확인 필요) | 소속 미기재(산업 연구진 추정)

arXiv · 2026-08-24 · [preprint(미동료심사)] · DOI · 코드 미공개 — 재현 불가

KEY POINT
10^5개 무작위 올리고뉴클레오타이드 라이브러리를 NGS로 병렬 정량한 뒤 CNN 기반 딥러닝으로 시험관 전사(IVT, in vitro transcription) RNA 생산량을 예측했다. 보류(held-out) 테스트 세트에서 예측-실측 Pearson 상관계수 0.94를 달성해, 신규 서열 설계 후보를 실험 전 사전 우선순위화하는 데 충분한 수준의 예측력을 보였다고 보고한다. 기존 단변량 DOE(Design of Experiment) 접근과 비교할 때 탐색 서열 공간을 수만 배 확장하는 구조다.
💡 인사이트
제조 공정 자체를 딥러닝 타깃으로 삼은 것이 이 논문의 핵심이다. Pearson 0.94는 단일 held-out 세트 기준이며, 무작위 올리고뉴클레오타이드에서 학습한 모델이 구조화된 mRNA 서열(5'UTR·코딩 영역·폴리A 테일)로 어떻게 일반화되는지는 별도 확인이 필요하다.
🔬 Method: 서열 → CNN → IVT 수율 예측. 베이스라인 비교 모델과 아키텍처 세부(레이어 수·하이퍼파라미터) 미제공. 코드·데이터 미공개로 독립 재현 불가. 🩺 Clinical: 제조 업스트림 도구이며 직접적 임상 접점이 없다. 수율 향상이 최종 RNA 약물의 품질·면역원성에 미치는 영향은 원문에서 다루지 않는다고 기술되어 있다. 🏭 Industry: Moderna·BioNTech 등 mRNA 플랫폼 기업이 즉각적 수요자. 코드·데이터 미공개가 외부 채택 장벽이나, 방법론(대규모 NGS 스크리닝 + CNN) 자체는 내부 구현 가능한 프레임워크다.
검증 수준: in silico (단일 held-out 테스트 세트)
#3 preprint

Perturb-seq으로 밝힌 조혈줄기·전구세포의 공동 조절 유전자 프로그램 (Perturb-seq identifies co-regulated gene programs shaping hematopoietic stem and progenitor cell function)

Joseph S Bowness (1저자) | Lars Velten (교신저자) | Centre for Genomic Regulation, Barcelona; Deutsches Krebsforschungszentrum / 핀란드 기관 포함 다국적 컨소시엄

bioRxiv · 2026-08-27 · [preprint(미동료심사)] · DOI · 코드 공개 여부 미확인 (bioRxiv 직접 접근 불가 환경)

KEY POINT
인간 조혈줄기·전구세포(HSPC, hematopoietic stem and progenitor cell)에 CRISPR 기반 Perturb-seq을 적용해, 단일 유전자 교란이 복수의 공동 조절 유전자 프로그램(co-regulated gene programs)에 동시에 파급된다는 것을 단일세포 해상도로 지도화했다. 단일 유전자-표현형 관계보다 복잡한 다중 프로그램 단위의 HSPC 조절 구조를 체계적으로 기술한 것이 이 연구의 핵심 기여다.
💡 인사이트
AML·MDS에서 단일 드라이버 유전자를 표적으로 삼아도 내성이 반복되는 이유를, 이 연구는 "프로그램 복수성"이라는 언어로 구체화한다. 복수 프로그램 상태를 동시에 겨냥하는 조합 전략이 왜 필요한지를 데이터로 직접 보여주는 연구다.
🔬 Method: Perturb-seq(CRISPR 교란 + scRNA-seq 동시 판독) → 공동 발현 기반 유전자 프로그램 추출(NMF 계열 추정) → 교란-프로그램 연결 매핑. 구체적 유전자 수·세포 수·통계적 유의성 수치는 원문 접근 불가로 미제공. 🩺 Clinical: ex vivo 인간 HSPC 실험. 골수 니치 환경이 결여된 상태이므로 in vivo 거동과 직접 등치하기 어렵다. 기능 검증(마우스 이식 모델 등)은 초록 수준에서 확인되지 않는다. 🏭 Industry: 혈액암(AML·MDS) 신약 타깃 발굴과 CRISPR 기반 HSC 유전자 치료 안전성 평가 두 경로 모두에 닿는다. Velten 컨소시엄 규모는 유럽계 빅파마 파트너십 관심 대상.
검증 수준: ex vivo (인간 HSPC) + 단일세포 전사체 분석
#4 preprint 코드 미공개 — 재현 불가

인간 뇌 장독취 RNA-seq 확장 분석을 가능케 하는 SALRR (SALRR: Scalable Analysis of Long-Read RNA-Seq Enables Comprehensive Transcriptome Profiling in Human Brain)

Cedric Kouam (1저자) | Fritz Sedlazeck, Luigi Ferrucci (교신저자 추정) | 다기관 컨소시엄 (국립노화연구소·Baylor College of Medicine 등)

bioRxiv · 2026-08-26 · [preprint(미동료심사)] · DOI · 코드 미공개 — 재현 불가

KEY POINT
기존 장독취 분석 도구(FLAIR·Bambu·IsoSeq3)가 대규모 다샘플 데이터셋에서 병목을 일으키는 문제를 해소하는 확장 가능한 파이프라인 SALRR을 개발하고, 인간 뇌 조직에서 포괄적인 이소폼(isoform) 프로파일링을 수행했다. 뇌 전사체의 이소폼 다양성이 신경발달·신경퇴행성 질환과 연결된다는 점에서, 분석 인프라 레이어의 병목을 직접 타깃한 논문이다.
💡 인사이트
알고리즘 혁신보다 확장 가능한 분석 파이프라인 구현에 집중한 논문이다. 데이터 생성보다 분석 처리가 병목임을 현장 연구자들이 인식하고 있다는 반증이기도 하다. 코드 공개 이후 신경퇴행성 질환 이소폼 타깃 발굴의 전제 인프라로 빠르게 채택될 가능성이 있다.
🔬 Method: 확장 가능한 계산 파이프라인 논문. 구체적 구성 요소(정렬 도구·이소폼 병합 전략·병렬화 방식)와 기존 도구 대비 속도·정확도 벤치마크 수치는 원문 접근 불가로 미제공. DOI 충돌 문제로 인용 최소화. 🩺 Clinical: in silico(대규모 시퀀싱 데이터 분석). 발굴된 이소폼과 신경질환 표현형 간 연관성 분석은 이 논문의 범위 밖이다. 🏭 Industry: Oxford Nanopore Technologies·PacBio 등 장독취 플랫폼 기업의 소프트웨어 생태계와 직결되며, Biogen·Roche 등 신경질환 파이프라인 보유사에는 이소폼 수준 타깃 발굴의 전제 인프라.
검증 수준: in silico (대규모 시퀀싱 데이터 분석)
#5 preprint

다중 모달 JEPA 기반 분자 표현 학습 (Mol-JEPA: A Multimodal Joint Embedding Predictive Architecture for Molecules)

Florian Rottach (1저자) | Carsten Eickhoff (교신저자) | University of Tübingen / Boehringer Ingelheim / University of Texas at Austin / Brown University

arXiv (cs.LG / q-bio.BM) · 2026-08-23 · [preprint(미동료심사)] · DOI · code

KEY POINT
LeCun이 제안한 JEPA(Joint Embedding Predictive Architecture) 프레임워크를 분자 표현 학습에 이식해, 검토필요: 14개 모달리티(분자 구조·세포 표현형·결합 친화도·ADMET 프로파일·양자화학 데이터 등; GitHub README는 12개 명시, 원문 확인 필요)를 모달리티 마스킹(modality masking)으로 통합 학습한다. 약 469만 분자(4.69M) 규모로 사전학습하고 OpenADMET·ASAP-Polaris·Biogen ADME 등 저데이터(low-data) 벤치마크에서 기존 GNN 기반 모델 대비 낮은 MAE를 달성했다고 보고한다. 구체적 MAE 수치는 원문 직접 확인 필요.
💡 인사이트
"잠재 공간에서 예측한다"는 JEPA의 핵심 직관이 분자 도메인에서 설득력 있게 작동하는지 보여주는 첫 체계적 시도다. Boehringer Ingelheim 공식 GitHub에 코드가 공개되었고 HuggingFace 통합까지 갖췄다. 기업이 이 아키텍처를 내부 도구로 진지하게 탐색하고 있다는 신호다.
🔬 Method: 검토필요: 14개 모달리티 인코더(GitHub README 기준 12개) → 공유 잠재 공간 → 모달리티 마스킹 예측 네트워크. 사전학습 세트와 벤치마크 세트 겹침(data leakage) 여부는 원문 확인 필요. 희소 모달리티 처리 방식도 미제공. 🩺 Clinical: in silico 벤치마크 단계. 역사적으로 in silico ADMET 예측 모델의 임상 전환율이 낮다는 점은 이 도구에도 동일하게 적용된다. 🏭 Industry: 히트-투-리드 및 리드 최적화 단계에서 즉시 평가해볼 수 있는 도구다. Isomorphic Labs·Recursion 등 경쟁 분자 파운데이션 모델과 같은 흐름 위에 있으나, 오픈소스·학술 공신력이 차별점이다.
검증 수준: in silico (공개 벤치마크 평가)

Deep Dive

GITIII-scale: 세포가 이웃을 만나는 방식을 학습한다

공간 전사체 파운데이션 모델이 등장한 것은 어제오늘 일이 아니다. scGPT, GeneFormer, HEST-1k 기반 모델들이 줄지어 나왔고, 공통 전략은 단일세포 유전자 발현 패턴을 트랜스포머로 학습하는 것이었다. 그런데 여기에는 한 가지 구조적 공백이 있었다. 세포 하나의 상태는 그 세포 주변을 어떤 세포들이 둘러싸고 있는가에 따라 결정된다. 리간드-수용체 신호(ligand-receptor signaling)가 세포 상태를 규정하는데, 기존 파운데이션 모델은 이 공간적 맥락 — 즉 이웃 세포들과의 상호작용 — 을 제대로 포착하지 못했다.

GITIII-scale은 이 공백을 정면으로 겨냥했다. NLP 방식의 설계 직관—세포를 단어, 이웃 세포군을 문맥으로 취급하는—을 공간 전사체에 그대로 이식했다. 구체적으로는 세 수준으로 쌓인다. 가장 아래 레이어는 CCI 해석 레이어로, 수용 세포의 각 유전자가 발신 세포에 의해 어떻게 영향받는지를 분해 가능한 형태로 표현한다. 중간은 이웃 세포군 전체의 임베딩을 생성하는 니치 임베딩 레이어, 그 위에 팬-암 사전학습이 쌓인다. 특히 1-레이어 그래프 트랜스포머에 feed-forward network를 두지 않은 선택이 눈에 띈다. 해석 가능성을 높이려는 의도적 단순화다.

평가 방식도 중요하다. 이 논문은 훈련 시 보지 않은 암종에서 얼마나 니치 관련 세포 상태 변화를 포착하는지를 기준으로 삼았다. 특정 암종에 맞춰 따로 학습하지 않아도 TME 구조를 표현할 수 있는지 물은 것이다. 초록 기준으로 "기존 공간 전사체 파운데이션 모델 대비 우수"하다고 기술하지만, 비교 대상 모델명과 구체 수치는 원문 방법 섹션에서 직접 확인이 필요하다.

재현성 측면에서 이번 주 다섯 편 중 가장 문이 열려 있다. 코드·체크포인트·사전학습 데이터 모두 GitHub에 공개되어 있고, PyPI 패키지(`gitiii`)도 배포된 것으로 확인된다. 단, 영상 기반 공간 전사체 데이터(MERFISH·Xenium 수준)와 scRNA-seq 매칭 데이터를 직접 보유하지 않은 연구팀이라면 완전한 재현에 상당한 컴퓨팅·데이터 접근 비용이 따를 것이다.

이 논문을 어떻게 쓸 것인가. 면역항암 연구자라면 CCI 해석 레이어를 통해 특정 리간드-수용체 쌍이 어떤 세포 상태 변화를 유도하는지 추적할 수 있다. 코드가 공개된 만큼 scRNA-seq + 공간 전사체 매칭 데이터를 보유한 연구라면 임베딩 추출부터 시작할 수 있다. 임베딩 품질이 면역항암제 반응 예측으로 곧바로 이어지지는 않는다. 이 논문이 남긴 가장 중요한 열린 질문은 하나다: 계산 벤치마크에서 포착된 TME 패턴이 환자 코호트에서 임상 결과와 얼마나 상관하는가.

Mol-JEPA: Boehringer Ingelheim이 공개한 분자 파운데이션 모델의 설계 논리

분자 표현 학습(molecular representation learning)의 오랜 숙제는 다중 모달리티를 어떻게 통합하느냐였다. 구조(2D 그래프)만 쓰는 모델에서 출발해, 세포 표현형 이미지를 더하고, ADMET 측정값을 더하고, 양자화학 계산값까지 더하려는 시도가 반복됐다. 주류는 대조 학습(contrastive learning)이었다. 모달리티 두 쌍을 가져다 표현 공간에서 가깝게 당기는 방식. 그런데 이 접근에는 두 가지 구조적 문제가 있었다. 하나는 모달리티 붕괴(modality collapse) — 어느 한 모달리티가 표현 공간을 지배하면 나머지가 사실상 무시된다. 다른 하나는 화학적으로 부자연스러운 증강(chemically invalid augmentation) — 원자 교란이나 결합 변형이 화학 의미를 파괴한다.

Mol-JEPA는 이 두 문제를 정면 돌파하지 않고 우회한다. LeCun이 제안한 JEPA(Joint Embedding Predictive Architecture) 프레임워크를 분자 도메인에 이식하는 방식이다. 핵심 직관은 이렇다: 픽셀이나 토큰을 직접 재구성하는 대신, 잠재 공간(latent space) 내에서 마스킹된 모달리티의 표현을 예측하도록 학습한다. 검토필요: 14개 모달리티(GitHub README 기준 12개) 중 일부를 마스킹하고, 나머지로부터 마스킹된 모달리티의 잠재 표현을 예측하는 예측 네트워크(predictor)를 학습한다는 것이 모달리티 마스킹(modality masking)의 핵심이다. 화학적으로 무의미한 저수준 노이즈를 암기할 이유가 없으므로 부자연스러운 증강 문제가 원천적으로 사라진다.

평가는 OpenADMET, ASAP-Polaris(COVID 표적 결합 + ADMET), Biogen ADME 세 벤치마크로 이루어졌다. 저데이터(low-data) 설정에서 기존 GNN 기반 모델과 기술자(descriptor) 기반 모델 대비 낮은 MAE를 달성했다고 보고하지만, 구체적 수치는 원문 결과 테이블에서 확인해야 한다.

이 논문에서 가장 먼저 점검해야 할 위험 요인은 데이터 누수(data leakage)다. 약 469만 분자(4.69M)로 사전학습할 때 OpenADMET·Polaris 챌린지의 평가 분자가 포함되어 있다면 성능이 과대평가된다. 이 논문을 인용하기 전, 원문에서 decontamination 처리 여부를 먼저 확인해야 한다.

이 논문을 내 연구에 어떻게 쓸 것인가. 자체 ADMET 측정값이 수십~수백 개 수준의 소규모 데이터셋이라면, Mol-JEPA의 사전학습 임베딩을 출발점으로 파인튜닝하는 전이학습이 가장 빠른 진입 경로다. HuggingFace 통합으로 진입 장벽이 낮다. Boehringer Ingelheim 공식 GitHub에서 코드가 나왔다는 사실이 이 논문의 가장 강한 신호다. 내부 약물 개발 파이프라인에 이 아키텍처를 실제로 통합하려는 방향성이 거기서 읽힌다.

🔭 Wide Angle

연구 수준 생물정보학 과제에서 AI 에이전트의 현주소 — BixBench3

· arXiv:2608.25286 · preprint(미동료심사) · DOI · data

GRPO 대신 진화전략으로 LLM 추론 커버리지를 넓힌다 — Evolution Strategies vs. GRPO

· arXiv:2608.27351 · preprint(미동료심사) · DOI

Threads to Follow

  • GITIII-scale 임상 연결 여부: 팬-암 벤치마크 성능이 실제 환자 코호트에서 면역항암제 반응(ORR)과 상관하는지 추적. 코드 공개 이후 독립 재현 결과가 나오는지 모니터링.
  • mRNA 제조 AI 경쟁 심화: C2와 유사한 접근(대규모 스크리닝 + 딥러닝)이 Moderna·BioNTech 내부 R&D 도구로 빠르게 내재화되는 신호 포착. 코드·데이터 공개 여부가 외부 채택 속도를 결정.
  • Perturb-seq HSPC 후속 연구: 규명된 공동 조절 유전자 프로그램이 혈액암 환자 HSPC에서 정상 HSPC와 어떻게 다른지 비교하는 후속 연구 여부. 기존 AML·MDS 드라이버(FLT3·IDH1/2 등)와의 겹침 확인.
  • Mol-JEPA 데이터 누수 검증: 사전학습 500만 분자 세트와 벤치마크 평가 세트 간 decontamination 처리 여부가 원문에서 어떻게 기술되는지 원문 확인 및 독립 재현 대기.
  • SALRR DOI 충돌 해소: 동일 DOI에 두 논문이 귀속된다는 웹검색 충돌이 bioRxiv 직접 접근으로 해소되는지 확인. 파이프라인 코드 공개 시 뇌 이소폼 연구 커뮤니티 채택 속도 모니터링.

Sources