paper-radar 주간 다이제스트
2026-W31
바이오인포·임상ML·신약AI 논문 주간 요약. 모든 해석은 preprint 단계에서의 분석임.
이번 주 논문들이 공유하는 구조는 하나다. 생물학 데이터의 고유한 복잡성—긴 DNA 서열, 비정규 펩타이드 잔기, 다중 세포 반응 모달리티, 분석 선택 민감성, 시간적으로 이질적인 임상 기록—을 정면으로 다루는 전용 아키텍처들이 한 주에 집중됐다.
CENO는 Mamba·Attention·MoE 하이브리드와 다중 종 MSA 후처리로 긴 DNA를 이해하는 게놈 스케일 세계 모델을 열었다. Vilya-2는 공진화 통계 기반 구조 예측이 닿지 못했던 비정규 잔기와 거대고리화 펩타이드의 계면 모델링을 확산 트랜스포머로 돌파했다. PMRD는 화학 구조·유전자 발현·세포 형태 세 모달리티에서 기전 신호를 노이즈와 분리하는 도메인 분리 프레임워크를 KDD 2026에 발표한다. SCTA는 scRNA-seq 표적 발굴의 재현성 문제를 에이전트 역할 전문화와 교차 실행 안정성 기준으로 풀었다. 다중모달 EHR 파운데이션 모델은 구조화 이벤트 코드에 ECG·흉부 X선·임상 노트를 게이트 교차 어텐션으로 붙여 자기회귀 EHR 모델의 입력 경계를 확장했다.
게놈에서 분자 계면, 세포 반응, 임상 기록까지—각 레이어의 고유 문제를 맞춤 설계로 푸는 논문들이 이번 주 시야를 채운다.
저자: Mingqian Ma, Yucheng Wu, Xin Chen, Feifei Jiang, Peijun Lin, Dongxin Ye, Yidi Sun, Yijing Zhang, Tianqiong Shi, Yu Zhao, Wanli Ouyang, Bowen Zhou, Lei Bai, Yuchen Ren | Shanghai Artificial Intelligence Laboratory
저자: Pascal Sturmfels, Naozumi Hiranuma, Milad Salem, Benjamin D. Sellers, Stephen Rettie, CJ San Felipe, Chase A. P. Wood, Jeffrey K. Holden, Adam P. Moyer, Patrick J. Salveson, Ivan Anishchanka | Vilya Research
저자: Jintao Huang, Lu Leng, Ziyuan Yang | 소속 기관 미확인
저자: Shuyu Chen, Chen Zhu, Ye Zhang, Yang Li, Qiqi Xie, Haohan Wang | 소속 기관 미확인
저자: Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal | Imperial College London
이번 주 가장 주목할 두 논문은 분자 생물학의 서로 다른 레이어에서 기존 방법이 손대지 못한 영역을 직접 공략한다.
CENO의 도전 — DNA 언어 모델은 Evo, Nucleotide Transformer 등 이미 수십억 파라미터 규모로 발전했지만, 긴 게놈 서열 이해·VEP·조절 서열 생성을 하나의 자기회귀 모델로 통합하는 시도는 드물었다. CENO는 Mamba의 선형 복잡도가 긴 DNA를 처리하는 문제를 다루고, MoE가 태스크별 전문화를 지원하는 이중 구조를 취한다. 그리고 다중 종 MSA 사후 훈련이 단일 종 훈련보다 진화적 제약이 약한 비코딩 조절 영역의 기능적 시그널을 강화한다는 가설 위에 설계됐다.
이 설계가 유효하다면, CENO는 희귀 유전 변이 해석과 맞춤 조절 서열 설계라는 두 병목을 동시에 건드린다. 특히 유전자 요법의 페이로드 설계나 CRISPRi 표적 선정에서 규제 서열 생성 능력이 요구되는 상황과 직접 연결된다(해석: 원문 밖 적용 추론). 코드 전체 공개는 이 가설을 직접 검증할 수 있는 기반을 제공한다.
Vilya-2의 도전 — AlphaFold2/3 기반 공동-폴딩 모델들이 표준 단백질-단백질, 단백질-소분자 계면에서 성과를 거두는 동안, 비정규 잔기·거대고리·이황화 결합 스테이플을 포함하는 펩타이드 치료제의 수용체 계면은 독특한 화학적 복잡성 때문에 동일 파이프라인으로 처리하기 어려웠다. Vilya-2의 전원자 표현은 FASTA 시퀀스로 표현할 수 없는 비정규 화학을 그래프/좌표 수준에서 직접 모델링한다.
59.1% sub-2Å 회복률이라는 수치 자체보다 중요한 것은, 이 모델이 훈련에서 보지 못한 거대고리와 미니단백질까지 일반화된다고 주장한다는 점이다. 이 일반화 주장이 독립 재현으로 확인된다면, 비정규 펩타이드 SBDD(structure-based drug design) 워크플로가 실질적으로 열린다(추정: Riptides 벤치마크 독립 재현 후 확인 필요).
두 논문 모두 공개 코드나 벤치마크를 제공한다는 점에서 커뮤니티 검증 경로가 열려 있다. 성능 수치가 구체적으로 명시된 정도는 Vilya-2(59.1% sub-2Å)가 CENO보다 높다. 두 연구 모두 독립 재현 전까지는 주장의 크기를 잠정적으로 유지해야 한다.
W1. Q-Steer: 분자 정책 최적화를 위한 행동-가치 유도 preprint
arXiv:2607.26391 · 2026-07-29. SMILES 분자 최적화의 지연 피드백 문제를 오프라인 PAVS-Q로 해결. 파인튜닝 없이 기존 분자 LM에 래핑 가능한 추론-시점 조향 방식. 2개 백본 × 4개 옵티마이저 8가지 조합에서 일관된 개선 보고(초록 기준; +0.033~+0.049 매크로 평균은 arXiv 검색 요약 기준, 원문 직접 확인 권장). PMO23 벤치마크 활용. in silico.
W2. 딥러닝이 단일세포 클러스터링에 도움이 되는 조건은? preprint
arXiv:2607.25288 · ISRSD 2026 채택 · 2026-07-28. 9개 파이프라인 × 10개 데이터셋(세포 수 90~5,685개, 유전자 수 19,046~41,480개, 세포 유형 4~11종)에서 Sobol 전체차수 민감도 분석·TOST 등가성 검정 조합으로 딥 표현 학습이 PCA를 유의미하게 상회하는 조건을 처음 정량화. 세포 수 상한 5,685개로 대용량 아틀라스 규모는 포함하지 않는다. in silico.
W3. FEV 프레임워크: 기능·증거·검증을 통한 에이전트 바이오인포매틱스 평가 preprint
arXiv:2607.27556 · 2026-07-30. 에이전트 바이오인포매틱스 109개 시스템·28개 벤치마크 포괄 리뷰. Function·Evidence·Validation 3축으로 LLM 에이전트의 과학적 신뢰성 평가 프레임워크 제시. 워크플로 아키텍처나 최종 출력 대신 검사 가능한 궤적을 분석 단위로 삼는다. 리뷰 논문.