생성형 AI 신약개발의 도달점과 신뢰 범위
BRIC View에 「생성형 AI의 바이오·신약개발 혁신 동향」 리포트를 공개했습니다. 이 글에서는 그 리포트를 배경지식 없이도 읽을 수 있게 옮겼습니다. 리포트를 관통한 질문은 하나였습니다. 생성형 AI가 바이오를 바꾸고 있다는데, 그래서 그 결과를 어디까지 믿을 수 있나.
답은 단계마다 다릅니다. 단백질 설계는 실험으로 확인된 자리까지 왔고, 화합물은 임상 문턱에 서 있으며, 유전체 수준의 설계는 아직 계산 안에 머물러 있습니다. 아래에서 그 차이를 하나씩 짚어 보겠습니다.
신약 하나가 나오는 과정
새 약을 하나 만들려면 후보 물질을 수만 개 단위로 훑어 그중 하나를 골라내고, 동물과 사람에게 차례로 시험합니다. 여기에 십수 년과 조 단위의 비용이 듭니다. 그런데도 사람에게 처음 투여하는 단계까지 온 후보 중 실제로 약이 되는 것은 열에 하나 남짓입니다.
그래서 오래된 질문이 하나 있습니다. 후보를 더 빨리, 더 잘 고를 수는 없을까.
생성형 AI가 맡은 자리
챗GPT가 문장을 만들어 내듯, 같은 원리의 모델이 단백질과 화합물을 만들어 냅니다. 기존 AI가 “이 물질이 독성이 있을까”를 맞히는 쪽이었다면, 생성형 AI는 “이런 성질을 가진 물질을 새로 그려 줘”에 답합니다. 찾는 일에서 설계하는 일로 옮겨 갔습니다.
여기에는 재료가 필요합니다. 단백질 서열을 모은 UniProt에는 2억 2,700만 개가 넘는 서열이, AlphaFold 구조 데이터베이스에는 2억 1,400만 개가 넘는 예측 구조가 쌓여 있습니다. 생체활성 데이터를 모은 ChEMBL에는 측정값이 2,030만 건 넘게 있습니다. 이렇게 공개된 자료가 학습에 쓰입니다.
실험으로 확인된 단백질 설계
가장 뚜렷한 성과는 단백질 설계에서 나왔습니다. RFdiffusion이라는 모델은 원하는 표적에 달라붙는 단백질을 처음부터 설계합니다. 설계에 그치지 않고 실제로 만들어 현미경으로 구조를 확인했고, 설계한 모양과 실측한 모양이 주쇄 원자 기준 0.63 Å 차이로 맞았습니다. 원자 하나의 크기가 대략 1 Å이니, 오차가 그보다 작았습니다.
다만 성공률은 약 19%였습니다. 다섯 개를 설계하면 하나가 되는 정도이지만, 기존 방법보다는 크게 올랐습니다. 2024년 노벨 화학상도 단백질 구조 예측과 계산 설계에 돌아갔습니다.
뒤로 갈수록 좁아지는 깔때기
컴퓨터 안에서는 후보를 싸게, 많이 만들어 낼 수 있습니다. 그런데 실험실과 임상시험을 지날수록 통과하는 수는 급격히 줄어들고, 요구되는 근거는 강해집니다.
숫자가 이 모양을 그대로 보여 줍니다. AI가 발굴한 신약은 안전성을 주로 보는 임상 1상에서 24건 중 21건, 약 88%가 다음 단계로 갔습니다. 업계 평균 40~65%를 크게 웃돕니다. 그런데 약이 실제로 듣는지를 가리는 2상에서는 10건 중 4건, 40%에 그쳐 업계 평균을 넘지 못했습니다.
가장 앞선 사례도 같은 자리에 있습니다. 폐가 굳는 병인 특발성 폐섬유증을 겨냥한 TNIK 저해제 렌토서팁은 환자 71명을 대상으로 한 2a상에서 1차 목표인 안전성을 확인했고, 2026년 7월 3상에 들어갔습니다. 효능은 2차 지표에서 개선 경향을 보이는 데 그쳤고, 군당 인원도 18명 정도로 적었습니다. 확증은 아직 남아 있습니다.
성적표가 부풀려지는 경로
모델의 성적표 자체를 의심해야 할 때도 있습니다. 연습문제가 시험에 그대로 출제되면 점수가 잘 나오는데, 같은 일이 데이터에서도 일어납니다. 학습에 쓴 자료가 평가에도 섞여 들어가는 데이터 누수입니다.
이 문제는 17개 분야 최소 294편의 논문에서 확인되었고 8가지 유형으로 정리되어 있습니다. 누수가 끼면 벤치마크 점수는 높게 나오지만 다른 곳에서 다시 재면 재현되지 않습니다. 며칠 전 ADMET 예측 모델로 직접 재본 글에서 다룬 문제이기도 합니다.
능력과 함께 커지는 위험
생성 능력이 늘어나면 오용 가능성도 함께 커집니다. 신약개발에 쓰던 생성 모델의 목표를 독성을 피하는 쪽에서 찾는 쪽으로 뒤집자, 6시간이 안 되어 약 4만 개의 독성 분자가 설계되었다고 보고되었습니다. 실제로 합성하거나 확인하지는 않은 계산 결과입니다.
반대 방향의 사례도 있습니다. 유전체 생성 모델 Evo 2는 사람 같은 진핵생물을 감염시키는 바이러스 유전체를 학습에서 일부러 빼 두어, 위험한 서열을 만들지 못하도록 설계 단계에서 미리 막았습니다.
제도의 정비 현황
규제도 따라오고 있습니다. 미국 FDA는 AI가 만든 데이터를 규제 판단에 쓸 때 신뢰할 만한지 가늠하는 평가 틀을 초안으로 냈습니다. EU는 AI Act로 고위험 AI가 지킬 의무를 정했고, 주요 조항의 적용 시점은 2027년 12월과 2028년 8월로 미뤘습니다. 미국 특허청은 AI가 발명자가 될 수 없고 사람의 상당한 기여가 있어야 특허 대상이라고 정리했습니다. 국내에서는 식약처가 2026년 6월 거대언어모델 기반 디지털의료기기 가이드라인을 내면서 위해요인 일곱 가지와 검증 지표를 붙였습니다.
다만 생성형 모델이 만들어 낸 근거를 신약 심사에서 어떻게 평가할지는 아직 별도 기준이 없습니다.
출발점
지난봄 BRIC View에 바이오 빅데이터가 어떻게 모이고 확장되는지를 다룬 리포트를 썼습니다. 데이터를 쌓는 이야기를 정리하고 나니 다음 질문이 자연스럽게 남았습니다. 그래서 그 데이터로 무엇을 만들어 내고 있나.
찾아보니 기술과 사례를 훑는 자료는 이미 충분히 많았습니다. 반면 각 단계에서 확보된 근거가 어느 수준인지 갈라 본 자료는 비어 있었습니다. 그래서 다루는 범위를 넓히는 대신 질문 하나를 두고 따라갔습니다.
리포트 전문
리포트 전문은 BRIC View에서 읽으실 수 있습니다.
이 글에 적은 수치는 모두 리포트 본문에서 가져왔고, 원출처는 참고문헌에 정리해 두었습니다.
다음
리포트를 쓰며 어느 주장에 어느 수준의 근거가 붙어 있는지 가르는 데 시간이 가장 많이 들었습니다. 같은 작업을 저도 해 보고 싶어 ADMET 예측 모델의 분할 방식을 직접 재봤고, 그 결과는 따로 정리해 두었습니다. 다음에는 과제와 모델을 늘려 선행 연구와 어긋난 부분의 원인을 가려 보려고 합니다.
리포트를 관통한 문장은 이렇게 남겼습니다. 생성형 AI 시대 바이오의 경쟁력은 무엇을 얼마나 빨리 만들어 내는가보다, 만들어 낸 것을 얼마나 신뢰할 수 있게 입증하는가에 달려 있습니다.