4 minute read

🇺🇸 Read this post in English

GPTers 23기 “AI 결과물 검수” 스터디에 참여하고 있습니다. 1주차에 한 일을 정리했습니다. 남이 만든 도구를 그대로 얹고, 그 위에서 남의 논문이 내놓은 숫자를 다시 쟀습니다.

문제

2025년 이후 “AI가 스스로 연구를 한다”는 논문이 쏟아졌습니다. Co-Scientist, The AI Scientist, AI-Researcher 같은 이름들입니다. 제목만 보면 다 같은 이야기 같은데, 열어 보면 하는 일이 다릅니다. 어떤 것은 가설을 만들고, 어떤 것은 코드를 짜고, 어떤 것은 논문 초안을 씁니다.

읽기는 읽는데 머릿속에 안 남았습니다. 한 편을 읽고 다음으로 넘어가면 앞 편이 흐려졌습니다.

특히 한 논문의 문장이 걸렸습니다. “AI가 만든 가설을 전문가 아홉 명이 평가했다”는 대목이었습니다. 그렇다면 그 전문가 자리에 AI를 앉히면 어떻게 되는가. 공개된 데이터로 확인할 수 있는 질문이었습니다.

맨바닥에서 시작하지 않기

이번 작업의 뼈대는 제가 만든 것이 아닙니다. 스터디장이 공개한 research-survey라는 Claude Code 플러그인을 그대로 얹었습니다.

이 도구가 하는 일은 다섯 단계입니다.

관심 주제 → 논문 추출 → 요약 → 삼중 검증 → 인사이트·가설 → 새 논문 추적

눈여겨볼 곳은 세 번째 칸입니다. 삼중 검증은 요약이 원문과 어긋나지 않는지 세 겹으로 확인한다는 뜻입니다. AI가 논문을 요약할 때 가장 흔한 사고가 원문에 없는 내용을 그럴듯하게 지어내는 것인데, 그 자리를 막는 장치입니다.

직접 만들었다면 수집기부터 설계하고, 분류 규칙을 정하고, 근거를 어떻게 추적할지 정하느라 며칠을 썼을 것입니다. 얹었더니 그 시간이 통째로 남았고, 남은 시간을 논문의 주장을 재보는 실험에 썼습니다.

어떻게 했나

네 단계로 진행했습니다.

첫째, 논문을 모았습니다. arXiv에서 관련 논문을 긁어와 두 갈래로 분류했습니다. 갱신 명령을 돌릴 때마다 새 논문이 붙어 25편에서 57편이 됐습니다.

둘째, 핵심 7편을 노트로 옮겼습니다. 원칙을 하나만 걸었습니다. 출처 없는 내용은 한 줄도 넣지 않는다는 것입니다. AI에게 요약을 시키면 매끄러운 문장이 나오는데, 그 문장이 논문에 실제로 있는 말인지 확인하기 어렵습니다. 그래서 페이지 번호와 그림 번호를 반드시 달게 했습니다.

여기서 이후 실험의 기준선이 나왔습니다. 그 논문 부록에 혈액종양내과 전문의 아홉 명이 두 그룹으로 나뉘어 가설 78건을 채점한 기록이 있었고, 두 그룹의 평가가 얼마나 일치하는지가 Spearman ρ = 0.745 (p < 0.001)였습니다.

이 값을 조금 풀어 쓸 필요가 있습니다. 1이면 두 그룹이 등수를 똑같이 매겼다는 뜻이고, 0이면 제각각이라는 뜻입니다. 0.745는 잘 맞는 편이지만 완벽하지 않습니다. 중요한 것은 이 값이 상한선이라는 점입니다. 사람끼리도 0.745밖에 안 맞는 판에서 AI가 그보다 훨씬 높은 값을 낼 수는 없습니다.

다만 개인끼리가 아니라 그룹끼리의 일치도입니다. 그리고 논문을 뒤져도 아홉 명을 어떻게 두 그룹으로 나눴는지, 그룹 안에서 점수를 어떻게 합쳤는지가 안 나옵니다. 평균을 냈다면 개인의 잡음이 상쇄돼 값이 높아지고, 78건을 나눠 봤다면 겹치는 부분에서만 계산했을 텐데 그 개수를 알 수 없습니다. 합치는 방식에 따라 이 값을 상한선으로 쓸 수 있는지가 갈립니다. 그래서 기준선으로는 쓰되 확정된 상한선으로 두지는 않았습니다.

셋째, AI를 심판석에 앉혔습니다. 다섯 기준으로 가설을 채점하게 했습니다. 새로움, 실현 가능성, 구체성, 비자명성, 근거성입니다. 채점 대상은 급성 골수성 백혈병에 쓸 수 있는지 검토된 약 여덟 개였고, 논문에 실린 실제 실험 결과와 대 봤습니다.

비교한 것 n Spearman ρ p
AI 채점과 실험값 (두 갈래) 8 0.447 0.267
AI 채점과 실험값 (연속 척도) 11 0.642 0.033
전문가 두 그룹 사이 78 0.745 < 0.001

목표로 잡은 0.70에는 못 미쳤습니다. 다만 0.642는 사람 상한선의 86%입니다.

넷째, 논문이 말한 빈틈을 확인했습니다. 같은 논문이 공개 데이터베이스에 실패한 연구 기록이 거의 없다고 했습니다. 정말 없는지 PLOS와 PubMed를 여섯 갈래로 뒤졌습니다.

경로 검색식 결과
PLOS drug repurposing + negative result 248편 (원자료)
PLOS 엄밀 필터(약물 재배치 직접) 약 30편
PubMed "Negative Results"[pt] AND "Drug Repositioning"[MeSH] 0건
PubMed "drug repurposing"[tiab] AND (negative result*) 68편

합치면 엄밀한 실패 논문이 약 50~60편으로 목표 경계를 겨우 넘겼습니다. 채우기는 했는데 쉽게 채운 것이 아닙니다. 여섯 갈래로 나눠 긁어모아야 했고, 표준 분류 항목은 아예 0건이었습니다. 문헌 종류에 “Negative Results”가 정의되어 있는데도 실제로 그 표시를 다는 사람이 거의 없다는 뜻입니다. 논문이 말한 빈틈이 실재한다는 것을 수집 과정 자체가 보여 주었습니다.

배운 것

하나, 다섯 기준 중 일하는 것은 하나였습니다.

채점 기준 자체를 살펴봤습니다. 실제 실험 결과와 관계있는 것이 무엇인지 확인한 것입니다.

차원 r_pb p 해석
근거성(Grounding) 0.707 0.050 유일하게 유의
구체성(Specificity) 0.500 0.207 방향은 맞음
비자명성(Non-triviality) 0.302 0.468 방향은 맞음
새로움(Novelty) 0.000 1.000 변별력 없음
실현 가능성(Feasibility) -0.146 0.730 역방향

문헌 근거가 탄탄한 가설이 실험실에서도 효과를 보였습니다. 그리고 실현 가능성은 오히려 반대 방향이었습니다. 시장에서 철수된 약은 실현 가능성 점수가 낮게 매겨지는데, 철수 사유가 약효 부족이 아니라 부작용이나 사업성인 경우가 많아 실험실에서는 잘 듣기도 합니다.

채점표를 다섯 칸으로 나눴는데 판정을 가른 것은 한 칸이었습니다. 나머지 넷은 꼼꼼히 봤다는 느낌은 주지만 결과를 설명하지 않았습니다.

둘, 낮은 숫자를 읽는 법이 따로 있습니다.

표만 보면 결론은 간단합니다. 0.642는 목표에 못 미쳤으니 “AI는 아직 전문가를 대신할 수 없다”가 됩니다.

그런데 실험 설계를 다시 보면 다릅니다. 원논문에서 전문가들은 말이 안 되는 가설을 미리 걸러낸 뒤에 채점을 시작했습니다. 남은 가설은 전부 어느 정도 품질이 보장된 것들이었습니다.

채점 장면으로 옮기면 이렇습니다. 반 전체를 채점하면 1등과 꼴찌가 뚜렷이 갈리니 두 심판의 등수가 잘 맞습니다. 그런데 상위권 열 명만 남겨 놓고 채점하면 실력 차이가 작아 등수가 흔들립니다. 심판이 못해서가 아니라 대상의 폭이 좁아서입니다. 통계에서는 이를 범위 제한이라 부릅니다.

측정값이 낮은 것과 능력이 낮은 것은 다릅니다. 이 구분을 못 하면 숫자를 그대로 결론으로 받게 됩니다.

셋, 남의 도구를 얹으면 질문에 시간을 쓸 수 있습니다.

조사 파이프라인을 직접 만들었다면 이 실험까지 가지 못했을 것입니다. 도구를 만드는 일과 도구로 무엇을 묻는 일은 다르고, 이번에는 뒤쪽이 목적이었습니다.

출발점

이 스터디를 신청할 때는 AI가 만든 결과물을 어떻게 믿을 것인가가 궁금했습니다. 1주차를 지나고 보니 질문이 하나 늘었습니다. 남의 숫자를 재보는 방법을 익혔으면, 내 숫자도 같은 방법으로 재봐야 하지 않을까.

다음

  • 원논문 저자에게 부록 전체 데이터를 요청할 계획입니다. 전문가 78건 채점 기록이 있으면 표본 8건짜리 실험을 제대로 다시 돌릴 수 있습니다. 메일 초안까지 써 두었고 아직 보내지 않았습니다.
  • 채점 AI를 하나만 쓰지 말고 셋을 독립으로 돌려 서로 얼마나 일치하는지 재 볼 계획입니다. 한 모델의 버릇이 결과를 좌우하지 않는지 확인하려 합니다.

다음 글에서는 이 방법을 제 논문 원고에 적용한 이야기를 씁니다. 근거를 지어내지 말라고 만든 시스템의 논문에서, 근거를 추적할 수 없는 숫자를 27개 찾았습니다.


참고

  • Gottweis et al. Accelerating scientific discovery with Co-Scientist, arXiv:2502.18864
  • Bisht et al. Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery, arXiv:2605.08956

Updated: