논문이 내놓은 숫자를 직접 재봤습니다
GPTers 23기 “AI 결과물 검수” 스터디에 참여하고 있습니다. 1주차에 한 일을 정리했습니다. 남이 만든 도구를 그대로 얹고, 그 위에서 남의 논문이 내놓은 숫자를 다시 쟀습니다.
문제
2025년 이후 “AI가 스스로 연구를 한다”는 논문이 쏟아졌습니다. Co-Scientist, The AI Scientist, AI-Researcher 같은 이름들입니다. 제목만 보면 다 같은 이야기 같은데, 열어 보면 하는 일이 다릅니다. 어떤 것은 가설을 만들고, 어떤 것은 코드를 짜고, 어떤 것은 논문 초안을 씁니다.
읽기는 읽는데 머릿속에 안 남았습니다. 한 편을 읽고 다음으로 넘어가면 앞 편이 흐려졌습니다.
특히 한 논문의 문장이 걸렸습니다. “AI가 만든 가설을 전문가 아홉 명이 평가했다”는 대목이었습니다. 그렇다면 그 전문가 자리에 AI를 앉히면 어떻게 되는가. 공개된 데이터로 확인할 수 있는 질문이었습니다.
맨바닥에서 시작하지 않기
이번 작업의 뼈대는 제가 만든 것이 아닙니다. 스터디장이 공개한 research-survey라는 Claude Code 플러그인을 그대로 얹었습니다.
이 도구가 하는 일은 다섯 단계입니다.
관심 주제 → 논문 추출 → 요약 → 삼중 검증 → 인사이트·가설 → 새 논문 추적
눈여겨볼 곳은 세 번째 칸입니다. 삼중 검증은 요약이 원문과 어긋나지 않는지 세 겹으로 확인한다는 뜻입니다. AI가 논문을 요약할 때 가장 흔한 사고가 원문에 없는 내용을 그럴듯하게 지어내는 것인데, 그 자리를 막는 장치입니다.
직접 만들었다면 수집기부터 설계하고, 분류 규칙을 정하고, 근거를 어떻게 추적할지 정하느라 며칠을 썼을 것입니다. 얹었더니 그 시간이 통째로 남았고, 남은 시간을 논문의 주장을 재보는 실험에 썼습니다.
어떻게 했나
네 단계로 진행했습니다.
첫째, 논문을 모았습니다. arXiv에서 관련 논문을 긁어와 두 갈래로 분류했습니다. 갱신 명령을 돌릴 때마다 새 논문이 붙어 25편에서 57편이 됐습니다.
둘째, 핵심 7편을 노트로 옮겼습니다. 원칙을 하나만 걸었습니다. 출처 없는 내용은 한 줄도 넣지 않는다는 것입니다. AI에게 요약을 시키면 매끄러운 문장이 나오는데, 그 문장이 논문에 실제로 있는 말인지 확인하기 어렵습니다. 그래서 페이지 번호와 그림 번호를 반드시 달게 했습니다.
여기서 이후 실험의 기준선이 나왔습니다. 그 논문 부록에 혈액종양내과 전문의 아홉 명이 두 그룹으로 나뉘어 가설 78건을 채점한 기록이 있었고, 두 그룹의 평가가 얼마나 일치하는지가 Spearman ρ = 0.745 (p < 0.001)였습니다.
이 값을 조금 풀어 쓸 필요가 있습니다. 1이면 두 그룹이 등수를 똑같이 매겼다는 뜻이고, 0이면 제각각이라는 뜻입니다. 0.745는 잘 맞는 편이지만 완벽하지 않습니다. 중요한 것은 이 값이 상한선이라는 점입니다. 사람끼리도 0.745밖에 안 맞는 판에서 AI가 그보다 훨씬 높은 값을 낼 수는 없습니다.
다만 개인끼리가 아니라 그룹끼리의 일치도입니다. 그리고 논문을 뒤져도 아홉 명을 어떻게 두 그룹으로 나눴는지, 그룹 안에서 점수를 어떻게 합쳤는지가 안 나옵니다. 평균을 냈다면 개인의 잡음이 상쇄돼 값이 높아지고, 78건을 나눠 봤다면 겹치는 부분에서만 계산했을 텐데 그 개수를 알 수 없습니다. 합치는 방식에 따라 이 값을 상한선으로 쓸 수 있는지가 갈립니다. 그래서 기준선으로는 쓰되 확정된 상한선으로 두지는 않았습니다.
셋째, AI를 심판석에 앉혔습니다. 다섯 기준으로 가설을 채점하게 했습니다. 새로움, 실현 가능성, 구체성, 비자명성, 근거성입니다. 채점 대상은 급성 골수성 백혈병에 쓸 수 있는지 검토된 약 여덟 개였고, 논문에 실린 실제 실험 결과와 대 봤습니다.
| 비교한 것 | n | Spearman ρ | p |
|---|---|---|---|
| AI 채점과 실험값 (두 갈래) | 8 | 0.447 | 0.267 |
| AI 채점과 실험값 (연속 척도) | 11 | 0.642 | 0.033 |
| 전문가 두 그룹 사이 | 78 | 0.745 | < 0.001 |
목표로 잡은 0.70에는 못 미쳤습니다. 다만 0.642는 사람 상한선의 86%입니다.
넷째, 논문이 말한 빈틈을 확인했습니다. 같은 논문이 공개 데이터베이스에 실패한 연구 기록이 거의 없다고 했습니다. 정말 없는지 PLOS와 PubMed를 여섯 갈래로 뒤졌습니다.
| 경로 | 검색식 | 결과 |
|---|---|---|
| PLOS | drug repurposing + negative result |
248편 (원자료) |
| PLOS | 엄밀 필터(약물 재배치 직접) | 약 30편 |
| PubMed | "Negative Results"[pt] AND "Drug Repositioning"[MeSH] |
0건 |
| PubMed | "drug repurposing"[tiab] AND (negative result*) |
68편 |
합치면 엄밀한 실패 논문이 약 50~60편으로 목표 경계를 겨우 넘겼습니다. 채우기는 했는데 쉽게 채운 것이 아닙니다. 여섯 갈래로 나눠 긁어모아야 했고, 표준 분류 항목은 아예 0건이었습니다. 문헌 종류에 “Negative Results”가 정의되어 있는데도 실제로 그 표시를 다는 사람이 거의 없다는 뜻입니다. 논문이 말한 빈틈이 실재한다는 것을 수집 과정 자체가 보여 주었습니다.
배운 것
하나, 다섯 기준 중 일하는 것은 하나였습니다.
채점 기준 자체를 살펴봤습니다. 실제 실험 결과와 관계있는 것이 무엇인지 확인한 것입니다.
| 차원 | r_pb | p | 해석 |
|---|---|---|---|
| 근거성(Grounding) | 0.707 | 0.050 | 유일하게 유의 |
| 구체성(Specificity) | 0.500 | 0.207 | 방향은 맞음 |
| 비자명성(Non-triviality) | 0.302 | 0.468 | 방향은 맞음 |
| 새로움(Novelty) | 0.000 | 1.000 | 변별력 없음 |
| 실현 가능성(Feasibility) | -0.146 | 0.730 | 역방향 |
문헌 근거가 탄탄한 가설이 실험실에서도 효과를 보였습니다. 그리고 실현 가능성은 오히려 반대 방향이었습니다. 시장에서 철수된 약은 실현 가능성 점수가 낮게 매겨지는데, 철수 사유가 약효 부족이 아니라 부작용이나 사업성인 경우가 많아 실험실에서는 잘 듣기도 합니다.
채점표를 다섯 칸으로 나눴는데 판정을 가른 것은 한 칸이었습니다. 나머지 넷은 꼼꼼히 봤다는 느낌은 주지만 결과를 설명하지 않았습니다.
둘, 낮은 숫자를 읽는 법이 따로 있습니다.
표만 보면 결론은 간단합니다. 0.642는 목표에 못 미쳤으니 “AI는 아직 전문가를 대신할 수 없다”가 됩니다.
그런데 실험 설계를 다시 보면 다릅니다. 원논문에서 전문가들은 말이 안 되는 가설을 미리 걸러낸 뒤에 채점을 시작했습니다. 남은 가설은 전부 어느 정도 품질이 보장된 것들이었습니다.
채점 장면으로 옮기면 이렇습니다. 반 전체를 채점하면 1등과 꼴찌가 뚜렷이 갈리니 두 심판의 등수가 잘 맞습니다. 그런데 상위권 열 명만 남겨 놓고 채점하면 실력 차이가 작아 등수가 흔들립니다. 심판이 못해서가 아니라 대상의 폭이 좁아서입니다. 통계에서는 이를 범위 제한이라 부릅니다.
측정값이 낮은 것과 능력이 낮은 것은 다릅니다. 이 구분을 못 하면 숫자를 그대로 결론으로 받게 됩니다.
셋, 남의 도구를 얹으면 질문에 시간을 쓸 수 있습니다.
조사 파이프라인을 직접 만들었다면 이 실험까지 가지 못했을 것입니다. 도구를 만드는 일과 도구로 무엇을 묻는 일은 다르고, 이번에는 뒤쪽이 목적이었습니다.
출발점
이 스터디를 신청할 때는 AI가 만든 결과물을 어떻게 믿을 것인가가 궁금했습니다. 1주차를 지나고 보니 질문이 하나 늘었습니다. 남의 숫자를 재보는 방법을 익혔으면, 내 숫자도 같은 방법으로 재봐야 하지 않을까.
다음
- 원논문 저자에게 부록 전체 데이터를 요청할 계획입니다. 전문가 78건 채점 기록이 있으면 표본 8건짜리 실험을 제대로 다시 돌릴 수 있습니다. 메일 초안까지 써 두었고 아직 보내지 않았습니다.
- 채점 AI를 하나만 쓰지 말고 셋을 독립으로 돌려 서로 얼마나 일치하는지 재 볼 계획입니다. 한 모델의 버릇이 결과를 좌우하지 않는지 확인하려 합니다.
다음 글에서는 이 방법을 제 논문 원고에 적용한 이야기를 씁니다. 근거를 지어내지 말라고 만든 시스템의 논문에서, 근거를 추적할 수 없는 숫자를 27개 찾았습니다.
참고
- Gottweis et al. Accelerating scientific discovery with Co-Scientist, arXiv:2502.18864
- Bisht et al. Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery, arXiv:2605.08956