구글 딥마인드가 2026년 9월 8일 공개한 AlphaGenome Atlas의 실제 활용 범위를 정리했습니다. 90억 개 변이 예측, AVI 점수의 한계, CADD 대비 성능 격차까지 검증된 수치로 확인하세요.
알파지놈 핵심만 먼저 정리하면
지금 시점에서 AlphaGenome Atlas는 연구의 출발점이지 진단 도구가 아닙니다. 구글 딥마인드가 2026년 9월 8일 공개한 이 데이터셋은 인간 유전체의 단일염기변이(SNV) 90억 개 전부에 대해 분자적 효과를 미리 계산해 담았습니다. 총 용량은 1페타바이트로, AlphaFold Database보다 30배 이상 큽니다. 비상업 용도라면 공개 당일부터 웹 포털에서 무료로 쓸 수 있습니다.
다만 규모와 신뢰도는 별개 문제입니다. 딥마인드는 공식 발표문에서 이 정보가 의학적 조언·진단·치료의 대체물이 아니며 어떤 임상 용도로도 검증·승인되지 않았다고 못 박았습니다. Scientific American은 Atlas가 AlphaFold Database보다 크지만 “far less accurate”(훨씬 덜 정확)하다고 평가했고, 독립 분석에서는 기존 무료 도구인 CADD와의 성능 격차가 생각보다 작다는 결과도 나왔습니다. 이 글에서는 발표문의 수치와 독립 검증 결과를 나란히 놓고, 실제로 무엇을 할 수 있고 무엇은 아직 못 하는지 정리합니다.
Q1. AlphaGenome Atlas는 정확히 무엇을 담고 있나요?

한 문장으로 줄이면 “DNA 글자 하나가 바뀌는 모든 경우의 수에 대한 예측 결과 사전”입니다. 인간 유전체는 약 30억 개 염기쌍으로 이뤄져 있고, 각 자리에서 다른 염기로 바뀔 수 있는 경우를 모두 세면 90억 가지가 됩니다. Atlas는 이 90억 개를 전부 미리 계산해뒀습니다.
| 항목 | 공식 발표 수치 | 출처 등급 |
|---|---|---|
| 커버 변이 수(SNV) | 90억 개 | T1 (딥마인드 블로그 2026-09-08) |
| 데이터셋 용량 | 1페타바이트 | T1 |
| AlphaFold DB 대비 크기 | 30배 이상 | T1 |
| 변이당 예측 수 | “thousands”(수천 개) | T1 |
| 반복 DNA 서열 모티프 | 2,500개 이상 | T1 |
| 코딩 / 비코딩 비율 | 2% / 98% | T1 |
| 협력 검증 기관 | 9개 기관 | T1 |
여기서 주의할 점이 하나 있습니다. Fortune은 변이당 평균 예측 수를 약 27,000개로 보도했지만, 공식 블로그는 숫자 대신 “수천 개”까지만 적었습니다. 27,000이라는 값은 T1 자료에서 확인되지 않습니다. Fortune과 winbuzzer는 SNV 외에 관측된 indel 1억 개 이상에도 점수가 매겨졌다고 보도했는데, 공식 블로그에 indel 언급이 없어 이 역시 확인 필요 항목으로 남습니다.
예측 범위는 수백 종의 인간·마우스 세포 타입과 조직을 포괄하며, 유전자 발현·염색질 접근성·스플라이싱 등 여러 분자 수준 지표를 함께 제공합니다.
용어 풀이
1. 단일염기변이(SNV) — DNA 서열에서 염기 하나만 다른 염기로 바뀐 변이를 말한다.
2. 비코딩 영역 — 단백질을 직접 만들지 않는 유전체 구간으로, 인간 유전체의 98%를 차지하며 유전자 발현 조절에 관여한다.
3. indel — 염기가 끼어들거나(insertion) 빠지는(deletion) 형태의 변이를 묶어 부르는 말이다.
Q2. AVI 점수는 병원성 판단에 써도 되나요?

써서는 안 됩니다. 이번 발표에서 오해가 가장 잦은 지점입니다. AVI(AlphaGenome Variant Impact) 점수는 AlphaGenome과 AlphaMissense의 예측을 합쳐 변이 하나당 숫자 하나로 압축한 지표이며, 코딩 2%와 비코딩 98% 양쪽에 모두 적용됩니다. 겉보기에는 “이 변이가 얼마나 위험한가”를 알려주는 값처럼 보입니다.
그런데 독립 분석 블로그 rundatarun은 2026년 9월 10일 분석에서 AVI가 harm의 대리변수로 allele frequency(희귀도)를 학습한다고 지적했습니다. 순위가 병원성 순서가 아니라 예측된 희귀도 순서에 가깝다는 뜻입니다. 희귀한 변이가 해로울 확률이 높은 건 사실이지만, 두 개념은 같지 않습니다. IEEE Spectrum 인터뷰에서 Carl de Boer(UBC)도 AVI 점수가 “easily misinterpreted”될 수 있다고 지적했습니다.
| 비교 항목 | AVI(Atlas) | CADD v1.7 | 차이 |
|---|---|---|---|
| 실측 라벨 홀드아웃 10개 스크린 | 0.668 | 0.647 | 0.021 |
| gnomAD AF 0.001 필터 적용 후 | 74.3% | 61% | 1.2배 |
| ClinVar intronic AUPRC | 0.76 | (GPN-Star-V) 0.44 | 2.4배 계열 |
| 라이선스 | 비상업 무료 / 상업 미공개 | 학술 무료 | — |
표의 마지막에서 두 번째 줄이 핵심입니다. ClinVar 같은 큐레이션 라벨에서는 AVI가 압도적으로 보입니다. 그런데 실측 라벨과 표준 전처리를 거치면 우위가 2.4배에서 1.2배로 줄어듭니다. rundatarun은 그 이유로 ClinVar 벤치마크의 순환성 문제도 함께 지적했습니다. CADD와 SpliceAI는 큐레이터가 변이를 분류할 때 이미 참고하는 도구라, 그 라벨로 만든 테스트에서 이기는 것은 부분적으로 자기참조라는 것입니다. 단, ClinVar synonymous·3′UTR·protein-altering 항목의 세부 AUPRC 수치는 원문 PDF 대조에 실패해 확인 필요 상태로 남겨둡니다.
용어 풀이
1. allele frequency — 인구집단에서 특정 변이가 얼마나 흔하게 나타나는지를 비율로 나타낸 값이다.
2. AUPRC — 정밀도-재현율 곡선 아래 면적으로, 값이 클수록 예측 성능이 좋다고 본다.
3. 홀드아웃 — 모델 학습에 쓰지 않고 따로 떼어둔 데이터로, 성능을 공정하게 측정하는 데 쓴다.
Q3. 기업이나 병원에서도 지금 바로 쓸 수 있나요?

비상업 용도만 가능합니다. 공식 발표문 기준으로 Atlas는 웹 포털에서 발표 당일부터 무료로 열려 있습니다. 반면 상업 용도는 “for commercial use on Google Cloud soon”이라고만 적혀 있고, 2026년 9월 12일 확인 시점에도 가격·계약 형태·출시 시점이 모두 공개되지 않았습니다. 상업 조직 입장에서는 현재 후보군 중 유일하게 비용을 모르는 선택지인 셈입니다.
이 지점이 AlphaFold 때와 달라졌습니다. Scientific American은 AlphaFold Database가 무료였던 것과 달리 제약사 등 상업 이용자는 Atlas를 라이선스해야 한다고 정리했습니다. 다만 혼동하기 쉬운 구분이 하나 있습니다. 기반 모델인 AlphaGenome 자체는 Google Cloud Model Garden에서 이미 상업 배포되고 있습니다. 미리 계산된 Atlas 데이터셋과 기반 모델 AlphaGenome은 접근 경로가 다릅니다.
| 경로 | 용도 | 현재 상태(2026-09-12 기준) |
|---|---|---|
| Atlas 웹 포털 | 비상업 조회 | 무료 이용 가능 |
| AlphaGenome API | 비상업 커스텀 예측 | 무료, 100만 예측 미만 권장 |
| Google Cloud Model Garden | 상업 모델 추론 | 이용 가능 |
| Atlas 데이터셋 상업 라이선스 | 기업 대량 활용 | 미제공(“soon”) |
병원·임상 쪽은 더 분명합니다. 딥마인드가 직접 임상 검증·승인이 없다고 밝혔으니, 진단이나 치료 결정의 근거로 쓸 수 없습니다. Fortune이 보도한 간질 사례에서 변이 재분류에 기여했다는 내용이 임상 승인처럼 읽히기 쉬운데, 연구 맥락의 성과와 규제 승인은 전혀 다른 이야기입니다.
Q4. 기존 CADD·SpliceAI 파이프라인을 갈아엎어야 하나요?

지금 당장은 근거가 약합니다. 특히 이미 gnomAD allele frequency 필터가 들어간 파이프라인을 운영 중이라면 기대 이득이 크게 줄어듭니다. 앞서 본 것처럼 AF 0.001 기준으로 1차 필터링하면 AVI 74.3%, CADD 61%로 격차가 1.2배까지 좁혀지기 때문입니다. 필터링은 임상 파이프라인의 표준 절차라, 실전 조건에서의 실제 이득을 보려면 이 수치를 봐야 합니다.
경쟁 도구별 위치를 정리하면 이렇습니다. GPN-Star는 계통발생 정보와 전체 유전체 정렬을 쓰는 유전체 언어모델로, Atlas 논문의 ClinVar 비교에서 여러 범주의 차선 모델로 등장합니다. 세포 타입별 분자 표현형이 필요 없는 분석이라면 여전히 유효한 대안입니다. SpliceAI와 Pangolin은 스플라이싱 전용인데, AlphaGenome이 스플라이싱과 프로모터 변이에서는 잘 작동한다는 평가가 있는 만큼 이 영역은 비교 검토할 만합니다. AlphaMissense는 미스센스 전용이며 이미 AVI의 구성요소로 흡수됐습니다. 코딩 변이만 본다면 AVI를 새로 도입할 이유가 적습니다.
현실적인 판단 기준을 세 가지로 정리합니다.
- 비코딩 변이 우선순위화가 병목이라면 도입 가치가 있습니다. UK Biobank 참가자 54,000명 이상 데이터에서 예측된 분자 효과로 변이를 묶자 비코딩 유전 연관이 22% 더 발견됐습니다(원수치는 728건 대 595건).
- 이미 AF 필터가 있고 코딩 변이 중심이라면 교체 이득이 작습니다. 0.021이라는 성능 차이로는 파이프라인 재구축 비용을 정당화하기 어렵습니다.
- 상업 조직이라면 가격이 공개될 때까지 판단을 미루는 게 합리적입니다. CADD·SpliceAI·GPN-Star는 학술 라이선스가 무료입니다.
Q5. 놓치기 쉬운 한계와 주의 상황은 무엇인가요?

가장 구조적인 제약은 입력 시야창이 1Mb라는 점입니다. AlphaGenome은 DNA 1Mb 구간을 입력받아 단일염기 해상도로 예측하는데, 유전자를 1Mb 밖에서 조절하는 enhancer는 애초에 모델의 시야 밖입니다. “유전체 전체를 커버한다”는 표현과 실제 문맥 한계 사이에 이 간극이 있습니다. Scientific American과 IEEE Spectrum 모두 이 점을 거듭 지적했습니다.
두 번째는 다수 변이가 얽힌 질환입니다. Atlas는 변이 하나하나의 효과를 독립적으로 계산한 결과물이라, 여러 변이가 함께 작용하는 복합 질환에는 단일 변이 예측이 잘 맞지 않습니다. 딥마인드의 Žiga Avsec도 예측이 후속 연구 방향을 잡을 만큼은 정확하지만 보편적 진실로 취급해서는 안 된다는 취지로 말했습니다(원문 대조를 하지 못해 인용 부호 없이 요약합니다).
세 번째는 해석 층위의 문제입니다. UK Biobank BMI 분석에서 영향도 상위 1% 변이만 골랐을 때 관련 유전 영역 19개를 찾았다는 발표 수치가 있습니다. 특정 필터 조건을 전제한 조건부 결과죠. 필터 조건 없이 인용하면 성능이 과대평가됩니다.
| 오해하기 쉬운 서술 | 실제 확인된 내용 |
|---|---|
| “AlphaFold의 유전체판” | 규모는 30배지만 정확도는 훨씬 낮다는 평가(T2) |
| “모든 변이를 커버” | SNV 90억은 T1 확인, indel 1억은 T1 미확인 |
| “임상에서 쓸 수 있다” | 임상 검증·승인 없음(T1 명시) |
| “지금 기업도 쓸 수 있다” | 상업 라이선스 미제공, 조건 일체 미공개 |
| “AVI가 병원성 점수” | 희귀도 대리학습 기반 랭킹 지표(T2) |
마지막으로 기술 문서의 지위도 확인해둘 필요가 있습니다. 기반 모델 논문은 Avsec 외의 Nature 649(8099):1206-1218(온라인 2026년 1월 28일)로 정식 게재됐습니다. 그러나 Atlas 자체를 다룬 Cheng 외 논문은 bioRxiv 프리프린트로 아직 피어리뷰를 거치지 않았습니다. Atlas 구축에 80배 연산 속도 개선이 필요했다는 IEEE Spectrum 보도도 이 프리프린트 맥락에서 나온 것입니다. AVI 점수의 버전 체계와 갱신 주기, AlphaGenome 모델 버전과 Atlas 스냅샷의 대응 관계 역시 공식 자료에서 확인되지 않았습니다.
정리
AlphaGenome Atlas는 며칠씩 계산해야 했던 변이 효과 예측을 브라우저 조회로 바꿔놨습니다. 접근성의 변화는 분명합니다. 90억 개 SNV, 1페타바이트라는 규모도 실제 수치입니다. 다만 큐레이션 라벨에서의 2.4배 우위가 실측 라벨과 표준 AF 필터를 거치면 1.2배로 줄어든다는 독립 분석 결과는, 기존 도구를 성급히 교체할 이유가 아직 부족하다는 뜻으로 읽는 편이 안전합니다.
실무 기준으로는 세 가지만 기억하면 됩니다. 비코딩 변이 우선순위화, 특히 스플라이싱과 프로모터 근처 변이에 쓰는 것이 현재 가장 안전한 적용 범위입니다. AVI는 병원성 점수가 아니라 희귀도 기반 랭킹 지표로 취급해야 합니다. 그리고 상업 이용은 가격도 시점도 공개되지 않았으므로, 기업이라면 조건이 나올 때까지 기존 파이프라인을 유지하는 것이 합리적입니다.
참고 자료
조사 기준일: 2026년 09월 12일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1
– AlphaGenome Atlas 공식 발표 — https://deepmind.google/blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/ (확인 2026-09-12, WebFetch 2회 대조)
– Google 공식 블로그 — https://blog.google/innovation-and-ai/models-and-research/google-deepmind/alphagenome-atlas/ (확인 2026-09-12)
– AlphaGenome 제품 페이지 — https://deepmind.google/science/alphagenome/ (확인 2026-09-12)
– AlphaGenome 공식 API 문서 — https://www.alphagenomedocs.com/ (확인 2026-09-12)
– AlphaGenome 공식 인용 페이지 — https://www.alphagenomedocs.com/references.html (확인 2026-09-12)
– Avsec 외, Nature 649(8099):1206–1218, DOI 10.1038/s41586-025-10014-0 — https://www.nature.com/articles/s41586-025-10014-0 (페이월, 초록·서지만 확인 2026-09-12)
– Cheng 외, Atlas 프리프린트 PDF — https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/alphagenome-atlas-a-predictive-map-of-every-possible-dna-letter-change-in-the-human-genome/alphagenome-atlas.pdf (본문 대조 실패 — 10MB 초과, 2026-09-12)
– Google Cloud AlphaGenome 문서 — https://docs.cloud.google.com/gemini-enterprise-agent-platform/models/open-models/alphagenome (검색 결과로 확인, 2026-09-12)
Tier 2
– Scientific American — https://www.scientificamerican.com/article/new-google-deepmind-alphagenome-atlas-could-transform-our-understanding-of-genetic-diseases/ (확인 2026-09-12)
– Fortune 2026-09-08 — https://fortune.com/2026/09/08/google-deepmind-ai-predictions-9-billion-mutation-human-genome/ (확인 2026-09-12)
– IEEE Spectrum — https://spectrum.ieee.org/alphagenome-atlas (확인 2026-09-12)
– WinBuzzer 2026-09-09 — https://winbuzzer.com/2026/09/09/google-alphagenome-atlas-nine-billion-dna-substitutions-searchable-xcxwbn/ (확인 2026-09-12)
– News-Medical 2026-09-09 — https://www.news-medical.net/news/20260909/AlphaGenome-Atlas-maps-billions-of-genetic-changes-with-AI.aspx (확인 2026-09-12)
– MarkTechPost 2026-09-08 — https://www.marktechpost.com/2026/09/08/google-deepmind-releases-alphagenome-atlas-with-precomputed-molecular-effect-predictions-and-avi-scores-for-9-billion-human-dna-variants/ (확인 2026-09-12)
– rundatarun.io 독립 분석 2026-09-10 — https://rundatarun.io/p/alphagenome-atlas-and-the-tools-you (확인 2026-09-12, 개인 분석 블로그이므로 T2 하단으로 취급)
– GPN-Star, Nature 2026, DOI 10.1038/s41586-026-11005-5 — https://www.nature.com/articles/s41586-026-11005-5 (서지·초록만 확인 2026-09-12)
– Nature news d41586-026-02835-4 — 페이월 리디렉션, 2026-09-12
– Cell Research 논평 s41422-026-01249-1 — 페이월 리디렉션, 2026-09-12

답글 남기기