OpenAI가 2026년 9월 10일 공개한 Codex 항균 분자 탐색 사례를 유전체 스크리닝 구조로 분해했습니다. AMPSphere 86만 개 후보, 아케아 프로테옴 1억 9,330만 조각, APEX 1.1 선별 단계까지 수치로 정리합니다.
Codex항생물질탐색 시작 전 확인할 것

결론부터 말하면 Codex는 항균 분자를 찾아내는 모델이 아니라, 찾는 파이프라인을 굴러가게 만드는 도구입니다. OpenAI가 2026년 9월 10일 자사 뉴스 Applied AI 카테고리에 올린 게시물에서 Codex와 ChatGPT가 맡은 역할은 원문 기준으로 가설 브레인스토밍, 코드 작성과 개선, 데이터셋 처리, 결과 분석, 학문 분야 간 아이디어 연결입니다. 후보 분자를 실제로 골라내는 주체는 펜실베이니아대 세사르 드 라 푸엔테 연구실이 자체 개발한 딥러닝 모델입니다. 게시물이 내세운 “년 단위를 시간 단위로”라는 표현도 후보 분자의 초기 탐색 단계에만 한정된 서술입니다.
이 글은 그 게시물을 출발점 삼아, 유전체에서 항균 후보를 뽑아내는 스크리닝 구조가 실제로 어떤 단계를 밟는지 논문 수치로 분해합니다. 배경 규모부터 짚으면 게시물이 제시한 숫자는 2021년 세균 항균제 내성 연관 사망 약 500만 명, 2050년까지 연간 사망 약 2배 증가 전망, 그리고 신규 항생제 계열이 나오지 않은 기간 50년입니다. 탐색 속도를 높일 유인이 분명한 영역이라는 뜻입니다.
미리 알아둘 전제는 세 가지입니다. 첫째, 이 분야의 “발견”은 카탈로그 등재를 뜻하지 합성과 검증을 마쳤다는 뜻이 아닙니다. 둘째, 활성 판정 기준 농도가 논문마다 다르므로 퍼센트만 비교하면 오독합니다. 셋째, 이 계열 후보 중 임상시험 진입이 확인된 사례는 현재까지 없습니다. 다루지 않는 범위도 밝혀둡니다. 규제 절차, 제형 개발, 특정 균주별 임상 전략은 이 글의 대상이 아닙니다.
용어 풀이
1. 항균 펩타이드(AMP) — 세균 세포막을 직접 무너뜨리는 짧은 아미노산 사슬로, 기존 항생제와 작용 방식이 달라 내성 우회 후보로 주목받는다.
2. MIC(최소억제농도) — 세균 증식을 완전히 막는 데 필요한 최소 약물 농도로, 값이 낮을수록 역가가 높다.
3. 프로테옴 — 한 생물이 가진 단백질 전체 집합으로, 유전체를 단백질 서열로 번역한 결과물이다.
준비물·필요 서류

유전체 스크리닝 파이프라인을 재현하거나 평가하려면 아래 네 층위의 입력이 모두 있어야 합니다. 어느 한 층이 비면 다음 단계로 넘어갈 수 없는 구조입니다.
| 구성 요소 | 실제 사례에서의 규모 | 출처 등급 |
|---|---|---|
| 유전체·메타지놈 원천 데이터 | 메타지놈 63,410건 + 원핵 유전체 87,920건 | T1 (Cell, 2024-07-11) |
| 프로테옴 기반 원천 데이터 | 아케아 프로테옴 233개 | T1 (Nature Microbiology, 2025-08-12) |
| 조각 생성 규칙 | 8–50 아미노산 단위로 절단, 총 1억 9,330만 조각 | T1 (Nature Microbiology, 2025-08-12) |
| 선별 전용 딥러닝 모델 | APEX 1.1 (순위화 담당) | T1 (Nature Microbiology, 2025-08-12) |
| 범용 LLM 보조 도구 | ChatGPT·Codex (코드·전처리·분석) | T1 (OpenAI, 2026-09-10) |
| 습식 실험 인프라 | 펩타이드 합성, MIC 측정, 세포독성·용혈 시험, 생쥐 감염 모델 | T1 (Nature Microbiology, 2025-08-12) |
| 인력 | Machine Biology Group 16명 | T2 (MIT Technology Review, 2026-02-16) |
여기서 가장 자주 생략되는 항목이 마지막 두 줄입니다. 드 라 푸엔테 본인이 OpenAI 게시물에서 AI 예측을 검증하려면 실측 실험이 필수라고 말한 대로, 습식 실험 인프라가 없으면 파이프라인의 출력은 후보 목록에서 멈춥니다. 연구실 규모도 참고 지표입니다. MIT Technology Review가 2026년 2월 16일 보도한 바로는 이 연구실이 100만 건 이상의 유전 레시피 라이브러리를 구축했고 인원은 16명입니다. 다만 이 두 수치는 공식 논문이 아니라 매체 보도이므로 T2로 취급합니다.
도구 비용도 준비물에 들어갑니다. 2026년 9월 15일 확인 기준 Codex 요금제는 Free $0, Go $8, Plus $20, Pro $100부터, Business는 연간 사용자당 $20이며 Enterprise는 별도 협의입니다. API를 직접 호출한다면 GPT-6 Astra 표준가는 100만 토큰당 입력 $10, 출력 $50입니다.
단계별 진행 순서

1단계 — 원천 유전체 확보 (규모 결정 단계)
어떤 생물 집합을 대상으로 삼느냐가 이후 후보 수를 전부 결정합니다. AMPSphere 연구는 메타지놈 63,410건과 원핵 유전체 87,920건을 썼고, 아케아 연구는 프로테옴 233개만으로 시작했습니다. 주의할 점은 입력 규모와 최종 검증 규모가 전혀 비례하지 않는다는 사실입니다. 소요 기간은 데이터 수집 경로에 따라 달라 공개된 표준 수치가 없습니다.
2단계 — 서열 조각화
단백질 서열을 항균 펩타이드 길이 범위로 자릅니다. 아케아 연구는 8–50 아미노산 기준으로 잘라 1억 9,330만 개 조각을 만들었습니다. 이 단계가 계산 부하의 정점이고, 여기서 LLM이 맡는 역할은 판단이 아니라 전처리 코드와 데이터 파이프라인 작성입니다.
3단계 — 전용 모델 순위화
APEX 1.1이 조각 전체를 훑어 활성 가능성 순으로 정렬합니다. 아케아 연구의 선별 기준은 기존 서열과의 유사도 70% 미만, 예측 평균 MIC 80 μmol/L 이하였고, 결과적으로 후보 12,623개가 남았습니다. 1억 9,330만에서 1만 2,623으로, 약 1만 5천분의 1로 좁히는 구간입니다.
4단계 — 합성과 시험관 검증
여기서 규모가 급격히 꺾입니다. 아케아소닌은 80개를 합성해 93%가 시험관 내 활성을 보였고, AMPSphere는 100개를 합성해 79개가 활성, 그중 63개가 병원균을 대상으로 작동했습니다. 단 AMPSphere의 활성 판정 조건은 1–64 μmol/L 범위에서 최소 한 병원균의 증식을 완전 억제한 경우입니다. 이 농도 조건을 빼고 퍼센트만 인용하면 역가를 과대평가하게 됩니다.
5단계 — 독성·안전성 확인
2026년 프리오닌 연구에서는 75개를 합성해 59개가 64 μmol/L 이하, 42개가 16 μmol/L 이하에서 억제를 보였고, 용혈·세포독성이 없는 것은 16개였습니다. 활성 후보의 4분의 1 수준만 이 관문을 통과한 셈입니다. 이 수치는 학회 연구 요약(T2)으로 대조했고 Nature Microbiology 원문은 확인하지 못했습니다.
6단계 — 동물 모델 검증
아케아소닌은 생쥐 피부 농양 모델 4일차에 2–4 log 세균 감소를 보였습니다. 다만 호중구감소 대퇴부 모델에서는 살균이 아니라 정균 수준에 그쳤습니다. 감염 부위와 숙주 면역 상태에 따라 결과가 갈린다는 신호입니다.
7단계 — 이후 절차
OpenAI 게시물 스스로 합성·MIC·세포독성·내성·약동학·동물실험·규제·임상이 그대로 남는다고 명시했습니다. AI가 단축한 구간은 1~3단계이지, 파이프라인 전체가 아닙니다.
용어 풀이
1. 메타지놈 — 특정 환경 시료에 섞여 있는 모든 미생물의 유전체를 배양 없이 통째로 읽어낸 데이터다.
2. 정균과 살균 — 정균은 세균 증식을 멈추게 할 뿐이고, 살균은 실제로 균을 사멸시키는 작용을 말한다.
3. 아케아(고세균) — 세균과 구분되는 제3의 생물 영역으로, 극한 환경에 사는 종이 많아 미탐색 서열 자원으로 주목받는다.
자주 놓치는 부분

첫째, 헤드라인의 “발견”과 실제 검증 규모를 같은 층위로 읽는 오류입니다. AMPSphere가 등재한 비중복 후보 펩타이드는 863,498개인데, 실제로 합성해 시험한 것은 100개입니다. 비율로 따지면 0.012%로, 카탈로그 규모와 검증 규모가 네 자릿수 차이입니다. 후보 수는 계산 자원의 함수이고 검증 수는 실험 예산의 함수라 애초에 같은 축이 아닙니다.
둘째, 적중률 숫자를 서로 비교하는 오류입니다. ApexAmphion 프리프린트는 64억 파라미터 단백질 언어모델에 PPO 강화학습을 결합해 설계 펩타이드 100개 전부가 낮은 MIC를 보였다며 100% 적중률을 보고했고, 99개가 2종 이상에 광범위 활성을 보였다고 밝혔습니다. 다만 이 수치는 자체 기준으로 확인한 100개 한정이며, 2025년 9월 16일 arXiv에 제출된 프리프린트입니다. 2026년 9월 기준 동료심사 게재 여부는 확인되지 않았습니다.
셋째, 모델이 예측한 결합력과 실제 항균 활성을 동일시하는 오류입니다. Frontiers in Bioinformatics가 2026년 7월 24일 정리한 리뷰는 도킹으로 예측한 강한 결합이 전세포 항균활성으로 이어지지 않는다는 점, 현재 모델이 그람음성균 외막 투과와 AcrAB-TolC 유출펌프를 과소반영한다는 점, 전향적 검증이 여전히 제한적이라는 점을 한계로 지목합니다. 같은 리뷰는 유전체 기반 in silico 파이프라인을 7단계로 정리하는데, 마지막 단계가 실험 검증이라는 점도 함께 봐야 합니다.
넷째, 제품 성능 수치를 파이프라인 성능으로 옮겨 읽는 오류입니다. OpenAI가 2026년 9월 4일 GPT-6 Astra를 공개하며 제시한 1.9배 속도 향상은 Mind2Web 기준의 과제 완료 속도이지 코딩 벤치마크가 아닙니다. 9to5Mac 보도에 따르면 Codex의 컨텍스트 간 메모 유지 기능도 발표 시점에는 옵트인 실험 기능이었고 몇 주 뒤 기본값이 될 예정이었습니다.
다섯째, 정보 공백을 추정으로 메우는 오류입니다. OpenAI 게시물에는 Codex가 작성한 코드량, 처리한 데이터 규모, 절감한 시간에 대한 구체적 수치가 하나도 실려 있지 않습니다. ApexOracle 프리프린트(2025년 7월 10일 제출) 역시 병원균 유전체 임베딩과 이산 확산 언어모델을 결합한 구조를 설명하지만 초록에 정량 성능 지표가 없습니다. MIT Technology Review 기사에도 외부 과학자의 비판적 코멘트는 실려 있지 않아, 제3자 검증 관점은 별도로 찾아야 합니다.
체크리스트 정리
- “AI가 항생제를 만들었다”가 아니라 “후보 목록을 좁히는 단계가 빨라졌다”로 읽습니다. 속도 개선 주장은 초기 후보 탐색 구간에만 걸립니다.
- Codex·ChatGPT의 역할과 전용 모델의 역할을 구분합니다. 후보 선별은 APEX 1.1·ApexAmphion 같은 자체 모델이, 코드와 데이터 처리는 범용 LLM이 맡는 분업 구조입니다.
- 활성 퍼센트를 볼 때 판정 농도를 함께 확인합니다. AMPSphere는 1–64 μmol/L, 아케아소닌 선별은 예측 평균 MIC 80 μmol/L 이하 기준입니다.
- 후보 수와 검증 수의 격차를 확인합니다. 863,498개 대 100개, 1억 9,330만 조각 대 80개 합성이 실제 비율입니다.
- 동물 모델 결과는 감염 부위별로 나눠서 봅니다. 피부 농양 2–4 log 감소와 대퇴부 모델 정균 수준은 결론이 다릅니다.
- 프리프린트와 동료심사 논문을 구분해 인용합니다. ApexAmphion·ApexOracle은 2026년 9월 기준 프리프린트 단계이며, 게재 여부는 확인이 필요합니다.
- 도구 비용은 모델별 크레딧 차이를 보고 배분합니다. 2026년 9월 15일 기준 100만 토큰당 입력 크레딧이 Astra 250, Sol 100, Terra 50, Luna 5로 최대 50배 차이가 나므로, 대량 전처리는 저가 모델로 분리하는 편이 유리합니다.
참고 자료
조사 기준일: 2026년 09월 15일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1
– OpenAI, “How a researcher uses Codex and ChatGPT to search for new antimicrobial molecules” — https://openai.com/index/using-codex-chatgpt-to-search-for-new-antimicrobials/ (직접 접근 403, r.jina.ai 프록시로 전문 대조 / 날짜는 https://openai.com/news/ 로 교차 확인) · 확인일 2026-09-15
– OpenAI, “GPT-6 Astra: A new generation of intelligence” — https://openai.com/index/gpt-6-astra/ (프록시 경유) · 확인일 2026-09-15
– OpenAI Codex 요금 문서 — https://learn.chatgpt.com/docs/pricing (developers.openai.com/codex/pricing 에서 308 리디렉션) · 확인일 2026-09-15
– Santos-Júnior et al., “Discovery of antimicrobial peptides in the global microbiome with machine learning”, Cell, 2024-07-11 — https://www.cell.com/cell/fulltext/S0092-8674(2400522-1 (프록시 경유 초록 대조) · 확인일 2026-09-15
– “Deep learning reveals antibiotics in the archaeal proteome”, Nature Microbiology, 2025-08-12 — https://pmc.ncbi.nlm.nih.gov/articles/PMC12408343/ (nature.com 본문은 인증 리디렉션) · 확인일 2026-09-15
– Cao et al., “A deep reinforcement learning platform for antibiotic discovery”, arXiv:2509.18153 — https://arxiv.org/abs/2509.18153 · 확인일 2026-09-15
– Leng et al., “Predicting and generating antibiotics against future pathogens with ApexOracle”, arXiv:2507.07862 — https://arxiv.org/abs/2507.07862 · 확인일 2026-09-15
– MIT News, “Using generative AI, researchers design compounds that can kill drug-resistant bacteria”, 2025-08-14 — https://news.mit.edu/2025/using-generative-ai-researchers-design-compounds-kill-drug-resistant-bacteria-0814 · 확인일 2026-09-15
Tier 2
– MIT Technology Review, “The scientist using AI to hunt for antibiotics just about everywhere”, 2026-02-16 — https://www.technologyreview.com/2026/02/16/1132516/cesar-de-la-fuente-using-ai-antibiotics-hunt/ · 확인일 2026-09-15
– Frontiers in Bioinformatics, “In silico drug discovery pipelines targeting antibiotic resistance: from genomes to leads”, 2026-07-24 — https://www.frontiersin.org/journals/bioinformatics/articles/10.3389/fbinf.2026.1839606/full · 확인일 2026-09-15
– Nature Reviews Drug Discovery, “Machine learning identifies AMPs”, 2024-06-27 — https://www.nature.com/articles/d41573-024-00111-6 (프록시 경유) · 확인일 2026-09-15
– American Peptide Society, “Prions Fight Back” (Nature Microbiology 2026 논문 요약) — https://www.americanpeptidesociety.org/research/prions-fight-back/ · 확인일 2026-09-15
– 9to5Mac, “OpenAI releasing major upgrade to ChatGPT and Codex with GPT-6 Astra”, 2026-09-04 — https://9to5mac.com/2026/09/04/openai-releasing-major-upgrade-to-chatgpt-and-codex-with-gpt-6-astra-details-here/ · 확인일 2026-09-15

답글 남기기