하루인포팁

생활·건강·지원금·IT까지, 하루에 필요한 정보를 한 번에

Devin 자체검증 테스트 자동화, GPT-6 Astra로 어디까지 되나

Devin 자체검증 테스트 자동화, GPT-6 Astra로 어디까지 되나

작성자

카테고리:

약 18분 소요

Devin이 GPT-6 Astra로 자기 코드를 직접 테스트하는 구조를 공식 문서와 독립 측정으로 대조했습니다. 테스트 모드 4단계 절차, 1/5 청구, Astra 가격 $10/$50, 그리고 “완전 자동”이 아직 아닌 지점까지 정리했습니다.

Devin자체검증 시작 전 확인할 것

Devin자체검증 시작 전 확인할 것

Devin 자체검증은 “에이전트가 코드를 짜고 스스로 화면을 눌러 확인한 뒤 영상을 남기는” 흐름입니다. 다만 2026년 9월 15일 기준 PR 생성 이후 테스트 실행은 아직 완전 자동이 아닙니다. Devin 공식 문서도 PR 생성 후 버튼 클릭 없이 테스트를 자동 실행하는 설정을 “coming soon”으로 적어 뒀습니다. 이 글에서는 Devin 테스팅 모드의 실제 절차, 그리고 GPT-6 Astra·SWE-2·Fusion 중 어떤 모델 구성을 붙일지 가르는 기준을 다룹니다. Devin 요금제 계약 조건이나 엔터프라이즈 도입 협상은 범위 밖입니다.

전제로 알아둘 사실이 셋 있습니다. 첫째, Devin 2.2는 2026년 2월 24일 발표됐습니다. 자체 Linux 데스크톱에 접근해 웹앱뿐 아니라 데스크톱 앱까지 실행하고 테스트한다고 Cognition이 밝혔습니다. 같은 글은 Devin이 코드를 넘기는 데서 끝나지 않고 계획·작성·자기 출력 검토·문제 포착·수정까지 맡는다고 서술합니다. 둘째, 자체검증의 규모는 실제로 커졌습니다. Cognition은 2026년 5월 29일 글에서 최근 두 달 동안 Devin에서 하루에 승인되는 테스트 실행이 두 배 넘게 늘었다고 밝혔습니다. 셋째, 테스트 모드는 일반 사용 비용의 1/5로 청구 중이라고 같은 글이 밝혔습니다. 다만 이 청구 조건이 2026년 9월 15일 현재도 그대로인지는 공식 문서에서 확인하지 못했습니다(확인 필요).

가장 중요한 전제는 기대치 조정입니다. Devin 문서는 녹화가 주요 엔드투엔드 흐름 하나를 보는 빠른 점검(quick sanity check)으로 설계됐다고 밝힙니다. 영상은 회귀 테스트를 대체하는 증거가 아니라, 핵심 경로 한 줄기가 살아 있는지 보는 장치입니다. 이 구분을 놓치면 CI 파이프라인을 영상 몇 개로 대체하려다 통과 판정만 쌓이게 됩니다.

용어 풀이
1. 엔드투엔드 테스트 — 사용자가 실제로 밟는 경로를 처음부터 끝까지 그대로 실행해 보는 검증 방식.
2. 회귀 테스트 — 새 코드가 기존에 잘 돌던 기능을 망가뜨리지 않았는지 반복 확인하는 테스트.
3. 컨텍스트 윈도우 — 모델이 한 번에 읽고 기억하는 입력 분량의 한계치.


준비물·필요 서류

준비물·필요 서류

Devin 자체검증을 붙이려면 실행 환경·모델 선택·비용 한도 세 축을 먼저 정해야 합니다. 특히 운영체제 제약은 사후에 바꾸기 가장 어려운 항목입니다. Devin 문서상 Computer Use는 Linux(기본)·Windows 세션과 Outposts 머신에서 동작하며, macOS는 Devin Cloud에서 제공되지 않습니다. macOS 데스크톱 앱을 검증 대상으로 잡았다면 Outposts 구성부터 확보해야 합니다.

준비 항목 확인해야 할 값 출처·기준일
실행 OS Linux(기본)·Windows·Outposts. Cloud에서 macOS 불가 Devin Docs, 2026-09-15 확인
테스트 진입 시점 PR 생성 후 테스팅 모드 진입 Devin Docs, 2026-09-15 확인
절차 단계 수 환경 설정 → 테스트 계획 → 영상 녹화 → 결과 전송 4단계 Devin Docs, 2026-09-15 확인
테스트 모드 청구 일반 사용 비용의 1/5 (2026-05-29 발표 기준, 현재 유효성 확인 필요) Cognition, 2026-05-29
무료 크레딧 신규 사용자 $10 Cognition, 2026-02-24

모델 쪽 사양은 아래와 같습니다. 개발자 트랙이라면 컨텍스트와 출력 한도를 파이프라인 설계 전에 고정해 두는 편이 낫습니다.

GPT-6 Astra 사양 값 (2026-09-15 확인)
모델 ID
컨텍스트 윈도우 1,050,000 토큰
최대 출력 128,000 토큰
지식 컷오프 2026-04-30
입출력 형식 입력 text·image / 출력 text
가격(100만 토큰) 입력 $10 / 캐시 입력 $1 / 출력 $50 / 캐시 쓰기 $12.50

배치 할인율과 Fast 모드 요금 배수는 공식 가격표 원문에서 확인하지 못했습니다(확인 필요 — T1 미확인). 미확인 할인율을 전제로 월 비용을 계산하면 실제 청구와 어긋납니다. 초기 산정은 위 표의 확인된 단가만으로 하는 편이 안전합니다.


단계별 진행 순서

단계별 진행 순서

1단계 — 실행 환경 결정 (소요: 반나절~1일). 검증 대상이 웹앱이면 Linux 기본 세션으로 충분합니다. 데스크톱 앱이면 Windows 세션이나 Outposts를 고르고, macOS 대상이면 Cloud로는 불가하므로 Outposts 확보가 선행 조건입니다. 주의할 점은 이 단계를 건너뛰고 PR부터 만드는 경우입니다. 환경이 맞지 않으면 테스팅 모드에 들어가도 앱 자체가 뜨지 않습니다.

2단계 — PR 생성 후 테스팅 모드 진입 (소요: 수 분). Devin 테스팅 모드는 PR이 만들어진 뒤에 시작하는 구조입니다. 여기서 버튼 클릭 없는 완전 자동 실행은 2026년 9월 15일 기준 “coming soon”이므로, 지금은 사람이 실행을 트리거하는 단계가 남아 있다고 보고 워크플로를 설계해야 합니다. “자율 자체검증”이라는 표현을 무인 운영으로 해석하면 여기서 어긋납니다.

3단계 — 테스트 계획 검토 (소요: 10~30분). 문서상 절차는 환경 설정 → 테스트 계획 → 영상 녹화 → 결과 전송의 4단계입니다. 계획 단계에서 어떤 흐름을 볼지 사람이 좁혀 주는 일이 성패를 가릅니다. 독립 리뷰 한 건에 따르면 Devin의 버그 수정 성공률은 재현 단계가 명확할 때 78%, 설명이 모호하면 35%로 갈렸습니다(실제 프로젝트 5개 대상, 2026-03-03 게시. 테스트 시점과 Devin 버전은 글에 명시되지 않았습니다). 지시 품질이 두 배 이상의 차이를 만든다는 뜻입니다.

4단계 — 모델 구성 선택 (소요: 1일 내외 벤치 검토). 화면을 조작해 증거를 남기는 검증이 핵심이면 Astra가 유리합니다. 제3자 집계 기준 Astra는 OSWorld 2.0 72.6%(Sol 65.7%), ScreenSpot-Pro 92.7%(Sol 76.9%), AutomationBench 41.4%(Fable 5.1 31.4%, Sol 18.1%)로 보고됐습니다. 같은 집계에서 OSWorld 2.0 태스크당 소요 시간은 약 40분 대 75분으로 47% 짧아졌습니다. 반대로 같은 파이프라인을 대량 반복해 비용이 지배적이라면 SWE-2가 후보입니다. SWE-2는 2026년 9월 10일 공개됐고 FrontierCode 1.1 Main 50.0%, DeepSWE 1.1 73.0%이며 GPT-6 Astra 비용의 약 1/4이라고 Cognition이 밝혔습니다.

5단계 — Fusion 적용 여부 판단 (소요: 반일). Cognition은 2026년 9월 11일 Fusion을 발표하며 lead 모델 + 저비용 sidekick 조합을 제시했고, 권장 조합은 Fable 5.1 + SWE-2, 대안으로 GPT-6 Astra + SWE-2를 들었습니다. 같은 글은 Fusion이 Fable 5.1 대비 36%, Astra 대비 39% 저비용이라고 밝혔습니다. 다만 이 수치의 근거는 Artificial Analysis Coding Agent Index v1.5(Fable 5.1 61.7·$7.90, Astra 58.9·$4.54)입니다. Artificial Analysis가 2026년 9월 9일 Codex harness로 측정한 Astra 값은 62입니다. 인덱스 버전과 harness가 달라 두 숫자를 나란히 놓고 비교하면 안 됩니다.

6단계 — 비용·정확도 기준선 고정 (소요: 1주 파일럿). 파일럿에서 기록할 값은 태스크당 토큰과 통과 판정의 신뢰도입니다. Artificial Analysis 측정에서 max effort 기준 Astra는 태스크당 출력 27k 토큰, Fable 5.1(max with fallback)은 78k 토큰으로 같은 점수를 냈습니다. Intelligence Index 수행 비용은 Astra $3.26, Fable 5.1 $7.63이며 두 모델의 Index는 53으로 동률이었습니다. 토큰 효율과 단가가 실익의 대부분이고 점수 이득은 크지 않다는 뜻입니다.


자주 놓치는 부분

자주 놓치는 부분

첫째, 발표 문구의 조건을 빼고 읽는 실수입니다. ARC-AGI-3 99.9%라는 수치는 OpenAI 자체 Provider Adapter harness에서 $19K를 써서 나온 값이고, 기본 ARC-AGI harness에서는 62.7%·$26K였습니다. 같은 모델이라도 실행 환경이 점수를 크게 바꿉니다. 종합 지능 역시 Artificial Analysis 2026년 9월 9일 측정에서 Astra(max)와 Fable 5.1이 Intelligence Index 53으로 동률이었습니다.

둘째, 세대 도약 서사를 그대로 옮기는 것입니다. 반올림 전 Intelligence Index는 Astra 61.2, Sol 60.9로 사실상 붙어 있다는 지적이 나왔습니다(2026-09-04). 반올림하면 둘 다 61입니다. 벤치마크를 인용할 때는 harness와 인덱스 버전을 반드시 병기해야 같은 오독을 피합니다.

셋째, 접근 가능 시점을 발표일로 착각하는 것입니다. GPT-6 Astra는 2026년 9월 3일 발표됐지만 초기 접근은 OpenAI Daybreak 보안 프로그램 소속 조직으로 한정됐고, OpenAI는 유료 플랜에서 Astra를 쓰지 못한 날마다 리셋 1회를 적립해 주겠다고 공지한 것으로 보도됐습니다. 2026년 9월 13일 기준으로도 계정별 편차가 남아 있다는 보도가 있었습니다.

넷째, 영상 증거를 품질 지표로 오인하는 것입니다. 앞서 적었듯 Devin 문서는 녹화를 주요 흐름 하나에 대한 빠른 점검으로 설명합니다. 더 큰 문제는 통과 판정을 냈으나 실제로는 결함이 있는 false-pass율인데, 이 수치는 Cognition 공식 자료에도 제3자 정리에도 제시되지 않았습니다(미확인). OpenAI의 Cognition 고객 사례 글에도 리뷰 감소량·배포 증가량·false-pass율 수치가 제시되지 않았다는 제3자 정리가 있습니다. 수치가 없는 영역은 낙관도 비관도 근거가 없다는 것이 현재 상태입니다.

다섯째, 자기 리뷰를 여러 번 돌리면 더 정확해진다는 가정입니다. 다중 턴 자기 리뷰가 검증 정밀도를 떨어뜨린다는 연구가 2026년 3월 18일 게시돼 있으나(arXiv 2603.16244), 정량 수치는 원문에서 대조하지 못했습니다(확인 필요). 턴 수를 늘리는 설정은 파일럿에서 직접 재 보고 결정하는 편이 안전합니다.

용어 풀이
1. harness — 모델에 문제를 주고 답을 받아내는 실행 껍데기로, 같은 모델도 이것에 따라 점수가 달라진다.
2. false-pass — 테스트가 통과라고 판정했지만 실제로는 결함이 남아 있는 경우.
3. sidekick 모델 — 주력(lead) 모델 옆에서 단순·반복 작업을 맡아 전체 비용을 낮추는 저비용 보조 모델.


체크리스트 정리

  1. 검증 대상 OS를 먼저 확정했는가 — macOS는 Devin Cloud에서 제공되지 않으므로 Outposts가 필요합니다(2026-09-15 문서 기준).
  2. PR 이후 실행이 사람 손을 탄다는 전제로 워크플로를 짰는가 — 버튼 없는 자동 실행은 아직 “coming soon”입니다.
  3. 재현 단계를 명확히 적었는가 — 독립 리뷰 기준 성공률이 78% 대 35%로 갈립니다.
  4. 모델 단가를 확인된 값으로만 계산했는가 — 입력 $10 / 캐시 입력 $1 / 출력 $50 / 캐시 쓰기 $12.50(100만 토큰, 2026-09-15 확인). 배치 할인·Fast 배수는 미확인입니다.
  5. 벤치마크를 옮길 때 harness와 인덱스 버전을 함께 적었는가 — 같은 Astra가 Codex harness에서 62, Cognition 인용 v1.5에서 58.9입니다.
  6. 비용 지배 구간과 화면 검증 구간을 분리했는가 — 전자는 SWE-2(Astra 비용 약 1/4), 후자는 Astra가 맞습니다.
  7. false-pass율을 파일럿에서 직접 측정할 계획이 있는가 — 공식·제3자 모두 이 수치를 공개하지 않았습니다.


참고 자료

조사 기준일: 2026년 09월 15일

본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.

Tier 1
– Cognition, “Introducing Devin 2.2” — https://cognition.com/blog/introducing-devin-2-2 (확인 2026-09-15)
– Cognition, “Verifying Agentic Development at Scale” — https://cognition.com/blog/testing-development (확인 2026-09-15)
– Cognition, “Introducing SWE-2: Pushing the Pareto Frontier” — https://cognition.com/blog/swe-2 (확인 2026-09-15)
– Cognition, “Introducing Fusion in Devin Desktop & CLI” — https://cognition.com/blog/local-fusion (확인 2026-09-15)
– Devin Docs, “Testing & Video Recordings” — https://docs.devin.ai/work-with-devin/testing-and-recordings (확인 2026-09-15)
– Devin Docs, “Computer Use” — https://docs.devin.ai/work-with-devin/computer-use (확인 2026-09-15)
– Devin Docs, “Models” — https://docs.devin.ai/cli/models (확인 2026-09-15)
– OpenAI Deployment Safety Hub, GPT-6 Astra System Card — https://deploymentsafety.openai.com/gpt-6-astra (확인 2026-09-15)
– OpenAI API Docs, GPT-6 Astra Model — https://developers.openai.com/api/docs/models/gpt-6-astra (확인 2026-09-15)
– OpenAI Developer Community, Announcements “Introducing GPT-6-Astra” — https://community.openai.com/t/introducing-gpt-6-astra-the-most-intelligent-and-aligned-model-in-the-world/1394703 (확인 2026-09-15)
– arXiv 2603.16244, “More Rounds, More Noise” — https://arxiv.org/pdf/2603.16244 (확인 2026-09-15, 수치 미대조)
Tier 1 접근 실패(미대조)
– Devin 블로그, “GPT-6 Astra is now available in Devin” — https://devin.ai/blog/gpt-6-astra (HTTP 429, 2026-09-15)
– OpenAI, “Cognition helps Devin test its own work with GPT-6 Astra” — https://openai.com/index/cognition-devin-testing-with-astra/ (HTTP 403, 2026-09-15)
– OpenAI, “GPT-6 Astra: A new generation of intelligence” — https://openai.com/index/gpt-6-astra/ (HTTP 403, 2026-09-15)
Tier 2
– Artificial Analysis, “Benchmarking GPT-6 Astra” (2026-09-09) — https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra (확인 2026-09-15)
– Simon Willison, “GPT-6 Astra” (2026-09-03) — https://simonwillison.net/2026/Sep/3/gpt6-astra/ (확인 2026-09-15)
– WinBuzzer (2026-09-04) — https://winbuzzer.com/2026/09/04/gpt-6-astra-arrives-with-major-gains-staged-access-and-new-questions-about-its-benchmarks-xcxwbn/ (확인 2026-09-15)
– Vellum, “GPT-6 Astra Benchmarks Explained” (2026-09-03) — https://www.vellum.ai/blog/gpt-6-astra-benchmarks-explained (확인 2026-09-15)
– Idlen, “Devin, the AI Engineer: Review, Testing & Limitations in 2026” (2026-03-03) — https://www.idlen.io/blog/devin-ai-engineer-review-limits-2026/ (확인 2026-09-15)
– kenashe.ai (2026-09-12) — https://kenashe.ai/blog/2026-09-12-devin-testing-its-own-work-with-gpt-6-astra-whats-real-whats-reported (확인 2026-09-15)


코멘트

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다