AI 워터마크, 무엇을 기준으로 비교해야 할까

2026년 8월 11일 Anthropic이 Claude 생성물에 표식을 넣기 시작했다고 발표한 뒤, 논의는 곧바로 두 갈래의 과장으로 갈라졌습니다. 한쪽은 “이제 AI로 쓴 글은 다 걸린다”고 말하고, 다른 한쪽은 “제거 도구가 벌써 나왔으니 무의미하다”고 말합니다. 공개 자료를 기준일(2026년 8월 14일) 시점에서 대조해 보면 두 주장 모두 사실과 어긋납니다.
먼저 확인할 것은 이 표식이 무엇을 증명하느냐입니다. Anthropic은 지원 문서에서 워터마크가 검출되더라도 그 콘텐츠가 “Claude에 의해 처리됐을 수 있음(may have been processed by Claude)”을 뜻할 뿐이라고 명시했습니다. 저작 증명이 아니라는 뜻입니다. 본인이 직접 쓴 보고서의 문법만 Claude로 다듬은 경우에도 같은 표식이 남습니다. “AI가 썼다”와 “Claude를 거쳤다”는 전혀 다른 명제인데, 규제와 여론은 앞쪽을 기대하고 실제 심기는 신호는 뒤쪽입니다.
두 번째 기준은 검증 가능성입니다. 발표는 있었지만 기준일까지 공개 탐지기, 검증 키, 기술 문서 중 어느 것도 나오지 않았습니다. Anthropic은 “사용자와 제3자가 탐지할 수 있도록 하는 작업을 진행 중”이며 곧 나올 기술 문서에서 세부를 공유하겠다고만 적었습니다. 지금 “내 글에 워터마크가 있나”를 확인할 수단은 Anthropic 외부에 없습니다.
세 번째 기준은 강건성입니다. 여기서만은 독립 실증이 이미 학술 문헌에 축적돼 있어, 발표문의 표현(“일부 편집은 견딜 수 있다”)과 측정치를 직접 대조할 수 있습니다. 아래에서는 이 세 축 — 무엇을 증명하는가, 검증할 수 있는가, 얼마나 버티는가 — 를 기준으로 Claude와 경쟁 방식을 비교합니다.
비교 기준 정리
워터마크를 평가할 때 흔히 “정확도”라는 단일 지표를 찾습니다. 그러나 실무에서 문제가 되는 지점은 여러 층으로 갈라지므로 항목을 나눠 봐야 합니다.
| 비교 항목 | 측정 단위·기준 | 주의점 |
|---|---|---|
| 표식 방식 | 텍스트 내 통계적 임베딩 / 파일 메타데이터(C2PA) | Anthropic은 텍스트에 “인지 불가능한 워터마크를 텍스트 자체에 직접 짜 넣고”, .svg·.png·.jpg에는 C2PA 서명 메타데이터를 붙이는 두 갈래 구조 |
| 적용 범위 | 제품·모델·지역 단위 | Claude Platform API, Claude, Claude Code, Claude Cowork, Claude Tag 전체 / 지역 제한 없음. 단 2026년 8월 2일 이후 출시 모델만 지원, 그 이전 모델은 “진행 중” |
| 위음성률(FN) | 워터마크가 있는데 못 잡는 비율 | 공격 이전 상태에서도 KGW 70%, Unigram 83%, SynthID 80% (arXiv:2607.16010) |
| 위양성률(FP) | 사람 글을 AI로 오판하는 비율 | 동일 연구의 SynthID 설정에서 패러프레이즈된 사람 작성 대조군의 5.4% 오판 |
| 패러프레이즈 내성 | 재작성 1회 통과 후 잔존율 | KGW·Unigram 0%, SynthID 1.7% 잔존 (846회 유효 실행 기준) |
| 메타데이터 내성 | 포맷 변환·스크린샷 후 잔존 | Anthropic이 직접 제거 가능성을 인정 |
| 검증 접근성 | 공개 탐지기·알고리즘 공개 여부 | Claude는 양쪽 모두 비공개(기준일 2026-08-14). SynthID-Text는 오픈소스 + HF Transformers v4.46.0 이상 통합 |
| 옵트아웃 | 사용자 거부 수단 | Claude 지원 문서에 언급 없음. 엔터프라이즈 예외 여부는 미확인 |
| 짧은 텍스트 적합성 | 최소 길이 요건 | Anthropic은 “짧은 구절은 신뢰할 만한 신호를 담지 못할 수 있다”고 명시 |
| 저엔트로피 출력 | 사실 나열·코드 등 | Google은 SynthID 문서에서 “사실 위주 응답에는 효과가 떨어진다”고 명시. 코드 적용 여부는 Anthropic 공식 언급 없음(확인 필요) |
| 추가 비용 | 워터마킹 관련 별도 과금 | 2026년 8월 14일 확인 시점 기준, 어느 쪽에서도 별도 요율 발표 없음 |
핵심은 마지막 세 줄입니다. 짧은 글, 사실 나열, 코드처럼 선택의 여지가 적은 출력에는 통계 워터마크가 애초에 잘 박히지 않습니다. 워터마크는 모델이 여러 후보 단어 중 무엇을 고를지 편향시켜 심는 신호입니다. 고를 수 있는 후보가 적을수록 심을 자리가 없습니다.
옵션·유형별 비교

발표문과 측정치의 간극
| 발표 측 주장 | 공개 자료로 확인된 것 |
|---|---|
| “워터마크가 텍스트의 일부라서 복사·붙여넣기해도 따라가고, 일부 편집은 견딜 수 있다” | 동일 계열 워터마크 3종을 846회 패러프레이즈로 시험한 결과 KGW·Unigram 100%, SynthID 98.3% 소실 |
| “제3자 탐지 지원 작업 진행 중” | 기준일까지 공개 탐지기·검증 키·기술 문서 없음 |
| “2026-08-02 이후 출시 모델은 출시 시점부터 지원” | 이전 출시 모델은 일정 없이 “진행 중” — 현재 실사용 트래픽 상당 부분이 미마킹일 가능성 |
| 규제 준수용 AI 생성물 식별 | Anthropic 스스로 “처리됐을 수 있음”으로 후퇴. 교정·번역·요약 사용자도 마킹 대상 |
| 워터마크는 비가시적이다 | ETH 취리히 SRI Lab은 SynthID-Text를 블랙박스 프로빙해 워터마크 존재 자체를 p≈0 수준에서 탐지(2024-12-20) |
TechCrunch는 “워터마크를 없애려면 얼마나 편집해야 하는지 불분명하다”며 Anthropic에 해명을 요청했으나 기사 작성 시점까지 답을 받지 못했다고 적었습니다. “일부 편집(some editing)”의 정량적 경계는 여전히 정의되지 않았습니다.
제거 도구 시장의 실체
발표 며칠 만에 , , 같은 프로젝트가 등장했고 한 저장소는 GitHub 스타 4,500개 이상을 모았습니다(SC Media, 2026-08-13 보도 기준). 그러나 같은 취재에서 개발자들은 이 도구들이 실제로는 메타데이터와 숨은 문자를 벗기는 수준이며, 모델의 단어 선택 안에 박힌 워터마크를 지우는 기능은 “아직 작동하지 않는다”고 인정했습니다. 국내 보도도 같은 지점을 짚었습니다 — 온라인 제거 서비스들은 제로폭 문자나 특수 유니코드, 복사 과정에 남은 서식을 삭제하는 수준에 그친다는 것입니다.
실제 우회 경로는 전용 도구가 아니라 다른 LLM으로 한 번 다시 쓰는 것입니다. ETH 취리히 실험에서 DIPPER-11B 패러프레이저 단독으로 평균 1,000토큰 텍스트의 스크러빙 성공률이 90%를 넘었고, 보조 기법을 결합하면 거의 100%였습니다. 반대로 스푸핑(없는 워터마크를 가짜로 심기)에는 강했습니다 — 기본 설정 4%, 쿼리 예산을 90,000회로 3배 늘려도 15%였습니다. 방어 방향이 비대칭이라는 뜻입니다. 지우기는 쉽고, 남의 글에 누명을 씌우기는 어렵습니다.
한편 “1,000단어 기사 한 편을 프런티어 API 요율로 패러프레이즈 1회 통과시키는 비용이 약 4센트”라는 계산이 인용되고 있으나, 원문을 직접 확인하지 못해 어떤 모델·요율 기준인지는 미확인 상태입니다.
경쟁 구도
Google은 2024년 10월 SynthID-Text 알고리즘을 오픈소스로 공개했고 Hugging Face Transformers v4.46.0 이상에 통합했습니다. 외부 연구자가 뜯어보고 공격할 수 있게 열어둔 결과 ETH 취리히 같은 곳에서 약점이 공개적으로 밝혀졌습니다. 역설적으로 이것이 신뢰의 근거입니다. Anthropic은 알고리즘과 탐지기 모두 비공개이므로, 더 강한지 더 약한지를 아직 아무도 검증할 수 없습니다. OpenAI는 텍스트 워터마크 공개 적용 정황이 없고 이미지·오디오에 C2PA와 공개 검증 도구를 붙이는 노선입니다(원문 접근이 차단돼 1차 확인은 하지 못했습니다).
규제 쪽 시간표는 명확합니다. EU AI Act 제50조 투명성 의무와 이를 구체화한 「Code of Practice on Transparency of AI-generated Content」가 2026년 8월 2일부터 적용됐고, 유럽위원회는 2026년 7월 8일 이 Code가 제50조 (2)·(4)·(5)항 의무를 “적절히 포괄한다”는 의견을 냈습니다. 7월 말 기준 약 190개 조직이 서명했습니다. 한국은 AI 기본법이 2026년 1월 22일 시행됐고 제31조 제2항에 따라 표시는 “사람 또는 기계가 판독할 수 있는 형식”으로 하도록 규정됐습니다. 딥페이크가 아닌 일반 결과물은 비가시 워터마크나 메타데이터만으로도 인정되는 구조입니다(시행령 원문 고시는 직접 확인하지 못했습니다).
상황별 추천

사내 문서·마케팅 카피처럼 AI 사용 사실이 드러나도 무관한 용도 — 고려할 것이 없습니다. Anthropic은 워터마킹이 의미·품질·가독성을 바꾸지 않는다고 주장하며, 이를 반증하는 자료도 없습니다. 다만 그 주장을 뒷받침하는 벤치마크 수치 역시 공개되지 않았습니다.
EU 시장을 대상으로 생성형 AI 기능을 얹는 서비스 — 제50조 (2)항 준수 부담을 모델 제공자가 이미 처리했다는 점에서 Claude와 Gemini가 유리합니다. 단 배포자(deployer) 의무는 별도로 남으므로 “마킹된 모델을 쓴다”가 곧 준수 완료는 아닙니다. 법무법인 요약에 상호운용성 기한 2027년 2월 2일, 기존 시스템 유예 2026년 12월 2일이 반복 등장하나 EU 공식 문서 원문에서 확인하지 못했습니다.
워터마크 유무를 스스로 검증해야 하는 파이프라인 — 콘텐츠 진위 확인 서비스처럼 검증이 요건이라면 기준일 현재 SynthID-Text 계열이 유일한 실무 선택지입니다. Claude는 탐지기가 없어 측정 자체가 불가능합니다. 마이그레이션 판단을 “탐지 가능성”이 아니라 “검증 가능성”으로 내려야 하는 이유입니다.
Claude를 백엔드로 쓰는 SaaS 사업자 — 옵트아웃 수단이 문서에 없고 API·Claude Code까지 전부 포함되므로, 최종 사용자에게 나가는 텍스트에 사업자가 통제할 수 없는 제3자 표식이 실립니다. 계약서의 출력물 소유권 조항과 충돌하는지, 고객 고지 의무가 생기는지 지금 검토할 사안입니다.
개인 사용자(교정·윤문 목적) — 지금 당장 달라지는 것은 없습니다. 표식은 심기고 있으나 읽을 도구가 없습니다. 문제는 탐지 API가 나온 뒤입니다. 실질적 대비는 AI를 어디까지 사용했는지 스스로 기록해두는 것입니다. 커뮤니티에서는 비영어권 사용자가 문법 교정 용도로 쓴 글이 AI 생성물로 몰릴까 걱정하는 반응이 다수 보고됐습니다(Hacker News 등, 공식 확인 자료는 아닙니다).
자주 하는 실수

첫째, 위음성만 보고 위양성을 놓칩니다. 논의는 대개 “얼마나 잘 걸리나”에 쏠리지만 실무 리스크가 큰 쪽은 반대입니다. 공격 이전 상태에서도 위음성률이 70~83%였고, SynthID 설정은 패러프레이즈된 사람 작성 글의 5.4%를 AI로 오판했습니다. 학교나 언론사가 이 신호를 징계 근거로 쓰기 시작하면 오판 비용은 개인이 부담합니다. 판정이 나왔다는 사실이 곧 사실 확정은 아니라는 점을 알아두면 다툴 때 근거가 됩니다.
둘째, “마킹된 모델을 쓴다”를 “우리 출력물이 마킹돼 있다”로 착각합니다. 통계 워터마크는 패러프레이즈 1회에 98~100% 소실되고 짧은 텍스트·사실 위주 출력에는 애초에 잘 박히지 않습니다. C2PA 메타데이터는 포맷 변환, 리사이즈, 스크린샷에서 날아갑니다. 후처리 LLM 체인이나 이미지 CDN 리인코딩, 템플릿 조합이 끼어 있는 서비스라면 표식은 이미 파이프라인 중간에 죽어 있을 가능성이 높습니다.
셋째, 발표(announce)를 사용 가능(GA)으로 읽습니다. 탐지기가 없다는 것은 검증도 반박도 불가능하다는 뜻입니다. 한 독립 실험자가 n-gram 빈도 편향과 z-score 검정으로 자체 탐지기를 만들어 돌렸더니 일반 기능어(the, a, of, in, is, and)가 반복되면서 본문 거의 전체가 표시되는 위양성이 났고, 결론은 “검증 키 없이는 Anthropic 외부의 누구도 이걸 할 수 없다”였습니다. 덧붙이면, 탐지 API 공개는 그 자체가 우회 확인용 오라클로 쓰일 수 있어 규제 요구와 보안 설계가 구조적으로 충돌합니다. Anthropic이 아직 답을 내놓지 않은 배경일 수 있습니다.
정리
Claude 워터마크의 현재 상태는 “심기고 있으나 읽을 수 없는 신호”입니다. 강건성은 동일 계열 방식 기준으로 패러프레이즈 1회에 98~100% 소실되는 수준이고, 공격 이전에도 위음성률이 70~83%였습니다. 따라서 판단 기준은 “얼마나 잘 걸리나”가 아니라 “내 파이프라인에서 표식이 살아남는지 내가 직접 측정할 수 있나” 하나로 압축됩니다. 검증이 요건이라면 알고리즘과 탐지기가 공개된 SynthID-Text 계열이, EU 제50조 준수 부담 이전이 목적이라면 Claude·Gemini 어느 쪽이든 기능합니다. 본문 수치는 모두 2026년 8월 14일 확인 시점 기준이며, 탐지 API가 공개되는 시점에 전면 재평가가 필요합니다.
함께 보면 좋은 글
참고 자료
조사 기준일: 2026년 08월 14일
본문의 수치는 아래 자료에서 확인한 것입니다. 제조사 공식 자료(T1)와 전문 매체 실측(T2)을 구분해 표기했습니다. 가격·공급 상황은 변동이 크므로 기준일 이후의 값은 다시 확인해야 합니다.
Tier 1 (발표 주체 공식 1차 자료 / 원논문)
- Claude Help Center, “How Claude marks AI-generated content” — https://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content (WebFetch 확인 2026-08-14)
- European Commission, “Guidelines on transparency obligations for providers and deployers of certain AI systems” — https://digital-strategy.ec.europa.eu/en/policies/guidelines-transparency-ai-generated-content (WebFetch 확인 2026-08-14)
- European Commission, “How to sign the Code of Practice on transparency of AI-generated content” — https://digital-strategy.ec.europa.eu/en/library/how-sign-code-practice-transparency-ai-generated-content (검색 확인 2026-08-14)
- European Commission, “Commission opinion on the assessment of the Code of Practice on Transparency of AI-generated Content” — https://digital-strategy.ec.europa.eu/en/library/commission-opinion-assessment-code-practice-transparency-ai-generated-content (검색 확인 2026-08-14)
- Tamim & Khan, “AI Watermark Evidence Fails Forensic Readiness: An Empirical Evaluation”, arXiv:2607.16010, 2026-07-17 — https://arxiv.org/abs/2607.16010 (WebFetch 확인 2026-08-14)
- Google AI for Developers, “SynthID: Tools for watermarking and detecting LLM-generated Text” — https://ai.google.dev/responsible/docs/safeguards/synthid (WebFetch 확인 2026-08-14)
Tier 2 (독립 검증·매체 취재)
- TechCrunch, “Anthropic says it will watermark text generated by its AI models”, 2026-08-11 — https://techcrunch.com/2026/08/11/anthropic-says-it-will-watermark-text-generated-by-its-ai-models/ (WebFetch 확인 2026-08-14)
- Forbes (Mary Roeloffs), “Claude Will Put Invisible Watermarks On AI Text And Images—And The Internet Isn’t Happy”, 2026-08-11 — https://www.forbes.com/sites/maryroeloffs/2026/08/11/claude-will-put-invisible-watermarks-on-ai-text-and-images-and-the-internet-isnt-happy/ (WebFetch 확인 2026-08-14)
- ETH Zurich SRI Lab, “Probing Google DeepMind’s SynthID-Text Watermark”, 2024-12-20 — https://www.sri.inf.ethz.ch/blog/probingsynthid (WebFetch 확인 2026-08-14)
- SC Media, “Market for AI watermark removal tools emerges after Anthropic’s Claude update”, 2026-08-13 — https://www.scworld.com/brief/market-for-ai-watermark-removal-tools-emerges-after-anthropics-claude-update (WebFetch 확인 2026-08-14)
- 데이터넷(안휘), “클로드 ‘AI 워터마크’ 도입하자 ‘제거 도구’ 등장 ··· AI 저작 판별 실효성 논란”, 2026-08-14 — https://www.datanet.co.kr/news/articleView.html?idxno=213800 (WebFetch 확인 2026-08-14)
- The Next Web, “Anthropic starts marking all of Claude’s output worldwide as EU transparency rules take effect”, 2026-08-12 — https://thenextweb.com/news/anthropic-watermarks-claude-output-eu-ai-act-article-50 (WebFetch 확인 2026-08-14)
- Andrea Saez, “Putting Claude’s watermarking to the test” — https://dreasays.substack.com/p/putting-claudes-watermarking-to-the (WebFetch 확인 2026-08-14)
- explainx.ai, “Claude Invisible Watermarks — What They Detect (And Miss)” — https://explainx.ai/blog/anthropic-claude-invisible-watermarks-c2pa-august-2026 (WebFetch 확인 2026-08-14)
- TechTimes, “Four Cents Strips Claude Watermark…”, 2026-08-12 — https://www.techtimes.com/articles/324183/20260812/four-cents-strips-claude-watermark-anthropic-detection-api-confirms-evasion-oracle.htm (HTTP 403 — 원문 직접 확인 실패, 검색 스니펫만 확보)
- Axios, “Anthropic’s text watermarks signal new front in AI detection”, 2026-08-12 — https://www.axios.com/2026/08/12/anthropic-claude-watermarks-ai-detection (HTTP 403 — 확인 실패)
- OpenAI Help Center, “Provenance signals in OpenAI-generated content” — https://help.openai.com/en/articles/8912793-c2pa-in-chatgpt-images (HTTP 403 — 확인 실패, T1으로 승격 불가)
- OpenAI, “Advancing content provenance” — https://openai.com/index/advancing-content-provenance/ (HTTP 403 — 확인 실패)
Tier 3 (커뮤니티 — 수치 근거 아님)
- Hacker News, “Claude users are mad that Anthropic’s new watermarks will catch them using it” — https://news.ycombinator.com/item?id=49283891 (WebFetch 확인 2026-08-14)
- X 반응 (Nick Dobos, Sarah Nadav 등) — Forbes 2026-08-11 기사에 인용된 형태로 확인

답글 남기기