AI 텍스트 워터마크 초록 빨강 리스트 탐지 원리 인포그래픽

AI가 쓴 글, 이제 다 들킨다고? AI 텍스트 워터마크 완벽 정리

“이거 AI가 썼죠?” 이제는 사람이 눈치채는 수준이 아니라, 글자 하나하나에 기계만 읽을 수 있는 표시가 남는 시대가 왔습니다. AI 텍스트 워터마크가 실제로 어떤 원리로 작동하는지, 얼마나 잘 잡아내는지 정리했습니다.

2026년 8월, 앤트로픽은 앤트로픽 고객센터 안내에서 클로드가 생성하는 모든 텍스트에 보이지 않는 워터마크를 심는다고 밝혔습니다. 유럽연합 AI법의 투명성 규정을 지키기 위한 조치인데, 적용 범위는 유럽에 그치지 않고 전 세계로 확대됩니다. “내 글도 워터마크가 찍혀서 나가는 걸까?”, “이게 검색엔진이나 독자에게 어떻게 보일까?” 궁금해질 수밖에 없습니다.

AI 텍스트 워터마크란 정확히 무엇인가요?

AI 텍스트 워터마크는 이미지에 찍는 반투명 로고 같은 것이 아닙니다. 눈으로 보거나 복사해서 붙여넣어도 절대 드러나지 않는, 통계적인 흔적에 가깝습니다.

언어모델은 다음 단어를 고를 때 항상 여러 후보를 확률로 저울질합니다. 예를 들어 “빠른”, “신속한”, “재빠른” 세 단어가 문맥상 거의 똑같이 자연스럽다면, 어떤 걸 골라도 문장의 뜻은 변하지 않습니다. 워터마킹 기술은 바로 이 지점을 파고듭니다. 비밀 키를 이용해 후보 단어들을 두 그룹으로 몰래 나누고, 한쪽 그룹에 아주 살짝 더 힘을 실어주는 방식입니다. 이 학계 표준 기법은 2023년 메릴랜드 대학 연구진이 처음 제안했고, 흔히 초록 리스트와 빨강 리스트로 부릅니다. 색으로 표현한 시각적으로 풀어낸 설명을 보면 감이 훨씬 잘 잡힙니다.


초록 리스트, 빨강 리스트는 어떻게 나뉘나요?

여기서 재미있는 부분이 나옵니다. 초록·빨강 구분은 단어마다 고정된 값이 아닙니다. 바로 앞에 어떤 단어들이 왔는지에 따라 매번 새로 계산됩니다. 그래서 같은 단어라도 어떤 문장에서는 초록이고, 두 단어 뒤에서는 빨강이 될 수 있습니다.

  • 아무 규칙도 못 찾는 사람: 글을 아무리 읽어도 어디가 초록이고 빨강인지 알 방법이 없습니다. 색 구분은 비밀 키를 쥔 쪽의 계산 결과일 뿐이라서입니다.
  • 비밀 키를 쥔 검사자: 문장 앞부분을 보고 같은 계산을 그대로 재현해, 실제로 초록 단어가 얼마나 자주 나왔는지 셀 수 있습니다.

워터마크가 없는 보통 글은 초록 단어가 대략 절반 정도 나옵니다. 반면 워터마크가 심어진 글은 이 비율이 조금씩, 하지만 꾸준히 높게 나옵니다. 한두 단어로는 우연인지 구분할 수 없지만, 문장이 수백 단어로 늘어나면 이 쏠림이 우연이라고 보기 어려운 수준까지 쌓입니다. 검사자는 이 쏠림 정도를 하나의 점수로 환산해, 이 글이 워터마크가 찍힌 글일 확률을 계산합니다.


그럼 나도 이 워터마크를 확인할 수 있나요?

아쉽지만 그렇지 않습니다. 검사에는 반드시 워터마크를 심은 회사만 가진 비밀 키가 필요합니다. 인터넷에 떠도는 “AI 판별기” 사이트들이 진짜 워터마크를 읽어내는 것은 아니라는 뜻입니다. 그런 도구들은 문체나 문장 패턴을 보고 추측할 뿐, 이 통계적 표시 자체를 검증할 권한이 없습니다.

앤트로픽을 비롯한 주요 AI 기업들은 자체 탐지 도구를 준비 중이라고 밝혔지만, 아직 일반에 공개되지는 않았습니다. 지금 시점에서는 “이 글에 워터마크가 있는지 없는지”를 외부인이 직접 확인할 방법이 없다고 보는 것이 정확합니다.


AI 워터마크, 얼마나 강력하게 걸러낼까요?

여기서 콘텐츠 제작자가 가장 궁금해할 질문에 답할 차례입니다. 결론부터 말하면, 이 워터마크는 생각보다 쉽게 깨집니다.

워터마크는 글자 하나하나가 “어떤 확률로 선택됐는가”에 의존합니다. 그런데 사람이 문장을 다시 쓰거나, 다른 AI 모델을 한 번 더 거쳐 표현을 바꾸면 이 확률 분포 자체가 완전히 새로 만들어집니다. 단어 선택이 통째로 다시 이루어지는 셈이라, 기존 워터마크의 흔적은 사실상 사라집니다. 메릴랜드 연구진의 원논문에서도 이미 다른 언어모델로 문장을 재작성하는 방식이 이 워터마크를 무력화한다는 사실을 확인한 바 있습니다.

표로 보면 더 명확합니다.

상황 워터마크 생존 여부
그대로 복사해서 붙여넣기 살아남음
문장 몇 군데만 다듬기 부분적으로 약해짐
전체를 새로 풀어쓰기(패러프레이즈) 사실상 사라짐
짧은 문장(몇 십 단어 이하) 애초에 신뢰도 있는 판정 자체가 어려움

이 표에서 보듯, 워터마크는 “복사-붙여넣기 수준의 무단 도용”을 잡아내는 데는 효과적이지만, 사람이 손을 대거나 다른 모델로 다듬은 글까지 완벽하게 추적하지는 못합니다. 앤트로픽 스스로도 워터마크가 없다고 해서 사람이 썼다는 증거는 아니라고 못 박고 있습니다.


콘텐츠 제작자라면 지금 무엇을 챙겨야 할까요?

AI로 초안을 쓰고 사람이 다듬어 발행하는 작업 방식을 쓰고 있다면, 사실 크게 달라질 것은 없습니다. 다만 몇 가지는 짚어두는 게 좋습니다.

워터마크는 저작권 침해를 잡는 도구가 아니라 “이 글이 기계적으로 생성됐는가”를 표시하는 투명성 장치에 가깝습니다. 표절 검사나 품질 검증과는 목적이 다릅니다.

AI 초안을 그대로 발행하는 습관보다는, 원래도 권장되던 방식이 이제 더 중요해졌습니다. 사람이 검토하고 실제 경험과 관점을 더해 다시 쓰는 과정입니다. 이 과정에서 AI투(AI 특유의 문체 습관)를 걷어내는 작업은 워터마크 여부와 상관없이 글의 자연스러움과 신뢰도를 높여줍니다.

이 기술은 아직 초기 단계라는 점도 감안할 만합니다. 탐지 도구가 일반에 공개되지 않았고, 기업마다 적용 범위와 방식도 계속 바뀌는 중입니다. 지금 당장 규제 대응 전략을 새로 짜기보다는, 어떤 도구를 쓰든 결과물의 품질과 진정성을 사람이 책임지는 원칙을 지키는 편이 안전합니다.

AI 텍스트 워터마크 초록 빨강 리스트 탐지 원리 인포그래픽

자주 헷갈리는 세 가지 오해

  • “메모장에 옮겨 붙이면 지워지지 않나요?” 아닙니다. 워터마크는 서식이나 폰트가 아니라 단어 선택 자체에 새겨지므로, 텍스트만 복사해도 그대로 따라갑니다.
  • “AI 판별 사이트에서 통과하면 워터마크가 없는 건가요?” 그 사이트들은 통계적 워터마크를 읽는 게 아니라 문체 패턴을 추측하는 별개의 도구입니다. 통과 여부와 워터마크 존재 여부는 서로 다른 이야기입니다.
  • “짧은 SNS 문구도 다 걸리나요?” 워터마크 판정은 어느 정도 글자 수가 쌓여야 신뢰도가 생깁니다. 한두 문장짜리 짧은 글은 애초에 판정 자체가 불안정합니다.

마무리: 보이지 않는 표시보다 중요한 것

AI 텍스트 워터마크는 “AI가 썼는지 아닌지”를 가려내려는 시도 중 하나일 뿐, 만능 해결책은 아닙니다. 초록·빨강 리스트라는 정교한 수학 뒤에 숨어 있지만, 문장을 한 번만 새로 풀어써도 흔적이 옅어질 만큼 여전히 허점이 많습니다.

결국 중요한 것은 워터마크를 피하는 기술이 아니라, AI를 도구로 삼아 얼마나 진짜 도움이 되는 글을 만드느냐입니다. 이 변화를 지켜보면서, 여러분의 콘텐츠 제작 방식도 한 번쯤 점검해보시길 권합니다.

Similar Posts