반응형

보로노이 패턴 — Generated with OpenAI

 

2026년 8월 앤트로픽(Anthropic)이 자사의 AI 모델 클로드(Claude)가 생성한 텍스트에 워터마크를 적용한다고 발표했다. 꼬리말처럼 눈에 보이는 표시를 덧붙이는 것이 아니라, 사람이 읽을 때는 전혀 알아차릴 수 없도록 텍스트 자체에 워터마크를 심는 방식이다.

 

AI 텍스트 워터마크는 2026년 8월 2일 발효된 EU AI Act의 투명성 규정을 준수하기 위해 도입된 것으로, 지역을 구분할 기술적 방법이 없어 전 세계 사용자에게 동일하게 적용된다.

 

이미지라면 픽셀을 미세하게 바꾸거나 파일 메타데이터에 정보를 숨기는 방식을 쉽게 떠올릴 수 있다. 하지만 텍스트는 조금 다르다. 복사해서 다른 곳에 붙여넣어도 지워지지 않으면서 사람 눈에는 보이지 않는 워터마크를 대체 어떻게 남길 수 있을까?

 

비밀은 '완성된 문장' 자체가 아니라 '문장을 만들어가는 과정'에 있다. 대규모 언어 모델(LLM)이 다음에 사용할 단어를 고를 때 후보들의 선택 확률에 특정한 규칙을 더하고, 이 수많은 선택이 쌓이면서 통계적으로만 구별할 수 있는 고유의 패턴을 남기는 것이다. 아래에서 자세하게 알아보자.

 

 

AI는 여러 후보 가운데 다음 단어를 선택한다


대규모 언어 모델은 문장을 통째로 만들어내지 않는다. 앞서 나온 내용을 바탕으로 다음에 등장할 가능성이 높은 토큰(token)을 하나씩 선택해 문장을 완성한다. 예를 들어 다음과 같은 문장이 있다고 가정해 보자.

 

연구 결과는 상당히 ___

 

빈칸에는 '긍정적이었다', '흥미로웠다', '놀라웠다'처럼 여러 표현이 들어갈 수 있다. 모델은 각 후보에 확률을 부여하고 그중 하나를 선택한다. 이때 정답은 하나만 있는 게 아니라 의미와 문맥상 자연스러운 후보가 여러 개 존재하는 경우가 많다. 텍스트 워터마킹은 바로 이 선택의 여지를 이용한다.

 

다음 표현 선택 확률 예시. 각 버튼을 누르면 확률에 따라 표현이 선택된다. ▼

작성 중인 문장
연구 결과는 상당히
긍정적이었다
40%
0회
흥미로웠다
30%
0회
놀라웠다
20%
0회
유의미했다
10%
0회
막대는 각 표현이 선택될 확률을 나타내며, 20번 반복하면 선택된 횟수가 동그란 점으로 표시된다. 어떤 표현이 선택되더라도 문장은 자연스럽다.

 

 

특정 단어가 조금 더 선택되도록 만든다


대표적인 워터마킹 기법은 비밀 키(secret key)를 이용해 다음에 등장할 수 있는 토큰들을 임의의 두 그룹으로 나눈다. 편의상 이를 '초록색 토큰'과 '빨간색 토큰'이라고 해보자.

 

이렇게 나뉜 두 그룹 중 초록색 토큰 쪽으로 확률을 살짝 밀어주는 것이 핵심이다. 원래 모델이 계산한 확률 자체를 완전히 뒤집는 것은 아니다. 대신 초록색으로 분류된 토큰의 확률은 살짝 올리고, 빨간색으로 분류된 토큰의 확률은 상대적으로 낮아지도록 조정하되 전체 합은 100%를 유지한다.

 

예를 들어 원래 모델의 선택 확률이 다음과 같다고 해 보자.

  • A: 40% (초록색 그룹)
  • B: 30%
  • C: 20% (초록색 그룹)
  • D: 10%

 

비밀 키가 A와 C를 초록색 그룹으로 지정했다면, 워터마킹 과정에서 이 그룹이 선택될 가능성이 약간 높아진다. 한두 번의 선택만 놓고 보면 그 차이를 알아채기 어렵다. 하지만 수백, 수천 개의 토큰이 쌓이면 초록색 그룹의 토큰이 평균보다 조금 더 많이 등장하는 통계적 패턴이 나타난다.

 

Google의 SynthID 역시 세부적인 알고리즘은 다르지만(여러 후보를 경쟁시키는 토너먼트 방식) 토큰 생성 과정에 통계적으로 탐지 가능한 패턴을 남긴다는 기본 원리는 비슷하다.

 

비밀 키가 선택 확률을 바꾸는 예시 ▼

작성 중인 문장
연구 결과는 상당히
긍정적이었다
40%
0회
흥미로웠다
30%
0회
놀라웠다
20%
0회
유의미했다
10%
0회
막대는 각 표현의 원래 선택 확률을 나타낸다.

 

 

워터마크는 통계적으로 찾아낸다


이렇게 만들어진 워터마크는 사람의 눈에는 보이지 않는다. 그렇다고 탐지기가 글의 내용이나 문체를 보고 "AI가 쓴 것 같다"고 판단하는 것도 아니다. 대신 워터마크를 만들 때 사용한 규칙을 다시 적용해 특정 그룹의 토큰이 우연이라고 보기 어려울 정도로 많이 등장하는지 확인한다.

 

워터마크가 없는 일반적인 텍스트라면 해당 토큰들이 특별히 많이 등장할 이유가 없다. 반면 워터마크가 적용된 텍스트에서는 생성 과정에서 미세한 편향이 계속 누적되므로 충분히 긴 글에서는 통계적으로 차이가 나타날 수 있다.

 

따라서 텍스트 워터마크는 특정 단어나 문장을 숨기는 기술이라기보다는, 단어 선택 분포에 일정한 흔적을 남기는 기술에 가깝다.

 

비밀 키로 워터마크 신호를 확인하는 예시 ▼

탐지할 글
예문 준비 중…
집계 준비 중…
판정 기준 준비 중…
키를 적용하면 각 어절의 색과 초록 비율을 확인할 수 있다.
같은 글이라도 키에 따라 분류 결과가 달라진다. 실제 워터마크 탐지는 어절 단위가 아닌 모델의 토큰을 기준으로 이루어진다.

 

 

글을 수정하면 워터마크는 어떻게 될까?


여기서 한 가지 의문이 생긴다. AI가 만든 글을 살짝 수정하면 워터마크가 사라질까?

 

단순한 오탈자 수정이나 일부 표현을 바꾸는 정도라면 워터마크가 완전히 사라지지 않을 수 있다. 원래 생성된 텍스트의 상당 부분이 그대로 남아 있기 때문이다.

 

실제로 워터마크 관련 연구에서는 사람이 직접 문장을 바꾸거나 다른 AI로 패러프레이징*해도 충분한 길이의 텍스트가 남아 있다면 워터마크가 탐지된다고 한다. 한 연구에서는 강한 수준의 인간 패러프레이징 이후에도 평균 약 800 토큰을 확보했을 때 워터마크를 탐지할 수 있었다.

 

패러프레이징(Paraphrasing): 원래 뜻을 유지하면서 단어나 문장 구조를 다른 표현으로 바꾸는 것.

 

반대로 문장을 거의 처음부터 다시 작성하거나 다른 언어로 번역하는 등 원문의 표현이 크게 달라지면 신호는 약해질 수 있다. 구글도 SynthID가 일부 단어 수정이나 가벼운 패러프레이징에는 비교적 견고하지만, 텍스트를 광범위하게 다시 쓰거나 번역하면 탐지 신뢰도가 크게 떨어질 수 있다고 설명한다.

 

글 수정에 따라 달라지는 워터마크 흔적 비교 예시 ▼

글 수정 정도
수정된 글
예문 준비 중…
결과를 준비하는 중…
밑줄은 원문과 5어절 이상 연속으로 일치하는 부분을 나타낸다. 표시된 비율은 수정된 글에 원문과 일치하는 구간이 얼마나 남아 있는지를 보여준다. 판정은 1,500 어절 길이의 글을 가정한 추정치로, 실제 워터마크 탐지 결과와는 다를 수 있다.

 

 

워터마크 탐지와 AI 탐지는 다르다


여기서 흔히 말하는 'AI 글 탐지기'와 워터마크 탐지는 구분할 필요가 있다.

 

일반적인 AI 탐지 서비스는 문장의 패턴이나 표현 방식 등을 분석해 AI가 작성했을 가능성을 추정한다. 반면 워터마크 탐지는 텍스트를 생성할 때 의도적으로 심어 놓은 통계적 신호를 확인하는 방식이다. 다만 워터마크가 발견됐다고 해서 반드시 AI가 처음부터 모든 내용을 작성했다는 뜻도 아니다.

 

예를 들어 사람이 직접 작성한 글을 Claude에 넣고 맞춤법만 수정하거나 번역하더라도 결과물에는 워터마크가 포함될 수 있다. 앤트로픽 역시 워터마크는 Claude가 처리·생성했을 가능성을 나타낼 뿐, 원저자가 누구인지를 증명하는 것은 아니라고 명시하고 있다.

 

반대로 워터마크가 탐지되지 않았다고 해서 사람이 작성했다는 의미도 아니다. 워터마크를 지원하지 않는 모델에서 생성됐거나, 글이 너무 짧거나, 상당 부분 수정된 경우 AI가 만든 텍스트라도 탐지하기 어려울 수 있다.

 

 

워터마크는 단어 사이의 선택에 숨어 있다


결국 워터마크는 텍스트 어딘가에 숨겨진 게 아니라, 단어와 단어 사이의 '선택' 그 자체에 있다. 텍스트는 이미지와 달리 눈에 보이지 않는 픽셀이나 별도의 저장 공간이 없다. 그래서 AI 텍스트 워터마킹은 글 속에 무언가를 직접 심는 대신, 모델이 다음 단어를 고를 때마다 아주 작은 규칙을 덧붙이는 방식을 택한다.

 

각각의 선택만 보면 지극히 자연스럽지만 이런 선택이 여러 번 쌓이면 통계적으로 일정한 패턴이 만들어진다. 그리고 그 규칙을 아는 쪽만이 이를 되짚어 계산해서 워터마크의 존재 여부를 확인할 수 있는 것이다.

 

 

참고 자료


반응형