워터마크가 찍히는 AI 생성 텍스트 일러스트

Anthropic이 자사 AI 모델의 텍스트 출력에 워터마크를 삽입하고 있다는 최근의 폭로는 소셜 미디어 전반에 걸쳐 격렬한 논쟁을 촉발했습니다. 정확한 방법론은 문서에 명시적으로 자세히 설명되어 있지 않지만, 아마도 복사, 붙여넣기, 심지어 이후의 AI 교정에도 살아남도록 설계된 통계적 단어 선택 편향에 기반한 것으로 추정됩니다. Anthropic 자신도 이 방법이 "완전히 결론적이지는 않다"고 인정합니다. 이에 대해서는 나중에 더 자세히 설명하겠습니다.

소셜 미디어의 반응은 신속하고 가혹했지만, 주류 담론에서는 몇 가지 중요한 함의가 간과되고 있습니다. 텍스트 워터마킹이 근본적으로 결함 있는 패러다임인 이유에 대한 저희의 관점을 말씀드리겠습니다.

Anthropic만이 아닙니다

현재 Anthropic이 부정적인 여론의 대부분을 떠안고 있지만, 이 분야의 선구자는 결코 아닙니다. Google은 최소한 2024년 5월부터 생성 텍스트에 워터마크를 삽입해 왔습니다(SynthID 논문 및 Gemini에서의 사용에 대한 Google 발표). OpenAI도 마찬가지로 AI 생성 텍스트에 출처 신호를 추가할 완전한 의도가 있다고 선언했으며, 그 시점은 불과 2026년 8월 2일입니다(OpenAI 도움말 센터).

Google이 이미 2년 전에 이를 구현했고 OpenAI가 불과 12일 전에 같은 일을 할 의도를 발표했음에도 Anthropic에 향하는 지나친 분노는 홍보의 관점에서 흥미로운 사례 연구이지만, 더 큰 요점을 놓치고 있습니다. 텍스트 워터마킹은 이제 업계 전반에 걸친 관행입니다. 우리는 이를 회사별 문제가 아닌 시스템적 변화로 평가해야 합니다. 이 문제는 현재 Anthropic이 이 문제로 받고 있는 비난보다 훨씬 큽니다.

저작권 함의

미국에서는 완전히 AI가 생성한 콘텐츠는 저작권으로 보호받을 수 없으며, 이는 최근 몇 년간 미국 저작권청에 의해 재확인된 입장입니다. 그러나 저작물이 저작권 보호 대상이 되기 위해 필요한 인간 개입의 기준은 여전히 모호한 법적 최전선입니다. 워터마킹은 이미 취약한 이 방정식에 위험한 변수를 도입합니다.

잠재적인 법적 역설을 살펴보겠습니다:

  • 교정자의 딜레마: 완전히 독창적인 책을 썼지만 AI를 사용해 교정하고 문장을 다듬었다면, 워터마크 탐지기가 전체 원고를 AI 생성으로 표시할 수 있습니다. 그렇다면 저작권을 박탈당하는 걸까요?
  • 번역가의 함정: 소설을 손으로 썼지만 AI를 사용해 영어로 번역했다면 어떨까요? 번역된 텍스트의 워터마크는 이론적으로 콘텐츠가 100% AI 생성임을 나타낼 수 있습니다. 영어 버전은 지식재산권 보호를 잃게 되는 걸까요?
  • 코더의 캔버스: 며칠을 들여 애플리케이션을 설계하고, 상위 수준의 설계 결정을 내리고, 프롬프트를 작성하고, 반복하고, 테스트했다고 상상해 보세요. 로직에는 인간의 창의성을 쏟아부었지만 실제 구문은 AI가 작성했습니다. 코드가 100% AI 생성으로 표시된다면, 막대한 인간의 노동이 투입되었음에도 불구하고 소프트웨어는 보호받을 수 없는 걸까요?

워터마킹은 인간-AI 협업 작품을 광범위하고 이분법적인 붓으로 칠함으로써 법적으로 무효화할 위협이 됩니다.

오탐지의 위험

Google과 Anthropic 모두 자사의 텍스트 워터마크가 100% 정확하지 않다는 것을 인정합니다. 완전히 인간이 작성한 작품이 AI 생성으로 잘못 분류되면 입증 책임은 부당하게도 창작자에게 넘어갑니다.

부정을 어떻게 증명할까요? 작가들은 이제 자신의 저작권을 입증하기 위해 화면과 키 입력을 녹화하거나 작업하는 동안 카메라를 자신에게 향하게 해야 할까요? 아니면 "믿어주세요, 제가 썼어요"라는 모호한 주장에 의존해야 할까요?

오탐지는 검열이나 직업적 사보타주의 도구로 무기화될 수 있기 때문에 특히 위험합니다. 악의적 행위자가 기자, 라이벌 또는 동료의 평판을 떨어뜨리고 싶다면, 대상의 글을 Anthropic, Google, OpenAI 등 서로 다른 워터마크 탐지기의 관문에 통과시켜 필연적으로 "탐지기 쇼핑"을 통해 오탐지를 얻어낼 때까지 반복하면 됩니다. 그런 다음 저자를 공개적으로 망신시키고, 학문적 또는 직업적 사기로 비난하고, 알고리즘의 거짓된 권위가 피해를 입히도록 내버려 둘 수 있습니다. 각 AI 탐지기에는 오탐지 확률이 있으며, 모두 다른 방법을 사용한다면 같은 텍스트를 다른 탐지기로 테스트할 때마다 오탐지 확률이 증가합니다.

텍스트 워터마킹을 구현하는 기업들 스스로 이 방법이 100% 정확하지 않다고 밝혔으므로, 워터마킹은 표시된 사람들에게 현실 세계의 결과를 초래할 어떤 자격도 없습니다.

개별 사용자 추적을 위한 백도어

현재 AI 제공업체가 사용자별로 워터마킹을 구현하는 것을 막는 기술적 제한은 없습니다. 범용 Anthropic 또는 Gemini 워터마크 대신, 모델을 조정하여 귀하의 사용자 계정에 연결된 특정하고 암호학적으로 고유한 패턴으로 단어 선택에 편향을 줄 수 있습니다.

왜 이것이 나쁜가요? AI 텍스트 생성을 대량 감시 장치로 바꿀 것이기 때문입니다. 익명 블로그 게시물, 내부 고발자의 신고, 민감한 이메일 등 인터넷에 게시하는 모든 텍스트가 스크랩되고, 분석되고, 수학적으로 귀하의 특정 AI 계정까지 역추적될 수 있습니다. 이는 사용자로부터 익명성과 프라이버시에 대한 권리를 박탈하고, 우리 문장의 구조 안에 숨겨진 영구적이고 보이지 않는 지문을 기술 대기업에 넘겨주는 것입니다.

AI 제공업체들은 과거에 분할 출시를 주저하지 않았습니다. 하나는 세계용, 하나는 EU용으로 나누고, 심지어 EU가 법을 준수할 때까지 EU의 접근을 제한하기도 했습니다. 현재의 출시가 EU뿐만 아니라 이미 전 세계적으로 이루어졌다는 사실은 AI 제공업체들 스스로 이를 구현하는 데 이익이 있다고 보고 있음을 나타냅니다. 그들이 텍스트에 워터마크를 추가하는 것에 이익을 보는 이유가 무엇인지 자문해 봐야 합니다.

저하되는 AI 출력 품질

기본적인 통계 논리에 따르면, 모델이 워터마크를 준수하도록 강제하면 성능이 저하됩니다. 통계적으로 유의미한 서명을 만들기 위해 단어 선택을 인위적으로 편향시키면 모델의 자연스러운 어휘, 표현 범위, 선택할 수 있는 옵션의 수가 제한됩니다. 이 모든 것은 모델 출력의 품질에 부정적인 영향을 미칠 수밖에 없습니다. 답변해야 하는 특정 방식이 제한될 때 창의성과 답변의 품질이 향상된 적은 한 번도 없었다는 것이 저희의 의견입니다.

이는 필연적으로 트레이드오프를 강요합니다: 모델 품질 대 워터마크 탐지 가능성. 뉘앙스를 제한합니다. 더 나아가, 모델이 워터마킹 알고리즘에 의해 심하게 제약을 받는다면, 복잡한 스타일 프롬프트(예: "18세기 해적 스타일로 이걸 써줘")를 무시할까요? 그 페르소나를 채택하려면 의무화된 통계적 단어 편향을 포기해야 하기 때문입니다.

워터마킹이 모델 품질에 영향을 미친다는 아이디어를 뒷받침하는 연구가 이미 일부 있습니다(OpenReview, ACL Anthology, OpenReview, arXiv).

학문적 진실성의 환상

교육자들이 학생들이 에세이와 시험에서 부정행위를 저지르기 위해 AI를 사용하는 것에 대해 우려하는 것은 당연합니다. 지지자들은 워터마킹이 해결책이라고 주장합니다. 저희는 강력히 반대합니다. 이 방법은 절대적이 아닌 확률적이기 때문에 징벌적 학문 환경에는 설 자리가 없습니다.

단 한 번의 부당한 퇴학은 이 기술이 제공하는 모든 이론적 이익을 무효화합니다. 더욱이, 거대한 제도적 권력 불균형으로 특징지어지는 학생들의 카프카적 악몽을 만들어냅니다. 대학이 에세이를 불투명한 독점 API에 통과시키고, 컴퓨터는 "AI 생성"이라고 말합니다. 학생은 구제 수단이 없고, 블랙박스 알고리즘을 감사할 방법도 없으며, 기관에 "다시 실행해 달라"고 간청하는 것 외에는 자신을 방어할 방법이 없습니다. 이는 교육적 신뢰를 알고리즘적 교리로 대체합니다.

허위 정보 퇴치: 무의미한 논점

워터마킹이 스팸, 아스트로터핑, 피싱과 싸운다는 주장은 근본적인 현실을 무시합니다. AI를 협업 글쓰기 파트너로 사용하는 것이 빠르게 글로벌 기본값이 되어가고 있습니다. 많은 전문가와 학생들이 이미 브레인스토밍, 번역, 초안 작성에 AI를 사용하고 있습니다. 앞으로 몇 년 안에 어떤 형태로든 AI 지원 없이 글을 쓰는 것은 규칙이 아닌 예외가 될 가능성이 매우 높습니다.

공개되는 거의 모든 텍스트에 어느 정도의 AI 협업이 포함된다면, AI 워터마크를 탐지하는 것은 완전히 무의미해집니다. 이는 맞춤법 검사기와 계산기가 사회를 "우둔하게 만든다"는 역사적 공황을 연상시키며, 이미 오래전에 신뢰를 잃은 논거입니다. 허위 정보와의 진정한 싸움은 실제 인간인지 자동화된 봇 농장인지가 텍스트를 게시하는지 확인하는 것이지, 텍스트 자체가 부분적으로 AI에 의해 생성되었는지 고민하는 것이 아닙니다.

"모델 붕괴" 오류

일부는 AI 기업들이 미래 모델을 훈련할 때 합성 텍스트를 걸러내어 "모델 붕괴"를 방지할 수 있도록 워터마킹이 필요하다고 주장합니다.

그러나 이 접근 방식에는 뉘앙스가 부족합니다. 인간-AI의 깊은 협업을 통해 생성된 텍스트는 훈련에 사용되어야 할 새롭고 고품질의 데이터입니다. 워터마크가 있는 모든 것을 맹목적으로 걸러냄으로써 AI 기업들은 차세대 모델에서 가치 있는 인간 주도 콘텐츠를 빼앗게 될 것입니다. 대신 AI 훈련 기업들은 AI가 언젠가 텍스트에 손을 댔는지 확인하기 위해 투박한 워터마크에 의존하기보다는 작품의 참신성과 텍스트의 실제 유용성을 평가해야 합니다.

군비 경쟁이 시작되었고 정직한 사람들이 손해를 볼 것입니다

이 전체 시도를 보안 극장으로 만드는 핵심 실패 모드는 다음과 같습니다. 워터마크 제거는 해결 가능한 적대적 문제이며, 이를 해결할 동기가 가장 강한 사람들은 정확히 시스템이 잡으려는 사람들입니다.

통계적 텍스트 워터마크는 단어 선택 확률을 밀어내는 방식으로 작동합니다. 따라서 다른 분류기와 마찬가지로 이에 대해 테스트할 수 있습니다. 표절 공장, 허위 정보 농장, 스패머 등 워터마크를 제거할 동기가 있는 사람은 누구나 출력물을 공개 탐지기에 통과시키고, 문구를 조정하고, 워터마크가 없는 오픈소스 LLM을 통해 바꿔 쓰고, 텍스트가 "깨끗함"으로 등록될 때까지 반복할 수 있습니다.

이것은 추측이 아닙니다. 표절 검사기와 이메일 스팸 필터에서 봐온 바로 그 쥐와 고양이의 역학입니다. 이 단일 목적을 위한 "AI 인간화" 도구의 수익성 높은 가내 산업이 이미 존재합니다.

결과적으로, 이 탐지기들이 실제로 잡아내는 사람들은 악의적 행위자가 아닙니다. 정직한 사용자들을 잡아냅니다. 문법을 고치기 위해서만 AI를 사용한 학생, AI에게 피드백을 요청한 후 해당 구절을 다시 쓴 작가, 언어적 어려움 때문에 번역에 AI를 의존한 사람. 이 사용자들은 숨길 것이 없기 때문에 자신의 작업을 다섯 가지 다른 회피 도구에 통과시키지 않습니다.

위음성 집단이 "적극적으로 회피하려 한 사람"이고 위양성 집단이 "숨기는 것을 귀찮아하지 않은 사람"인 탐지 시스템은 구조적으로 망가져 있습니다. 정직함을 걸러내면서 부정직함에 면죄부를 줍니다.

결론

AI 텍스트 워터마킹은 복잡한 사회학적 변화에 적용된 투박하고 피상적인 패치입니다. 현재의 형태로는 AI 출력의 품질을 저하시키고, 저작권법의 물을 흐리고, 사용자 추적을 위한 거대한 취약점을 만들고, 작업물이 AI 생성으로 잘못 표시된 사람들에게 실질적인 피해를 줄 위협이 됩니다. 무엇보다 최악인 것은 정직하고 투명한 사용자에게는 함정으로 작동하면서, 겉으로는 저지하기 위해 설계된 악의적 행위자들을 막는 데는 완전히 실패한다는 것입니다. 더 나쁜 것은, 이미 진행 중인 일을 가속화하고 있다는 점입니다. 사회는 AI 사용을 둘러싼 새로운 마녀사냥 시대에 진입하고 있으며, 누군가의 작업물이 마음에 들지 않는다는 것이 글 자체의 장점과 씨름하는 대신 점점 더 "이건 마녀 AI 생성이야"라고 주장하는 것을 의미하게 되고 있습니다. 이러한 사고방식이 더욱 굳어지기 전에 워터마킹 같은 원시적인 도구를 넘어서야 합니다.