AI 감지기는 실제로 어떻게 작동할까 (그리고 왜 당신을 걸러낼까)
GPTZero나 Turnitin 같은 도구가 당신의 글을 'AI 생성'이라고 판정할 때마다, 그것은 거짓말 탐지가 아니라 통계적 추측을 하고 있는 것입니다. AI 감지기의 작동 원리를 이해하는 것이 진짜 인간다운 글을 쓰는 첫걸음입니다.
AI 감지기가 실제로 측정하는 것
AI 감지기는 문장을 누가 썼는지 알지 못합니다. 당신의 문서를 본 적도 없고, 숨겨진 ChatGPT 출력 데이터베이스와 대조할 수도 없습니다. 대신 당신의 텍스트가 대형 언어 모델이 만들어 내는 패턴과 비교해 얼마나 예측 가능한지를 채점합니다.
현대의 감지기는 그 자체가 수백만 개의 인간 텍스트와 AI 텍스트로 학습된 머신러닝 모델입니다. 생성 과정이 남기는 통계적 지문을 찾아낸 뒤 확률을 출력합니다. 이 과정 어디에도 저자를 검증하는 단계는 없습니다. 감지기는 당신의 브라우저 기록을 볼 수도, 타이핑하는 모습을 지켜볼 수도 없습니다. 그저 당신의 텍스트가 자신이 학습한 기계 글쓰기와 닮았는지 아닌지를 말할 수 있을 뿐입니다.
스팸 필터를 떠올려 보세요. 스팸 메일이 보통 어떻게 생겼는지 학습했기 때문에 그런 특징을 공유하는 메시지를 걸러내지만, 개별 이메일 하나에 대해서는 결코 확신할 수 없습니다. AI 감지도 같은 방식으로 작동하며, 따라서 모든 점수는 숫자로 포장된 추측입니다. 결과를 읽는 방식도 달라져야 합니다. 'AI 85%'는 텍스트의 85%가 기계로 작성됐다는 뜻이 아니라, 감지기가 자신의 추측에 꽤 자신이 있다는 뜻일 뿐입니다.
퍼플렉시티: 당신의 단어가 얼마나 의외인가
퍼플렉시티(perplexity)는 가장 중요한 단일 신호입니다. 당신이 고른 각 단어에 언어 모델이 얼마나 놀라는지를 측정합니다. 다음 단어가 모두 모델이 예측했을 법한 단어라면 퍼플렉시티는 낮아지고, 텍스트는 기계가 쓴 것처럼 보입니다. 인간은 덜 예측 가능합니다. 엉뚱한 형용사를 고르고, 규칙을 깨고, 살짝 어색하게 표현하는데, 이런 선택 하나하나가 퍼플렉시티를 끌어올립니다.
구체적인 예를 보면 분명해집니다. 첫 번째 문장: '규칙적인 운동은 신체 건강과 정신 건강을 모두 개선하기 때문에 중요합니다.' 두 번째 문장: '운동을 계속하는 이유는 무릎이 덜 쑤시고, 끝나고 나면 받은메일함이 덜 무섭게 느껴져서입니다.' 둘 다 문법적으로 맞고 요지도 같지만, 첫 문장은 언어 모델이 가장 가능성 높은 다음 단어로 꼽을 만한 단어로만 조립되어 있습니다. '규칙적인 운동은 중요합니다'는 사실상 템플릿입니다. 두 번째 문장은 작은 모험을 합니다. 쑤시는 무릎, 무섭게 느껴지는 받은메일함. 단어별 확률을 채점하는 모델에게 첫 문장은 전혀 놀랍지 않고 두 번째 문장은 정말로 예측하기 어렵기 때문에, 첫 문장은 AI로, 두 번째 문장은 인간으로 읽힙니다.
이것이 사람이 한 단어 한 단어 직접 쓴 매끈하고 무난한 글까지 걸리는 이유입니다. 퍼플렉시티는 노력이나 정직함이 아니라 예측 가능성만 측정하며, 완벽하게 인간적인 글 중에도 매우 예측 가능한 글이 있습니다.
버스티니스: 진짜 글쓰기의 리듬
버스티니스(burstiness)는 문장 구조와 길이의 변화를 측정합니다. 사람은 리듬을 타며 씁니다. 길게 굽이치는 문장 뒤에 짧은 문장이 옵니다. 딱 세 단어. 그다음에는 필요 이상으로 길게 이어지는, 세부 묘사가 빽빽한 복잡한 절이 따라옵니다.
AI 출력물은 더 매끄럽습니다. 기본 설정 그대로 두면 모델은 비슷한 길이를 맴돌고, 비슷한 구문으로 시작하고, 문단이 바뀌어도 똑같이 고른 박자로 끝나는 문장들을 만들어 냅니다. 둘을 나란히 놓으면 한 단어도 읽기 전에 차이가 보일 때가 많습니다. 인간의 텍스트는 지면 위에서 들쭉날쭉해 보이고, 기계의 텍스트는 벽돌쌓기처럼 보입니다.
감지기는 그 들쭉날쭉함을 수치화합니다. 낮은 버스티니스에 낮은 퍼플렉시티가 더해진 것이 전형적인 AI 시그니처이고, 두 신호가 모두 나타나면 주제와 문법이 완벽하더라도 감지기는 그 텍스트가 생성됐다고 확신하게 됩니다. 다만 신호 하나만으로는 약합니다. 시인은 버스티니스가 요동치는 글을 쓰고 계약 전문 변호사는 거의 없는 글을 쓰지만 둘 다 인간이며, 그래서 제대로 된 도구는 항상 두 신호를 결합합니다.
내부에서 벌어지는 토큰 확률 계산
언어 모델은 토큰을 하나씩 생성하며, 각 토큰에는 확률 점수가 붙습니다. 감지기는 이 확률을 근사해서 당신의 텍스트가 모델의 '편안한 선택 범위' 안에 있는지 확인합니다. 어떤 구절이 거의 전부 고확률 토큰으로, 고른 리듬으로 조립되어 있다면 ChatGPT, Gemini, Claude가 기본값으로 생성하는 방식과 일치하고, 감지기는 그 패턴을 당신이 보는 퍼센트로 변환합니다.
이는 짧은 텍스트 검사가 신뢰하기 어려운 이유이기도 합니다. 문장 한두 개로는 신중한 인간과 모델을 구분할 신호가 부족해서 점수가 크게 요동칩니다. 대부분의 업체도 조용히 이를 인정합니다. 몇백 단어 미만은 아예 채점을 거부하는 곳이 여럿인데, 그 길이 아래에서는 계산이 측정이라기보다 동전 던지기에 가깝기 때문입니다.
통계 기반 감지기 vs 분류기 기반 감지기
감지 도구는 두 계열로 나뉘며, 어느 쪽을 상대하는지 알면 이상한 결과가 상당 부분 설명됩니다. 통계 기반 감지기는 참조 언어 모델로 확률을 직접 계산합니다. 텍스트를 모델에 통과시켜 퍼플렉시티, 버스티니스 등 관련 수치를 측정한 뒤 임계값을 적용합니다. GLTR, DetectGPT 같은 연구 방법론이 이 방식이고, 여러 무료 검사기의 채점 방식도 마찬가지입니다. 라벨링된 학습 데이터가 필요 없다는 것이 강점이고, 어떤 참조 모델이 채점하느냐에 판정이 크게 좌우된다는 것이 약점입니다.
분류기 기반 감지기는 학습으로 만들어집니다. 업체가 인간 텍스트와 AI 텍스트로 확인된 대규모 말뭉치를 모은 뒤, 흔히 RoBERTa 계열 트랜스포머 모델을 미세 조정해 둘을 구분하게 합니다. Turnitin, Originality.ai, Copyleaks가 이 방식입니다. 분류기는 순수 퍼플렉시티 너머의 미묘한 단서까지 포착하므로 학습 데이터와 닮은 텍스트에서는 더 정확한 경향이 있지만, 새로운 모델, 다른 언어, 본 적 없는 도메인의 글에서는 성능이 떨어지고, 실제로 무엇을 학습했는지는 업체 밖의 누구도 들여다볼 수 없습니다.
요즘 상용 제품 대부분은 두 접근법의 하이브리드인데, 이것이 점수를 해석하기 어렵고 도구 간 비교는 더더욱 어려운 이유 중 하나입니다.
ChatGPT, Gemini, Claude 출력물이 걸리는 이유
프런티어 모델은 명확하고 안전하고 유창하게 쓰도록 학습되며, 그 학습의 마지막 단계는 대부분의 평가자가 잘 썼다고 평가하는 답변에 보상을 줍니다. 그 결과 출력물은 균형 잡힌 문장, '게다가'와 '결론적으로' 같은 깔끔한 접속 표현, 통계적으로 중간 지대에 머무는 어휘 쪽으로 밀려갑니다.
바로 그 특성이 감지기가 사냥하는 대상입니다. 글이 매끄럽고 '평균적'일수록 퍼플렉시티와 버스티니스는 낮아지고 AI 점수는 높아집니다. 역설적이게도 오타와 개성으로 가득한 인간의 날것 초안이 깔끔한 AI 초안보다 쉽게 통과하는 경우가 많은데, 결점이야말로 인간 신호를 실어 나르기 때문입니다.
GPTZero, Turnitin, ZeroGPT 등이 실제로 확인하는 것
주요 도구들은 같은 핵심 논리를 공유하되 조율 방식이 다릅니다. GPTZero는 퍼플렉시티와 버스티니스 채점을 대중화했고 두 수치를 문장 단위로 보여 줍니다. Turnitin AI는 학교용 표절 검사 제품군에 감지 기능을 통합해, 문서를 겹치는 구간으로 나누고 분류기가 모델 작성으로 판단한 구간에 플래그를 답니다.
ZeroGPT는 빠르고 무료인 문장별 판독을 제공하고, Originality.ai는 엄격한 신뢰도 가중 점수로 퍼블리셔와 SEO 팀을 겨냥합니다. Copyleaks는 다국어 커버리지와 기업용 리포트를 강조합니다. 모두 확률 기반이므로 어느 것도 완벽하다고 정직하게 주장할 수 없으며, 각 업체의 정확도 마케팅이 사실은 업체 스스로 설계한 테스트를 조용히 설명하고 있는 이유이기도 합니다.
감지기들이 서로 다른 판정을 내리는 이유
같은 에세이를 세 개의 감지기에 붙여 넣으면 한 곳에서는 AI 2%, 다른 곳에서는 45%, 또 다른 곳에서는 88%가 나올 수 있습니다. 이 편차는 어느 한 도구의 버그가 아닙니다. 서로 다른 시스템이 같은 증거에서 서로 다른 추측을 할 때 벌어지는 당연한 일입니다.
각 도구는 자기만의 말뭉치로 학습하고, 자기만의 참조 모델로 채점하고, 텍스트를 다르게 쪼개고(문서 전체 vs 문장 단위), 'AI일 가능성이 높음'의 기준선도 스스로 정합니다. 억울한 오판을 피하도록 보정된 도구는 보수적으로 덜 잡아내고, 부정행위 적발을 내세워 파는 도구는 같은 텍스트를 공격적으로 더 잡아냅니다. 업데이트 주기도 제각각이라, 새 모델 출시 전에 조율된 감지기는 몇 달 동안 그 모델의 문체를 오판합니다.
실용적인 교훈은 단일 점수는 결코 결정적이지 않다는 것이며, 도구 간 불일치 자체가 얼마나 많은 추측이 개입되는지 보여 주는 직접 증거입니다. 학교가 Turnitin으로 검사한다면 중요한 것은 Turnitin의 판정뿐이고, 다른 곳에서 받은 깨끗한 점수는 그것을 예측해 주지도, 지켜 주지도 않습니다.
오탐: 공개된 수치들
감지기는 예측 가능성을 판정하기 때문에 일상적으로 오작동하며, 그 실패는 가정이 아닙니다. 2023년 1월 출시된 OpenAI 자체 분류기는 AI 작성 텍스트의 26%만 식별하면서 인간 텍스트의 9%를 AI로 오판했고, 회사는 낮은 정확도를 이유로 6개월 만에 이를 퇴역시켰습니다. Turnitin은 문서 수준 오탐률이 1% 미만이라고 주장하지만, 개별 플래그 문장의 신뢰도는 훨씬 낮다고 인정했으며, 의심되는 AI 텍스트 분량이 적은 문서에는 점수 표시를 보류하는 이유가 바로 이것입니다.
가장 우려스러운 연구 결과는 비원어민 영어 화자에 관한 것입니다. 스탠퍼드 연구진이 실제 학생들이 TOEFL 시험을 위해 쓴 에세이로 인기 감지기 7종을 테스트한 결과, 이 인간 작성 에세이의 평균 61%가 AI 생성으로 플래그되었고, 거의 전부가 적어도 하나의 감지기에서 걸렸습니다. 미국 원어민 학생들의 에세이는 같은 도구를 거의 무사통과했습니다.
메커니즘은 이 글이 설명하는 바로 그것입니다. 제2언어로 글을 쓰는 사람은 더 안전한 어휘와 더 규칙적인 문장 구조를 쓰는 경향이 있고, 그것이 퍼플렉시티를 낮추고, 그것이 기계 텍스트로 읽힙니다. 편향은 방법론 자체에 새겨져 있습니다. 책임 있는 학교들이 감지기 점수를 증거가 아니라 대화의 출발점으로 취급하는 이유입니다. 숫자는 증거가 아닙니다.
워터마킹: 아직 출시되지 않은 해결책
연구자들은 오래전부터 진짜 해결책은 워터마킹이라고 주장해 왔습니다. AI 모델 스스로 생성 시점에 보이지 않는 통계적 서명을 심는 방식입니다. 가장 잘 알려진 기법에서는 모델이 글을 쓰는 동안 순환하는 '그린 리스트' 토큰을 몰래 선호합니다. 독자는 패턴을 알아챌 수 없지만, 키를 가진 감지기는 퍼플렉시티 추측보다 훨씬 높은 정확도로 이를 검증할 수 있습니다.
그런데 대부분 출시되지 않았습니다. OpenAI는 긴 텍스트에서 약 99.9% 유효하다고 내부적으로 알려진 텍스트 워터마커를 만들어 놓고도 묵혀 두고 있습니다. 패러프레이징이나 번역이 마크를 지운다는 점, AI를 정당하게 다듬기 용도로 쓰는 비원어민에게 낙인이 될 수 있다는 점, 그리고 덜 고상한 이유로는 사용자들이 워터마크 없는 도구로 갈아탈 것이라는 점을 우려해서입니다. Google의 SynthID-Text가 예외로, Gemini 안에서 작동하고 오픈 소스로 공개됐지만 Gemini 자신의 출력물에만 마크를 남깁니다.
이것이 핵심 문제입니다. 워터마크는 제작사가 협조하는 모델만 커버하고, 누구나 로컬에서 돌릴 수 있는 오픈 웨이트 모델에는 영원히 새겨지지 않습니다. 그래서 오늘 당신의 학교나 회사가 쓰는 감지기는 여전히 워터마크를 읽는 게 아니라 통계를 돌리고 있으며, 거기에 따르는 불확실성도 그대로입니다.
인간과 AI가 섞인 텍스트는 어떻게 처리될까
실제 문서가 한 가지로만 이루어진 경우는 드뭅니다. 학생이 서론을 직접 쓰고, ChatGPT에게 본문 두 문단의 확장을 맡기고, 전체를 다시 편집합니다. 감지기는 문서 위로 창을 밀며 각 문장이나 구간을 따로 채점하고, 생성된 것으로 보이는 구간을 강조하는 방식으로 이를 처리합니다.
혼합은 모든 신호를 약화시킵니다. AI 문단 안의 인간 편집은 퍼플렉시티를 올리고, 인간 섹션 안의 AI 문장은 리듬을 균일한 쪽으로 끌어당깁니다. 그 결과는 '절반이 AI'일 수도 '전부 인간인데 특이하게 쓴 글'일 수도 있는 중간 점수이고, 문장별 하이라이트는 전체 수치보다 눈에 띄게 덜 신뢰할 만합니다. 예컨대 Turnitin은 문장 수준 플래그가 문서 점수보다 오류율이 높다고 밝혔고, 너무 불안정하다는 이유로 낮은 퍼센트는 한동안 아예 표시하지 않았습니다.
요컨대 문서가 섞일수록 판정은 흐려지고, 리포트에서 강조된 문장은 헤드라인 퍼센트보다 더 큰 의심을 받아 마땅합니다.
인간화가 점수를 낮추는 원리
감지기가 높은 퍼플렉시티와 버스티니스에 보상을 준다면, 해법은 더 사람답게 쓰는 것입니다. 문장 길이를 다양하게 하고, 덜 예측 가능한 단어를 고르고, 자연스러운 전환을 넣고, 균일한 리듬을 깨는 것입니다. 문서 전체에 이 작업을 손으로 하려면 느리기 때문에, 텍스트를 재작성해 인간적 변화를 자동으로 복원해 주는 AI 휴머나이저가 존재하는 것입니다.
Humanize AI 같은 도구는 모델 출력물을 다시 표현해 자연스러운 버스티니스와 덜 예측 가능한 문장을 되찾게 하고, 의미는 그대로 유지하면서 AI 감지 우회를 돕습니다. 결정적으로, 실제 감지기의 전후 점수를 보여 주기 때문에 희망이 아니라 측정으로 변화를 확인하게 됩니다. 목표는 속임수가 아니라 마침내 당신답게 들리는 글입니다.
실전에서 이것이 의미하는 바
기술의 작동 방식에서 몇 가지 습관이 곧바로 따라 나옵니다. 제출 전에 테스트하세요. 확인이 무료인데 점수를 추측하는 것은 무의미합니다. 무료 AI 휴머나이저에 초안을 돌려 보면 다른 누구보다 먼저 감지기 수치를 볼 수 있습니다. 짧은 텍스트에 대한 판정은 절대 믿지 말고, 문장 단위 하이라이트는 기껏해야 약한 증거로 취급하세요.
정직하게 쓴다면 증거를 남기세요. 초안 버전, 메모, 편집 기록은 어떤 반박용 점수보다 훨씬 좋은 저자 증명이며, 감지기가 의심하는 격식체로 글을 쓰는 비원어민이라면 더욱 그렇습니다. 특정 검사기를 상대해야 한다면 그 검사기의 구체적인 행동을 익히세요. 특히 Turnitin에는 알아 둘 가치가 있는 특성들이 있어서, 이 글의 자매편으로 Turnitin 가이드를 썼습니다.
무엇보다 감지기가 무엇인지 기억하세요. 예측 가능성을 채점하는 패턴 매칭 도구이고, 업체가 만들었고, 임계값에 맞춰 조율되었으며, 양방향으로 측정 가능한 비율만큼 틀립니다. 유용할 때는 있습니다. 증거인 적은 없습니다.
자주 묻는 질문
AI 감지기는 실제로 얼마나 정확한가요?
마케팅이 시사하는 것보다 부정확합니다. OpenAI는 자체 감지기가 AI 텍스트의 26%만 잡아내면서 인간 텍스트의 9%를 오판하자 이를 퇴역시켰고, 독립 테스트에서는 패러프레이징되거나 편집된 텍스트에서 두 자릿수 오류율이 흔히 발견됩니다. 최고 수준의 도구는 길고 편집되지 않은 AI 출력물에서 동전 던지기보다 훨씬 낫지만, 모든 점수는 검증된 사실이 아니라 확률 추정치입니다.
AI 감지기가 제가 ChatGPT를 썼다는 것을 증명할 수 있나요?
아니요. 감지기는 글이 통계적으로 얼마나 예측 가능한지를 측정할 뿐 누가 타이핑했는지는 검증할 수 없으며, 기록된 비율만큼 양방향으로 오작동합니다. 점수는 고발 모양을 한 추측입니다. 직접 쓴 글이라면 초안, 개요, 버전 기록이야말로 다른 감지기의 반박용 점수와는 차원이 다른 진짜 증거입니다.
같은 텍스트인데 두 감지기의 점수가 완전히 다른 이유는 무엇인가요?
서로 다른 추측기이기 때문입니다. 각 도구는 자기 데이터로 학습하고, 자기 참조 모델로 채점하고, 텍스트를 다르게 쪼개고, AI 판정의 임계값도 스스로 정합니다. 보수적인 도구는 같은 문단을 덜 잡아내고 공격적인 도구는 더 잡아냅니다. 감지기 간 불일치는 정상이며, 모든 퍼센트 뒤에 얼마나 많은 불확실성이 있는지 일깨워 주는 좋은 신호입니다.
AI 감지기는 짧은 텍스트에도 작동하나요?
잘 작동하지 않습니다. 퍼플렉시티와 버스티니스는 패턴이 형성될 만큼의 단어가 필요한데, 문장 한두 개에는 신호가 부족합니다. 짧은 글의 점수는 크게 요동치며, 그래서 여러 업체가 몇백 단어 미만은 채점 자체를 거부합니다. 짧은 구절에 대한 판정은, 긴 리포트 안에서 강조된 문장 하나까지 포함해, 강하게 의심하며 받아들이세요.
의미를 바꾸지 않고 AI 감지 점수를 낮출 수 있나요?
네, 감지기는 내용이 아니라 문체를 채점하기 때문입니다. 문장 길이를 다양화하고, 통계적으로 안전한 표현을 더 구체적인 단어로 바꾸고, 균일한 리듬을 깨면 논지는 그대로 둔 채 퍼플렉시티와 버스티니스가 올라갑니다. 무료 AI 휴머나이저가 자동화하는 것이 정확히 이 작업이며, 전후 감지기 점수를 보여 주므로 하락을 직접 확인할 수 있습니다.