Как на самом деле работают детекторы ИИ (и почему они вас помечают)
Каждый раз, когда инструмент вроде GPTZero или Turnitin называет ваш текст "сгенерированным ИИ", он делает статистическую догадку, а не проводит проверку на детекторе лжи. Понимание того, как работают детекторы ИИ, - первый шаг к тексту, который читается как по-настоящему человеческий.
Что на самом деле измеряет детектор ИИ
Детектор ИИ не знает, кто написал предложение. Он никогда раньше не видел ваш документ и не может сверить его со скрытой базой ответов ChatGPT. Вместо этого он оценивает, насколько ваш текст предсказуем по сравнению с паттернами, которые обычно выдают большие языковые модели.
Современные детекторы сами являются моделями машинного обучения, обученными на миллионах человеческих и ИИ-фрагментов. Они ищут статистические отпечатки, которые оставляет генерация, и выдают вероятность. Ничто в этом конвейере не проверяет авторство. Детектор не видит историю вашего браузера и не смотрит, как вы печатаете; он может лишь сказать, что ваш текст похож или не похож на машинное письмо, на котором его обучали.
Представьте спам-фильтр. Он выучил, как обычно выглядит мусорная почта, и помечает письма с такими признаками, но никогда не может быть уверен насчет отдельного письма. Детекция ИИ работает так же, а значит, каждая оценка - это догадка, наряженная в число. Это меняет и то, как читать результат: "85% ИИ" не означает, что 85% вашего текста написано машиной. Это означает, что детектор довольно уверен в своей догадке.
Перплексия: насколько неожиданны ваши слова
Перплексия - самый важный сигнал. Она измеряет, насколько языковая модель удивлена каждым выбранным вами словом. Если каждое следующее слово ровно то, что модель бы и предсказала, перплексия низкая, и текст выглядит машинным. Люди менее предсказуемы: мы тянемся к странному прилагательному, нарушаем правило или формулируем что-то чуть неуклюже, и каждый такой выбор толкает перплексию вверх.
Конкретная пара делает это наглядным. Первое предложение: "Регулярные физические упражнения важны, потому что они улучшают физическое и психическое здоровье". Второе: "Я продолжаю тренироваться, потому что колени меньше ноют, а почта после зала пугает не так сильно". Оба грамматичны и говорят об одном, но первое целиком собрано из слов, которые языковая модель поставила бы на первое место по вероятности; "регулярные упражнения важны, потому что" - практически шаблон. Второе идет на маленькие риски: ноющие колени, пугающая почта. Модель, оценивающая вероятность слово за словом, находит первое предложение неудивительным, а второе по-настоящему трудным для предсказания, поэтому первое читается как ИИ, а второе как человек.
Именно поэтому отполированное, обезличенное письмо помечается, даже когда каждое слово написал человек. Перплексия не измеряет усилия или честность, только предсказуемость, а часть совершенно человеческого письма очень предсказуема.
Вариативность: ритм настоящего письма
Вариативность (burstiness) измеряет разброс структуры и длины предложений. Люди пишут рывками: длинное, петляющее предложение, за ним короткое. Три слова. Потом сложная конструкция, набитая деталями, которая тянется дольше, чем, наверное, следовало бы.
Вывод ИИ глаже. На настройках по умолчанию модель выдает предложения примерно одной длины, с похожими зачинами и одинаково ровной каденцией, абзац за абзацем. Положите два текста рядом - и разницу часто видно еще до чтения: человеческий текст выглядит на странице зубчатым, машинный - как кирпичная кладка.
Детекторы измеряют эту зубчатость. Низкая вариативность плюс низкая перплексия - классическая сигнатура ИИ, и когда есть оба сигнала, детектор уверенно считает текст сгенерированным, даже если тема и грамматика безупречны. Впрочем, каждый сигнал по отдельности слаб. Поэт пишет с дикой вариативностью, а юрист по контрактам почти без нее, и оба - люди, поэтому серьезные инструменты всегда сочетают оба показателя.
Вероятности токенов под капотом
Языковые модели пишут по одному токену за раз, и у каждого токена есть вероятность. Детекторы аппроксимируют эти вероятности и проверяют, находится ли ваш текст внутри "зоны комфорта" вероятных выборов модели. Когда фрагмент почти целиком собран из высоковероятных токенов, выстроенных в ровный ритм, он совпадает с тем, как ChatGPT, Gemini и Claude генерируют по умолчанию, и детектор превращает этот паттерн в процент, который вы видите.
Это же объясняет, почему короткие отрывки ненадежно тестировать. На одном-двух предложениях сигнала недостаточно, чтобы отличить аккуратного человека от модели, поэтому оценки прыгают. Большинство вендоров молчаливо согласны: некоторые отказываются оценивать что-либо короче нескольких сотен слов, потому что ниже этой длины математика ближе к подбрасыванию монеты, чем к измерению.
Статистические детекторы против детекторов-классификаторов
Инструменты детекции делятся на два семейства, и знание того, с каким вы имеете дело, объясняет многие странные результаты. Статистические детекторы используют эталонную языковую модель для прямого вычисления вероятностей: они прогоняют ваш текст через модель, измеряют перплексию, вариативность и связанные величины, затем применяют порог. Так работают исследовательские методы вроде GLTR и DetectGPT, как и скоринг за многими бесплатными чекерами. Их сила в том, что им не нужны размеченные обучающие данные; слабость в том, что вердикт сильно зависит от того, какая эталонная модель делает скоринг.
Детекторы-классификаторы, напротив, обучаются. Вендор собирает большие корпуса заведомо человеческого и заведомо ИИ-текста, затем дообучает модель, часто трансформер в духе RoBERTa, отличать одно от другого. Так устроены Turnitin, Originality.ai и Copyleaks. Классификаторы улавливают тонкие признаки за пределами чистой перплексии, поэтому они точнее на тексте, похожем на их обучающие данные, но деградируют на письме новых моделей, других языках и доменах, которых они не видели, и никто вне вендора не может проверить, чему они на самом деле научились.
Большинство коммерческих продуктов теперь гибриды обоих подходов, что отчасти объясняет, почему их оценки трудно интерпретировать и еще труднее сравнивать между инструментами.
Почему вывод ChatGPT, Gemini и Claude помечается
Передовые модели обучены быть ясными, безопасными и гладкими, и финальный этап этого обучения поощряет ответы, которые большинство оценщиков считает хорошо написанными. Это толкает вывод к сбалансированным предложениям, аккуратным переходам вроде "более того" и "в заключение" и лексике, которая держится статистической середины.
Именно эти качества и выслеживают детекторы. Чем более отполирован и "усреднен" текст, тем ниже его перплексия и вариативность и тем выше оценка ИИ. По иронии, сырые человеческие черновики с опечатками и причудами часто проходят легче, чем чистый первый черновик ИИ, потому что именно изъяны несут человеческий сигнал.
Что на самом деле проверяют GPTZero, Turnitin, ZeroGPT и другие
Крупные инструменты разделяют одну базовую логику, но настраивают ее по-разному. GPTZero популяризировал скоринг перплексии и вариативности и показывает оба показателя на уровне предложений. Turnitin AI встраивает детекцию в свой пакет проверки плагиата для учебных заведений, разбивая документы на перекрывающиеся сегменты и помечая те, которые его классификатор считает написанными моделью.
ZeroGPT предлагает быстрый бесплатный разбор по предложениям, а Originality.ai нацелен на издателей и SEO-команды со строгой, взвешенной по уверенности оценкой. Copyleaks делает упор на многоязычное покрытие и корпоративную отчетность. Все они вероятностные, поэтому ни один не может честно называться идеальным, а маркетинг точности каждого вендора тихо описывает тесты, которые вендор сам и придумал.
Почему детекторы не согласны друг с другом
Вставьте одно и то же эссе в три детектора, и вы можете получить 2% ИИ от одного, 45% от другого и 88% от третьего. Этот разброс - не баг одного из них; так и бывает, когда разные системы делают разные догадки на одних и тех же данных.
Каждый инструмент обучен на своем корпусе, скорит своей эталонной моделью, по-своему режет текст (весь документ против предложения за предложением) и сам задает порог того, что считать "вероятным ИИ". Инструмент, откалиброванный избегать ложных обвинений, будет осторожничать и недопомечать; инструмент, который продают как ловца читеров, будет агрессивничать и перепомечать тот же текст. Обновляются они тоже по разным графикам, поэтому детектор, настроенный до выхода новой модели, месяцами будет неверно судить о ее стиле.
Практический вывод: ни одна оценка не окончательна, а разногласия между инструментами - прямое свидетельство того, сколько здесь гадания. Если ваш вуз проверяет через Turnitin, значим только вердикт Turnitin, и чистая оценка в другом месте его не предсказывает и от него не защищает.
Ложные срабатывания: опубликованные цифры
Поскольку детекторы судят о предсказуемости, они регулярно промахиваются, и эти промахи не гипотетические. Собственный классификатор OpenAI, запущенный в январе 2023 года, распознал лишь 26% ИИ-текста, при этом пометив 9% человеческого текста как ИИ, и компания закрыла его через полгода из-за низкой точности. Turnitin заявляет долю ложных срабатываний на уровне документа ниже 1%, но признал, что отдельные помеченные предложения куда менее надежны, поэтому он скрывает оценки на документах с небольшим объемом подозреваемого ИИ-текста.
Самый тревожный результат касается неносителей английского языка. Исследователи из Стэнфорда протестировали семь популярных детекторов на эссе, написанных реальными студентами для экзамена TOEFL, и обнаружили, что в среднем 61% этих написанных людьми эссе были помечены как сгенерированные ИИ, и почти все они были помечены хотя бы одним детектором. Эссе носителей языка из США прошли те же инструменты почти без единого флага.
Механизм ровно тот, что описан в этой статье: пишущие на втором языке склонны выбирать более безопасную лексику и более регулярные конструкции, что снижает перплексию, что читается как машинный текст. Смещение зашито в сам метод. Поэтому ответственные учебные заведения воспринимают оценку детектора как начало разговора, а не как доказательство. Число - не улика.
Водяные знаки: решение, которое так и не вышло
Исследователи давно утверждают, что настоящее решение - водяные знаки: сама модель ИИ встраивает невидимую статистическую подпись в момент генерации. В самой известной схеме модель при письме тайно отдает предпочтение ротируемому "зеленому списку" токенов. Читатель паттерна не заметит, но детектор с ключом может проверить его куда точнее, чем гадание по перплексии.
В основном это так и не вышло в свет. OpenAI построила текстовый водяной знак, по внутренним отчетам эффективный примерно на 99,9% на длинных фрагментах, и положила его на полку, ссылаясь на то, что перефразирование или перевод стирают метку, что она может стигматизировать неносителей языка, легитимно использующих ИИ для полировки, и, менее благородно, что пользователи просто уйдут к инструментам без водяных знаков. Исключение - SynthID-Text от Google, работающий внутри Gemini и выпущенный в открытый код, но он метит только вывод самого Gemini.
В этом и корень проблемы: водяной знак покрывает лишь модели, чьи создатели сотрудничают, а открытые модели, которые любой может запустить локально, никогда его не понесут. Так что детектор, которым сегодня пользуется ваш вуз или работодатель, по-прежнему занимается статистикой, а не чтением водяных знаков, со всей вытекающей неопределенностью.
Как детекторы обрабатывают смешанный текст человека и ИИ
Реальные документы редко однородны. Студент пишет вступление сам, просит ChatGPT расширить два абзаца, затем редактирует все целиком. Детекторы справляются с этим, двигая окно по документу, оценивая каждое предложение или сегмент отдельно и подсвечивая участки, которые выглядят сгенерированными.
Смешение ослабляет каждый сигнал. Человеческие правки внутри ИИ-абзаца поднимают его перплексию; ИИ-предложения внутри человеческого раздела тянут его ритм к однородности. В итоге получается средняя оценка, которая может означать и "наполовину ИИ", и "полностью человек, странно пишущий", а пометки по предложениям заметно менее надежны, чем общее число. Turnitin, например, говорил, что его флаги на уровне предложений несут более высокую долю ошибок, чем оценка документа, и одно время вовсе отказывался показывать низкие проценты, настолько они были шаткими.
Короче: чем более смешан документ, тем размытее вердикт, а подсвеченные предложения в отчете заслуживают даже большего скепсиса, чем общий процент.
Как гуманизация снижает оценку
Если детекторы вознаграждают высокую перплексию и вариативность, решение - писать более по-человечески: варьировать длину предложений, выбирать менее предсказуемые слова, добавлять естественные переходы и ломать однородный ритм. Делать это вручную по всему документу долго, поэтому и существует ИИ-хуманизатор, который переписывает текст и автоматически возвращает человеческую вариативность.
Инструмент вроде Humanize AI перефразирует вывод модели так, чтобы он вновь обрел естественную вариативность и менее предсказуемые формулировки, помогая ему обойти детекцию ИИ при сохранении смысла. Что важно, он показывает оценку до и после от реальных детекторов, так что вы измеряете изменение, а не надеетесь. Цель не обман, а текст, который наконец звучит как вы.
Что это значит для вас на практике
Несколько привычек напрямую следуют из устройства технологии. Проверяйте перед отправкой, потому что гадать об оценке бессмысленно, когда проверка бесплатна; вы можете прогнать черновик через бесплатный ИИ-хуманизатор и увидеть цифры детекторов раньше всех. Никогда не доверяйте вердикту по короткому фрагменту, а пометки на уровне предложений считайте в лучшем случае слабой уликой.
Если вы пишете честно, храните доказательства: версии черновиков, заметки и история правок - куда лучшее подтверждение авторства, чем любая контроценка, особенно если вы неноситель языка, пишущий в формальном регистре, которому детекторы не доверяют. А если вам предстоит конкретный чекер, изучите его конкретное поведение; у Turnitin в частности есть особенности, которые стоит знать, поэтому мы и написали гайд по Turnitin как дополнение к этому.
Главное, помните, что такое детектор. Это сопоставитель паттернов, оценивающий предсказуемость, созданный вендором, настроенный на порог и ошибающийся с измеримой частотой в обе стороны. Полезен - иногда. Доказательство - никогда.
Часто задаваемые вопросы
Насколько точны детекторы ИИ на самом деле?
Менее точны, чем обещает их маркетинг. OpenAI закрыла собственный детектор после того, как он поймал лишь 26% ИИ-текста, пометив при этом 9% человеческого, а независимые тесты регулярно находят двузначные доли ошибок на перефразированном или отредактированном тексте. Лучшие инструменты действительно сильно превосходят подбрасывание монеты на длинном неотредактированном ИИ-выводе, но каждая оценка - это оценка вероятности, а не проверенный факт.
Может ли детектор ИИ доказать, что я использовал ChatGPT?
Нет. Детекторы измеряют статистическую предсказуемость вашего письма; они не могут проверить, кто его набирал, и ошибаются в обе стороны с задокументированной частотой. Оценка - это догадка в форме обвинения. Если вы написали работу сами, черновики, планы и история версий - настоящие доказательства в том смысле, в каком контроценка от другого детектора ими не является.
Почему два детектора дают совершенно разные оценки одному тексту?
Потому что это разные гадатели. Каждый инструмент обучается на своих данных, скорит своей эталонной моделью, по-своему режет текст и сам задает порог, после которого что-то называется ИИ. Осторожный инструмент недопомечает, а агрессивный перепомечает один и тот же абзац. Разногласия между детекторами нормальны, и это хорошее напоминание о том, сколько неопределенности стоит за каждым процентом.
Работают ли детекторы ИИ на коротком тексте?
Плохо. Перплексии и вариативности нужно достаточно слов, чтобы сложился паттерн, а одно-два предложения просто не содержат сигнала. Оценки на отрывках сильно прыгают, поэтому некоторые вендоры отказываются оценивать что-либо короче нескольких сотен слов. К любому вердикту по короткому фрагменту, включая одно подсвеченное предложение в длинном отчете, относитесь с большим скепсисом.
Можно ли снизить оценку детектора ИИ, не меняя смысл?
Да, потому что детекторы оценивают стиль, а не содержание. Варьирование длины предложений, замена статистически безопасных формулировок более конкретными и слом однородного ритма поднимают перплексию и вариативность, оставляя аргумент нетронутым. Ровно это и автоматизирует бесплатный ИИ-хуманизатор, показывая оценки детекторов до и после, чтобы вы сами убедились в падении.
Попробуйте бесплатный гуманизатор ИИ
Вставьте текст и за секунды увидите оценку ИИ до и после. Без регистрации, работает на любом языке.
Гуманизировать текст