Як насправді працюють детектори ШІ (і чому вони вас позначають)
Щоразу, коли інструмент на кшталт GPTZero чи Turnitin позначає ваш текст як "згенерований ШІ", він робить статистичне припущення, а не проводить тест на детекторі брехні. Розуміння того, як працюють детектори ШІ, це перший крок до тексту, який читається як справді людський.
Що насправді вимірює детектор ШІ
Детектор ШІ не знає, хто написав речення. Він ніколи раніше не бачив ваш документ і не може звірити його з прихованою базою відповідей ChatGPT. Натомість він оцінює, наскільки передбачуваним є ваш текст порівняно з патернами, які зазвичай продукують великі мовні моделі.
Сучасні детектори самі є моделями машинного навчання, натренованими на мільйонах людських і ШІ-фрагментів. Вони шукають статистичні відбитки, які залишає генерація, а потім видають імовірність. Ніщо в цьому конвеєрі не перевіряє авторство. Детектор не бачить вашу історію браузера і не спостерігає, як ви друкуєте; він може лише сказати, що ваш текст схожий чи не схожий на машинне письмо, на якому його навчали.
Уявіть спам-фільтр. Він вивчив, як зазвичай виглядає небажана пошта, тож позначає листи з такими ознаками, але ніколи не може бути впевненим щодо окремого листа. Детекція ШІ працює так само, а отже кожна оцінка це здогад, вбраний у число. Це також змінює те, як читати результат: "85% ШІ" не означає, що 85% вашого тексту написала машина. Це означає, що детектор доволі впевнений у своєму припущенні.
Перплексія: наскільки несподівані ваші слова
Перплексія є найважливішим окремим сигналом. Вона вимірює, наскільки мовна модель здивована кожним обраним вами словом. Якщо кожне наступне слово саме таке, яке модель і передбачила б, перплексія низька, і текст виглядає машинним. Люди менш передбачувані: ми хапаємося за дивний прикметник, порушуємо правило чи формулюємо думку трохи незграбно, і кожен такий вибір штовхає перплексію вгору.
Конкретна пара робить це наочним. Речення перше: "Регулярні фізичні вправи важливі, бо вони покращують і фізичне, і психічне здоров'я." Речення друге: "Я продовжую тренуватися, бо коліна менше скаржаться, а поштова скринька після залу лякає не так сильно." Обидва граматичні і обидва кажуть по суті те саме, але перше зібране цілком зі слів, які мовна модель поставила б на перше місце за ймовірністю; фраза "регулярні фізичні вправи важливі, бо" є практично шаблоном. Друге трохи ризикує: коліна, що скаржаться, поштова скринька, що лякає. Модель, яка оцінює ймовірність слово за словом, вважає перше речення непримітним, а друге по-справжньому важким для передбачення, тож перше читається як ШІ, а друге як людина.
Саме тому відшліфоване, загальне письмо позначається, навіть коли кожне слово написала людина. Перплексія не вимірює зусилля чи чесність, лише передбачуваність, а деяке цілком людське письмо дуже передбачуване.
Берстовість: ритм справжнього письма
Берстовість вимірює варіативність структури і довжини речень. Люди пишуть сплесками: довге, звивисте речення, за ним коротке. Три слова. Потім складна конструкція, напхана деталями, яка тягнеться довше, ніж, мабуть, слід.
Вивід ШІ гладкіший. Залишена на стандартних налаштуваннях, модель продукує речення, що крутяться навколо однієї довжини, відкриваються схожими конструкціями і приземляються з однаковою рівною каденцією, абзац за абзацом. Покладіть їх поруч, і різницю часто видно ще до читання: людський текст на сторінці виглядає зубчастим, машинний як цегляна кладка.
Детектори кількісно вимірюють цю зубчастість. Низька берстовість плюс низька перплексія це класичний підпис ШІ, і коли присутні обидва, детектор стає впевненим, що текст згенеровано, навіть якщо тема і граматика бездоганні. Утім кожен сигнал окремо слабкий. Поет пише з дикою берстовістю, а юрист із контрактів майже без неї, і обидва люди, тому серйозні інструменти завжди комбінують обидва сигнали.
Ймовірність токенів під капотом
Мовні моделі пишуть по одному токену за раз, і кожен токен має оцінку ймовірності. Детектори наближено відтворюють ці ймовірності і перевіряють, чи сидить ваш текст усередині "зони комфорту" ймовірних виборів моделі. Коли фрагмент побудований майже повністю з високоймовірних токенів, розставлених у рівному ритмі, він збігається з тим, як за замовчуванням генерують ChatGPT, Gemini і Claude, і детектор перетворює цей патерн на відсоток, який ви бачите.
Це також пояснює, чому короткі уривки тестувати ненадійно. З одним-двома реченнями сигналу замало, щоб відрізнити уважну людину від моделі, тож оцінки дико гойдаються. Більшість вендорів мовчки з цим погоджується: кілька з них відмовляються оцінювати будь-що коротше за кілька сотень слів, бо нижче цієї довжини математика ближча до підкидання монети, ніж до вимірювання.
Статистичні детектори проти детекторів-класифікаторів
Інструменти детекції діляться на дві родини, і знання того, з якою ви маєте справу, пояснює багато дивних результатів. Статистичні детектори використовують еталонну мовну модель для прямого обчислення ймовірностей: вони проганяють ваш текст через модель, вимірюють перплексію, берстовість і суміжні величини, а потім застосовують поріг. Так працюють дослідницькі методи на кшталт GLTR і DetectGPT, а також скоринг за багатьма безкоштовними чекерами. Їхня сила в тому, що їм не потрібні розмічені навчальні дані; слабкість у тому, що вердикт сильно залежить від того, яка еталонна модель виконує оцінювання.
Детектори-класифікатори натомість навчаються. Вендор збирає великі корпуси підтверджено людського і підтверджено ШІ-тексту, а потім донавчає модель, часто трансформер типу RoBERTa, розрізняти їх. Так побудовані Turnitin, Originality.ai і Copyleaks. Класифікатори вловлюють тонкі ознаки поза сирою перплексією, тож зазвичай точніші на тексті, схожому на їхні навчальні дані, але деградують на письмі новіших моделей, іншими мовами чи в доменах, яких ніколи не бачили, і ніхто поза вендором не може зазирнути в те, чого вони насправді навчилися.
Більшість комерційних продуктів тепер є гібридами обох підходів, і це одна з причин, чому їхні оцінки важко інтерпретувати і ще важче порівнювати між інструментами.
Чому вивід ChatGPT, Gemini і Claude позначається
Передові моделі навчають бути ясними, безпечними і плавними, а фінальний раунд цього навчання винагороджує відповіді, які більшість рецензентів оцінює як добре написані. Це штовхає вивід до збалансованих речень, охайних переходів на кшталт "більше того" та "на завершення" і лексики, що тримається статистичної середини дороги.
Саме на ці якості полюють детектори. Що відшліфованіше і "середніше" письмо, то нижчі його перплексія і берстовість і то вища оцінка ШІ. За іронією, сирі людські чернетки, повні одруків і дивацтв, часто проходять легше, ніж чиста перша ШІ-чернетка, бо саме вади несуть людський сигнал.
Що насправді перевіряють GPTZero, Turnitin, ZeroGPT та інші
Головні інструменти поділяють одну базову логіку, але налаштовують її по-різному. GPTZero популяризував оцінювання перплексії та берстовості і звітує про обидві на рівні речень. Turnitin AI вбудовує детекцію у свій антиплагіатний пакет для навчальних закладів, розбиваючи документи на сегменти, що перекриваються, і позначаючи ті, які його класифікатор вважає написаними моделлю.
ZeroGPT пропонує швидку безкоштовну розбивку по реченнях, тоді як Originality.ai цілиться у видавців і SEO-команди зі строгою, зваженою за впевненістю оцінкою. Copyleaks наголошує на багатомовному покритті та корпоративній звітності. Усі вони ймовірнісні, тому жоден не може чесно претендувати на ідеальність, а маркетинг точності кожного вендора тихо описує тести, які цей вендор сам і спроєктував.
Чому детектори не погоджуються один з одним
Вставте те саме есе у три детектори, і ви можете отримати 2% ШІ від одного, 45% від другого і 88% від третього. Цей розкид не баг котрогось із них; це те, що трапляється, коли різні системи роблять різні здогади з однакових доказів.
Кожен інструмент навчений на власному корпусі, оцінює власною еталонною моделлю, по-різному ріже текст (цілим документом чи речення за реченням) і встановлює власний поріг того, що вважати "ймовірно ШІ". Інструмент, відкалібрований уникати хибних звинувачень, працюватиме консервативно і недопозначатиме; інструмент, який продають як ловця шахраїв, працюватиме агресивно і перепозначатиме той самий текст. Вони ще й оновлюються за різними графіками, тож детектор, налаштований до запуску нової моделі, місяцями хибно оцінюватиме її стиль.
Практичний висновок: жодна окрема оцінка не є остаточною, а розбіжності між інструментами є прямим свідченням того, скільки тут вгадування. Якщо ваш заклад перевіряє через Turnitin, важить лише вердикт Turnitin, і чиста оцінка деінде його не передбачає і від нього не захищає.
Хибні спрацьовування: опубліковані цифри
Оскільки детектори судять про передбачуваність, вони регулярно схиблюють, і ці промахи не гіпотетичні. Власний класифікатор OpenAI, запущений у січні 2023 року, розпізнавав лише 26% написаного ШІ тексту, водночас хибно позначаючи 9% людського тексту як ШІ, і компанія прибрала його за пів року через низьку точність. Turnitin заявляє про частку хибних спрацьовувань на рівні документа нижче 1%, але визнав, що окремі позначені речення значно менш надійні, і саме тому він приховує оцінки на документах із лише невеликою кількістю підозрюваного ШІ-тексту.
Найтривожніший результат стосується тих, для кого англійська не рідна. Дослідники зі Стенфорда протестували сім популярних детекторів на есе, написаних реальними студентами для іспиту TOEFL, і виявили, що в середньому 61% цих людських есе було позначено як згенеровані ШІ, і майже кожне з них позначив принаймні один детектор. Есе носіїв мови зі США пройшли ті самі інструменти майже неторканими.
Механізм саме той, що описує ця стаття: люди, які пишуть другою мовою, схильні до безпечнішої лексики та регулярніших конструкцій, що знижує перплексію, що читається як машинний текст. Упередження вшите в сам метод. Ось чому відповідальні заклади ставляться до оцінки детектора як до початку розмови, а не як до доказу. Число не є доказом.
Водяні знаки: рішення, яке так і не відвантажили
Дослідники давно стверджують, що справжнім рішенням є водяні знаки: сама модель ШІ вбудовує невидимий статистичний підпис у момент генерації. У найвідомішій схемі модель під час письма потай надає перевагу ротованому "зеленому списку" токенів. Читач не помітить патерн, але детектор із ключем може перевірити його з набагато кращою точністю, ніж вгадування за перплексією.
Здебільшого це так і не відвантажили. OpenAI створила текстовий вотермаркер, який, за внутрішніми звітами, ефективний приблизно на 99,9% на довгих фрагментах, і поклала його в шухляду, посилаючись на побоювання, що перефразування чи переклад знімають мітку, що вона може стигматизувати людей з іншою рідною мовою, які легітимно користуються ШІ для шліфування, і, менш шляхетно, що користувачі просто перейдуть на інструменти без водяних знаків. SynthID-Text від Google є винятком: він працює всередині Gemini і випущений з відкритим кодом, але мітить лише власний вивід Gemini.
У цьому й корінь проблеми: водяний знак покриває лише моделі, чиї творці співпрацюють, а моделі з відкритими вагами, які будь-хто може запустити локально, ніколи його не нестимуть. Тож детектор, яким сьогодні користується ваш заклад чи роботодавець, досі займається статистикою, а не читанням водяних знаків, з усією непевністю, яку це передбачає.
Як детектори обробляють змішаний людський і ШІ-текст
Реальні документи рідко бувають однорідними. Студент пише вступ від руки, просить ChatGPT розгорнути два абзаци основної частини, а потім редагує все разом. Детектори дають цьому раду, просуваючи ковзне вікно по документу, оцінюючи кожне речення чи сегмент окремо і підсвічуючи ділянки, що виглядають згенерованими.
Змішування послаблює кожен сигнал. Людські правки всередині ШІ-абзацу підіймають його перплексію; ШІ-речення всередині людської секції тягнуть її ритм до одноманітності. Результатом є середня оцінка, яка може означати "наполовину ШІ" або "повністю людина, що дивно пише", а підсвітки окремих речень помітно менш надійні за загальне число. Turnitin, наприклад, казав, що його позначки на рівні речень мають вищу частоту помилок, ніж оцінка документа, і якийсь час він взагалі відмовлявся показувати низькі відсотки, настільки вони були хиткими.
Коротко: що змішаніший документ, то розмитіший вердикт, а підсвічені речення у звіті заслуговують навіть більшого скепсису, ніж заголовний відсоток.
Як гуманізація знижує оцінку
Якщо детектори винагороджують високу перплексію і берстовість, рішення полягає в тому, щоб писати більш по-людськи: варіювати довжину речень, обирати менш передбачувані слова, додавати природні переходи і ламати одноманітний ритм. Робити це вручну по всьому документу повільно, і саме тому існує ШІ-гуманізатор, який переписує текст і автоматично повертає цю людську варіативність.
Інструмент на кшталт Humanize AI перефразовує вивід моделі так, щоб він знову отримав природну берстовість і менш передбачувані формулювання, допомагаючи обійти детекцію ШІ зі збереженням вашого змісту. Що важливо, він показує оцінку до і після від реальних детекторів, тож ви вимірюєте зміну, а не сподіваєтеся. Мета не обман, а текст, який нарешті звучить як ви.
Що це означає для вас на практиці
Кілька звичок випливають прямо з того, як працює ця технологія. Тестуйте перед здачею, бо вгадувати оцінку безглуздо, коли перевірка безкоштовна; ви можете прогнати чернетку через безкоштовний ШІ-гуманізатор і побачити цифри детекторів раніше за будь-кого іншого. Ніколи не довіряйте вердикту на короткому фрагменті і сприймайте підсвітки окремих речень щонайбільше як слабкий доказ.
Якщо ви пишете чесно, зберігайте квитанції: версії чернеток, нотатки та історія редагування є набагато кращим доказом авторства, ніж будь-яка контроцінка, особливо якщо ви пишете нерідною мовою у формальному регістрі, до якого детектори ставляться з недовірою. А якщо ви маєте справу з конкретним чекером, вивчіть його конкретну поведінку; у Turnitin зокрема є особливості, які варто знати, і саме тому ми написали посібник із Turnitin як супутній до цього.
Понад усе пам'ятайте, чим є детектор. Це зіставлювач патернів, що оцінює передбачуваність, створений вендором, налаштований на певний поріг і помиляється з вимірюваною частотою в обидва боки. Корисний? Інколи. Доказ? Ніколи.
Поширені запитання
Наскільки точні детектори ШІ насправді?
Менш точні, ніж підказує їхній маркетинг. OpenAI прибрала власний детектор після того, як він зловив лише 26% ШІ-тексту, водночас позначивши 9% людського, а незалежні тести регулярно знаходять двозначні частки помилок на перефразованому чи відредагованому тексті. Найкращі інструменти на довгому невідредагованому виводі ШІ справді значно кращі за підкидання монети, але кожна оцінка є оцінкою ймовірності, а не перевіреним фактом.
Чи може детектор ШІ довести, що я використовував ChatGPT?
Ні. Детектори вимірюють, наскільки статистично передбачуване ваше письмо; вони не можуть перевірити, хто його набрав, і схиблюють в обидва боки із задокументованою частотою. Оцінка це здогад у формі звинувачення. Якщо ви написали роботу самі, чернетки, плани та історія версій є справжнім доказом у той спосіб, у який контроцінка з іншого детектора ним не є.
Чому два детектори дають зовсім різні оцінки на одному тексті?
Бо це різні вгадувачі. Кожен інструмент навчається на власних даних, оцінює власною еталонною моделлю, по-різному ріже текст і встановлює власний поріг для того, щоб назвати щось ШІ. Консервативний інструмент недопозначає, а агресивний перепозначає той самий абзац. Розбіжності між детекторами нормальні, і це добре нагадування про те, скільки непевності стоїть за кожним відсотком.
Чи працюють детектори ШІ на короткому тексті?
Погано. Перплексії та берстовості потрібно достатньо слів, щоб сформувати патерн, а одне-два речення просто не містять достатньо сигналу. Оцінки на уривках дико гойдаються, і саме тому кілька вендорів відмовляються оцінювати будь-що коротше за кілька сотень слів. Ставтеся до будь-якого вердикту на короткому фрагменті, включно з одним підсвіченим реченням у довшому звіті, з великим скепсисом.
Чи можу я знизити оцінку детекції ШІ, не змінюючи зміст?
Так, бо детектори оцінюють стиль, а не суть. Варіювання довжини речень, заміна статистично безпечних формулювань на конкретніші слова і ламання одноманітного ритму підіймають перплексію та берстовість, залишаючи ваш аргумент недоторканим. Саме це автоматизує безкоштовний ШІ-гуманізатор, і він показує оцінки детекторів до і після, щоб ви могли самі підтвердити падіння.
Спробуйте безкоштовний гуманізатор ШІ
Вставте текст і за секунди побачите оцінку ШІ до і після. Без реєстрації, працює будь-якою мовою.
Гуманізувати текст