Ako AI detektory naozaj fungujú (a prečo vás označia)
Zakaždým, keď nástroj ako GPTZero alebo Turnitin označí vaše písanie ako "generované AI", vykonáva štatistický odhad, nie test na detektore lži. Pochopenie toho, ako AI detektory fungujú, je prvý krok k písaniu textu, ktorý sa číta ako skutočne ľudský.
Čo AI detektor v skutočnosti meria
AI detektor nevie, kto vetu napísal. Váš dokument nikdy predtým nevidel a nemôže ho porovnať so skrytou databázou výstupov ChatGPT. Namiesto toho hodnotí, aký predvídateľný je váš text v porovnaní so vzorcami, ktoré veľké jazykové modely zvyknú produkovať.
Moderné detektory sú samy osebe modely strojového učenia vytrénované na miliónoch ľudských a AI pasáží. Hľadajú štatistické odtlačky, ktoré po sebe generovanie zanecháva, a potom vydajú pravdepodobnosť. Nič v tomto procese neoveruje autorstvo. Detektor nevidí vašu históriu prehliadača ani vás nesleduje pri písaní; dokáže len povedať, že váš text sa podobá, alebo nepodobá, na strojové písanie, na ktorom bol trénovaný.
Predstavte si to ako spamový filter. Naučil sa, ako zvyčajne vyzerá nevyžiadaná pošta, takže označuje správy, ktoré zdieľajú tie znaky, ale pri žiadnom jednotlivom e-maile si nemôže byť istý. Detekcia AI funguje rovnako, čo znamená, že každé skóre je tušenie oblečené do čísla. To mení aj to, ako by ste mali výsledok čítať: "85 % AI" neznamená, že 85 % vášho textu napísal stroj. Znamená to, že detektor si je svojím odhadom pomerne istý.
Perplexita: aké prekvapivé sú vaše slová
Perplexita je jediný najdôležitejší signál. Meria, ako veľmi jazykový model prekvapí každé slovo, ktoré ste zvolili. Ak je každé ďalšie slovo presne to, ktoré by model predpovedal, perplexita je nízka a text vyzerá strojovo. Ľudia sú menej predvídateľní: siahneme po zvláštnom prídavnom mene, porušíme pravidlo alebo niečo sformulujeme trochu neohrabane a každá z týchto volieb perplexitu zvyšuje.
Konkrétna dvojica to zviditeľní. Veta jeden: "Pravidelné cvičenie je dôležité, pretože zlepšuje fyzické aj duševné zdravie." Veta dva: "Cvičím ďalej, lebo kolená sa sťažujú menej a e-mailová schránka po tréningu pôsobí menej desivo." Obe sú gramaticky správne a obe hovoria v podstate to isté, ale prvá je poskladaná výlučne zo slov, ktoré by jazykový model zaradil ako najpravdepodobnejšiu ďalšiu voľbu; "pravidelné cvičenie je dôležité, pretože" je prakticky šablóna. Druhá podstupuje malé riziká: kolená, ktoré sa sťažujú, schránka, ktorá desí. Model hodnotiaci pravdepodobnosť slovo po slove považuje prvú vetu za neprekvapivú a druhú za skutočne ťažko predvídateľnú, takže prvá sa číta ako AI a druhá ako človek.
Toto je aj dôvod, prečo uhladené, generické písanie dostáva označenie, aj keď každé slovo napísal človek. Perplexita nemeria úsilie ani poctivosť, iba predvídateľnosť, a niektoré dokonale ľudské písanie je veľmi predvídateľné.
Burstiness: rytmus skutočného písania
Burstiness meria variabilitu štruktúry a dĺžky viet. Ľudia píšu v nárazoch: dlhá, kľukatá veta nasledovaná krátkou. Tri slová. Potom zložité súvetie nabité detailmi, ktoré sa tiahne dlhšie, než by asi malo.
AI výstup je hladší. Ponechaný na predvolených nastaveniach model produkuje vety, ktoré sa držia okolo rovnakej dĺžky, začínajú podobnými konštrukciami a dopadajú s rovnakou rovnomernou kadenciou, odsek za odsekom. Položte ich vedľa seba a rozdiel často zbadáte skôr, než prečítate jediné slovo: ľudský text vyzerá na stránke zubato, strojový text vyzerá ako murivo.
Detektory túto zubatosť kvantifikujú. Nízka burstiness plus nízka perplexita je klasický podpis AI, a keď sú prítomné obe, detektor nadobúda istotu, že text bol generovaný, aj keď téma a gramatika sú bezchybné. Každý signál sám osebe je však slabý. Básnik píše s divokou burstiness a zmluvný právnik takmer bez nej, a obaja sú ľudia, preto seriózne nástroje vždy kombinujú oba signály.
Pravdepodobnosť tokenov pod kapotou
Jazykové modely píšu token po tokene a každý token prichádza so skóre pravdepodobnosti. Detektory tieto pravdepodobnosti aproximujú a kontrolujú, či váš text sedí v "komfortnej zóne" pravdepodobných volieb modelu. Keď je pasáž postavená takmer výlučne z vysoko pravdepodobných tokenov usporiadaných v rovnomernom rytme, zodpovedá tomu, ako ChatGPT, Gemini a Claude predvolene generujú, a detektor tento vzorec premení na percento, ktoré vidíte.
To tiež vysvetľuje, prečo sú krátke úryvky na testovanie nespoľahlivé. Pri jednej či dvoch vetách nie je dosť signálu na odlíšenie starostlivého človeka od modelu, takže skóre divoko kolíše. Väčšina výrobcov s tým potichu súhlasí: viacerí odmietajú hodnotiť čokoľvek pod niekoľko stoviek slov, pretože pod touto dĺžkou je matematika bližšie k hodu mincou než k meraniu.
Štatistické detektory vs. detektory založené na klasifikátoroch
Detekčné nástroje sa delia na dve rodiny a vedieť, ktorej čelíte, vysvetľuje veľa zvláštnych výsledkov. Štatistické detektory používajú referenčný jazykový model na priamy výpočet pravdepodobností: prepustia váš text modelom, zmerajú perplexitu, burstiness a súvisiace veličiny a potom aplikujú prah. Takto fungujú výskumné metódy ako GLTR a DetectGPT a rovnako aj skórovanie za mnohými bezplatnými kontrolórmi. Ich silou je, že nepotrebujú označkované trénovacie dáta; ich slabinou je, že verdikt silne závisí od toho, ktorý referenčný model skórovanie vykonáva.
Detektory založené na klasifikátoroch sú naopak trénované. Výrobca zozbiera veľké korpusy známeho ľudského a známeho AI textu a potom doladí model, často transformer v štýle RoBERTa, aby ich od seba rozlíšil. Takto sú postavené Turnitin, Originality.ai a Copyleaks. Klasifikátory zachytávajú jemné signály nad rámec surovej perplexity, takže bývajú presnejšie na texte podobnom ich trénovacím dátam, ale strácajú na písaní z novších modelov, iných jazykov alebo domén, ktoré nikdy nevideli, a nikto mimo výrobcu nemôže preskúmať, čo sa v skutočnosti naučili.
Väčšina komerčných produktov je dnes hybridom oboch prístupov, čo je jeden z dôvodov, prečo sa ich skóre ťažko interpretuje a ešte ťažšie porovnáva medzi nástrojmi.
Prečo býva výstup z ChatGPT, Gemini a Claude označený
Špičkové modely sú trénované tak, aby boli jasné, bezpečné a plynulé, a záverečné kolo tohto tréningu odmeňuje odpovede, ktoré väčšina hodnotiteľov považuje za dobre napísané. To tlačí výstup k vyváženým vetám, úhľadným prechodom ako "navyše" a "na záver" a slovnej zásobe, ktorá sa drží štatistického stredu cesty.
Presne tieto vlastnosti detektory lovia. Čím uhladenejšie a "priemernejšie" je písanie, tým nižšia je jeho perplexita a burstiness a tým vyššie AI skóre. Ironicky, surové ľudské koncepty plné preklepov a zvláštností často prechádzajú ľahšie než čistý prvý koncept od AI, pretože práve nedostatky nesú ľudský signál.
Čo GPTZero, Turnitin, ZeroGPT a ďalšie v skutočnosti kontrolujú
Hlavné nástroje zdieľajú rovnakú základnú logiku, ale ladia ju odlišne. GPTZero spopularizoval skórovanie perplexity a burstiness a oboje reportuje na úrovni viet. Turnitin AI integruje detekciu do svojho antiplagiátorského balíka pre školy, rozdeľuje dokumenty na prekrývajúce sa segmenty a označuje tie, o ktorých sa jeho klasifikátor domnieva, že sú napísané modelom.
ZeroGPT ponúka rýchly, bezplatný výpis po vetách, zatiaľ čo Originality.ai cieli na vydavateľov a SEO tímy s prísnym skóre váženým podľa miery istoty. Copyleaks kladie dôraz na viacjazyčné pokrytie a podnikové reportovanie. Všetky sú pravdepodobnostné, a preto žiadny z nich nemôže úprimne tvrdiť, že je dokonalý, a preto marketing presnosti každého výrobcu potichu popisuje testy, ktoré si výrobca sám navrhol.
Prečo sa detektory navzájom nezhodujú
Vložte tú istú esej do troch detektorov a môžete dostať 2 % AI od jedného, 45 % od druhého a 88 % od tretieho. Tento rozptyl nie je chyba jedného z nich; je to to, čo sa stane, keď rôzne systémy robia rôzne odhady z rovnakých dôkazov.
Každý nástroj je trénovaný na vlastnom korpuse, skóruje vlastným referenčným modelom, delí text inak (celý dokument verzus veta po vete) a nastavuje si vlastný prah pre to, čo sa počíta ako "pravdepodobne AI". Nástroj kalibrovaný na vyhýbanie sa falošným obvineniam bude konzervatívny a označí menej; nástroj predávaný na chytanie podvodníkov bude agresívny a ten istý text označí nadmerne. Aktualizujú sa aj v rôznych intervaloch, takže detektor ladený pred spustením nového modelu bude štýl toho modelu mesiace posudzovať nesprávne.
Praktické ponaučenie znie, že žiadne jednotlivé skóre nie je definitívne, a nezhoda medzi nástrojmi je priamym dôkazom toho, koľko hádania je v hre. Ak vaša škola kontroluje Turnitinom, záleží len na verdikte Turnitinu a čisté skóre inde ho nepredpovedá ani vás pred ním nechráni.
Falošne pozitívne výsledky: zverejnené čísla
Pretože detektory posudzujú predvídateľnosť, pravidelne sa mýlia a tieto omyly nie sú hypotetické. Vlastný klasifikátor OpenAI, spustený v januári 2023, identifikoval len 26 % textu napísaného AI, pričom 9 % ľudského textu nesprávne označil ako AI, a spoločnosť ho pre nízku presnosť do šiestich mesiacov stiahla. Turnitin tvrdí, že miera falošne pozitívnych výsledkov na úrovni dokumentu je pod 1 %, ale priznal, že jednotlivé označené vety sú oveľa menej spoľahlivé, a preto zadržiava skóre pri dokumentoch s len malým množstvom podozrivého AI textu.
Najznepokojujúcejšie zistenie sa týka ľudí, pre ktorých angličtina nie je materinský jazyk. Výskumníci zo Stanfordu otestovali sedem populárnych detektorov na esejach, ktoré napísali skutoční študenti na skúšku TOEFL, a zistili, že v priemere 61 % týchto ľudsky napísaných esejí bolo označených ako generované AI a takmer všetky boli označené aspoň jedným detektorom. Eseje rodených hovoriacich z amerických škôl prešli tými istými nástrojmi takmer nedotknuté.
Mechanizmus je presne ten, ktorý tento článok popisuje: pisatelia pracujúci v druhom jazyku zvyknú používať bezpečnejšiu slovnú zásobu a pravidelnejšie vetné štruktúry, čo znižuje perplexitu, čo sa číta ako strojový text. Zaujatosť je zabudovaná do samotnej metódy. Preto zodpovedné školy berú skóre detektora ako začiatok rozhovoru, nie ako dôkaz. Číslo nie je dôkaz.
Vodoznaky: riešenie, ktoré sa nedostalo do praxe
Výskumníci dlho tvrdili, že skutočným riešením je vodoznakovanie: aby samotný AI model pri generovaní vložil neviditeľný štatistický podpis. V najznámejšej schéme model pri písaní tajne uprednostňuje rotujúci "zelený zoznam" tokenov. Čitateľ si vzorec nevšimne, ale detektor s kľúčom ho dokáže otestovať s oveľa lepšou presnosťou než hádanie z perplexity.
Väčšinou sa to do praxe nedostalo. OpenAI postavila textový vodoznak, ktorý bol podľa interných správ na dlhých pasážach účinný na približne 99,9 %, a sedí na ňom s odvolaním sa na obavy, že parafrázovanie alebo preklad značku odstráni, že by mohol stigmatizovať nerodených hovoriacich, ktorí AI legitímne používajú na vylepšenie textu, a, menej ušľachtilo, že by používatelia jednoducho prešli k nástrojom, ktoré vodoznak nevkladajú. Výnimkou je SynthID-Text od Googlu, ktorý beží v Gemini a bol uvoľnený ako open source, ale označuje len výstup samotného Gemini.
A to je jadro problému: vodoznak pokrýva len modely, ktorých tvorcovia spolupracujú, a modely s otvorenými váhami, ktoré si ktokoľvek spustí lokálne, ho nikdy niesť nebudú. Takže detektor, ktorý dnes používa vaša škola alebo zamestnávateľ, stále robí štatistiku, nečíta vodoznaky, so všetkou neistotou, ktorá z toho plynie.
Ako si detektory poradia so zmiešaným ľudským a AI textom
Skutočné dokumenty sú málokedy len jedno alebo druhé. Študent napíše úvod ručne, požiada ChatGPT o rozšírenie dvoch odsekov jadra a potom celok upraví. Detektory to riešia posúvaním okna po dokumente, hodnotením každej vety alebo segmentu samostatne a zvýrazňovaním úsekov, ktoré vyzerajú generované.
Miešanie oslabuje každý signál. Ľudské úpravy vo vnútri AI odseku zvyšujú jeho perplexitu; AI vety v ľudskej časti ťahajú jej rytmus k uniformite. Výsledkom je stredné skóre, ktoré môže znamenať "napoly AI" alebo "celé ľudské, zvláštne napísané", a zvýraznenia po vetách sú citeľne menej spoľahlivé než celkové číslo. Turnitin napríklad uviedol, že jeho označenia na úrovni viet majú vyššiu chybovosť než skóre dokumentu, a istý čas odmietal nízke percentá zobrazovať vôbec, pretože boli také vratké.
Skrátka: čím zmiešanejší dokument, tým rozmazanejší verdikt, a zvýraznené vety v správe si zaslúžia ešte viac skepticizmu než titulné percento.
Ako humanizácia znižuje skóre
Ak detektory odmeňujú vysokú perplexitu a burstiness, riešením je písať viac ako človek: striedať dĺžky viet, používať menej predvídateľné voľby slov, pridávať prirodzené prechody a lámať uniformný rytmus. Robiť to ručne v celom dokumente je pomalé, a preto existuje AI humanizér, ktorý text prepíše a obnoví ľudskú variabilitu automaticky.
Nástroj ako Humanize AI preformuluje výstup modelu tak, aby znovu získal prirodzenú burstiness a menej predvídateľné formulácie, čo mu pomáha obísť detekciu AI a zároveň zachovať váš význam. Zásadné je, že ukazuje skóre pred a po zo skutočných detektorov, takže zmenu meriate, nie v ňu dúfate. Cieľom nie je klamať, ale písať tak, aby text konečne znel ako vy.
Čo to pre vás znamená v praxi
Z fungovania technológie priamo vyplýva niekoľko návykov. Testujte pred odovzdaním, pretože hádať skóre je zbytočné, keď je kontrola zadarmo; svoj koncept môžete prehnať cez bezplatný AI humanizér a vidieť čísla detektorov skôr než ktokoľvek iný. Nikdy neverte verdiktu nad krátkou pasážou a zvýraznenia na úrovni viet berte prinajlepšom ako slabý dôkaz.
Ak píšete poctivo, uchovávajte si dôkazy: verzie konceptov, poznámky a história úprav sú oveľa lepší dôkaz autorstva než akékoľvek protiskóre, najmä ak ste nerodený hovoriaci píšuci vo formálnom registri, ktorému detektory nedôverujú. A ak čelíte konkrétnemu kontrolóru, naučte sa jeho konkrétne správanie; obzvlášť Turnitin má zvláštnosti, ktoré sa oplatí poznať, a preto sme ako spoločníka k tomuto článku napísali sprievodcu Turnitinom.
Predovšetkým si pamätajte, čo detektor je. Je to porovnávač vzorcov skórujúci predvídateľnosť, postavený výrobcom, naladený na prah a mýliaci sa merateľnou mierou oboma smermi. Užitočný, niekedy. Dôkaz, nikdy.
Často kladené otázky
Aké presné sú AI detektory v skutočnosti?
Menej presné, než naznačuje ich marketing. OpenAI stiahla vlastný detektor po tom, čo zachytil len 26 % AI textu a zároveň označil 9 % ľudského textu, a nezávislé testy bežne nachádzajú dvojcifernú chybovosť pri parafrázovanom alebo upravenom texte. Najlepšie nástroje na dlhom, neupravenom AI výstupe porážajú hod mincou s veľkým náskokom, ale každé skóre je odhad pravdepodobnosti, nie overený fakt.
Môže AI detektor dokázať, že som použil ChatGPT?
Nie. Detektory merajú, aké štatisticky predvídateľné je vaše písanie; nedokážu overiť, kto ho napísal, a mýlia sa oboma smermi v zdokumentovanej miere. Skóre je odhad v tvare obvinenia. Ak ste prácu napísali sami, koncepty, osnovy a história verzií sú skutočný dôkaz spôsobom, akým protiskóre z iného detektora nie je.
Prečo dva detektory dávajú na ten istý text úplne odlišné skóre?
Pretože sú to rôzni hádači. Každý nástroj trénuje na vlastných dátach, skóruje vlastným referenčným modelom, delí text inak a nastavuje si vlastný prah pre to, čo nazve AI. Konzervatívny nástroj ten istý odsek označí nedostatočne a agresívny nadmerne. Nezhoda medzi detektormi je normálna a je dobrou pripomienkou, koľko neistoty sedí za každým percentom.
Fungujú AI detektory na krátkom texte?
Zle. Perplexita a burstiness potrebujú dosť slov na vytvorenie vzorca a jedna či dve vety jednoducho neobsahujú dosť signálu. Skóre na úryvkoch divoko kolíše, a preto viacerí výrobcovia odmietajú hodnotiť čokoľvek pod niekoľko stoviek slov. Akýkoľvek verdikt nad krátkou pasážou, vrátane jedinej zvýraznenej vety v dlhšej správe, berte s veľkou skepsou.
Môžem znížiť skóre detekcie AI bez zmeny významu?
Áno, pretože detektory hodnotia štýl, nie podstatu. Striedanie dĺžky viet, nahradenie štatisticky bezpečných formulácií konkrétnejšími voľbami slov a lámanie uniformného rytmu zvyšujú perplexitu a burstiness a pritom nechávajú váš argument nedotknutý. Presne to automatizuje bezplatný AI humanizér a ukazuje skóre detektorov pred a po, takže si pokles môžete overiť sami.
Vyskúšajte bezplatný AI humanizer
Vložte text a v priebehu niekoľkých sekúnd uvidíte skóre AI pred a po. Bez prihlásenia, funguje v akomkoľvek jazyku.
Humanizovať text