Cara Pengesan AI Sebenarnya Berfungsi (dan Sebab Anda Ditandai)
Setiap kali alat seperti GPTZero atau Turnitin melabelkan tulisan anda sebagai "dijana AI," ia sedang membuat tekaan statistik, bukan ujian pengesan penipuan. Memahami cara pengesan AI berfungsi ialah langkah pertama untuk menulis teks yang benar-benar terbaca sebagai tulisan manusia.
Apa yang sebenarnya diukur oleh pengesan AI
Pengesan AI tidak tahu siapa yang menulis sesuatu ayat. Ia tidak pernah melihat dokumen anda sebelum ini, dan ia tidak boleh menyemaknya terhadap pangkalan data tersembunyi output ChatGPT. Sebaliknya, ia menskor sejauh mana teks anda boleh diramal berbanding corak yang cenderung dihasilkan oleh model bahasa besar.
Pengesan moden itu sendiri ialah model pembelajaran mesin yang dilatih dengan berjuta-juta petikan tulisan manusia dan AI. Ia mencari cap jari statistik yang ditinggalkan oleh proses penjanaan, kemudian mengeluarkan satu kebarangkalian. Tiada apa-apa dalam saluran itu yang mengesahkan kepengarangan. Pengesan tidak boleh melihat sejarah pelayar anda atau memerhati anda menaip; ia hanya boleh mengatakan bahawa teks anda menyerupai, atau tidak menyerupai, tulisan mesin yang menjadi bahan latihannya.
Anggaplah ia seperti penapis spam. Ia telah belajar rupa biasa mel sampah, jadi ia menandai mesej yang berkongsi ciri-ciri itu, tetapi ia tidak pernah boleh pasti tentang mana-mana satu e-mel. Pengesanan AI berfungsi dengan cara yang sama, yang bermakna setiap skor ialah sangkaan yang disolek menjadi angka. Ini juga mengubah cara anda patut membaca sesuatu keputusan: "85% AI" tidak bermakna 85% teks anda ditulis mesin. Ia bermakna pengesan itu agak yakin dengan satu tekaan.
Perplexity: sejauh mana perkataan anda mengejutkan
Perplexity ialah isyarat tunggal yang paling penting. Ia mengukur sejauh mana sesebuah model bahasa terkejut dengan setiap perkataan yang anda pilih. Jika setiap perkataan seterusnya adalah tepat seperti yang akan diramalkan model, perplexity adalah rendah, dan teks itu kelihatan seperti ditulis mesin. Manusia kurang boleh diramal: kita mencapai kata sifat yang ganjil, melanggar peraturan, atau menyusun sesuatu dengan cara yang sedikit janggal, dan setiap pilihan itu menolak perplexity naik.
Sepasang contoh konkrit menjelaskannya. Ayat pertama: "Senaman berkala adalah penting kerana ia meningkatkan kesihatan fizikal dan mental." Ayat kedua: "Saya terus bersenam kerana lutut saya kurang mengeluh dan peti masuk saya terasa kurang menakutkan selepas itu." Kedua-duanya gramatis dan membawa maksud asas yang sama, tetapi ayat pertama disusun sepenuhnya daripada perkataan yang akan disenaraikan model bahasa sebagai pilihan seterusnya yang paling berkemungkinan; "senaman berkala adalah penting kerana" boleh dikatakan satu templat. Ayat kedua mengambil risiko kecil: lutut yang mengeluh, peti masuk yang menakutkan. Model yang menilai kebarangkalian perkataan demi perkataan mendapati ayat pertama tidak mengejutkan dan ayat kedua benar-benar sukar diramal, jadi yang pertama terbaca sebagai AI dan yang kedua terbaca sebagai manusia.
Inilah juga sebabnya tulisan generik yang digilap turut ditandai walaupun setiap perkataannya ditulis oleh manusia. Perplexity tidak mengukur usaha atau kejujuran, hanya kebolehramalan, dan sesetengah tulisan manusia yang tulen memang sangat mudah diramal.
Burstiness: rentak tulisan sebenar
Burstiness mengukur variasi dalam struktur dan panjang ayat. Manusia menulis secara berombak: satu ayat panjang yang berliku diikuti satu ayat pendek. Tiga patah perkataan. Kemudian klausa kompleks yang sarat perincian dan berlarutan lebih panjang daripada yang sepatutnya.
Output AI lebih licin. Dibiarkan pada tetapan lalainya, model menghasilkan ayat yang panjangnya berlegar di takat yang sama, dibuka dengan binaan yang serupa, dan mendarat dengan kadens sekata yang sama, perenggan demi perenggan. Letakkan kedua-duanya bersebelahan dan anda sering dapat mengesan bezanya sebelum membaca sepatah perkataan pun: teks manusia kelihatan bergerigi di atas halaman, teks mesin kelihatan seperti susunan bata.
Pengesan mengukur kegerigian itu. Burstiness rendah ditambah perplexity rendah ialah tanda tangan klasik AI, dan apabila kedua-duanya hadir, pengesan menjadi yakin teks itu dijana, walaupun topik dan tatabahasanya sempurna. Namun setiap isyarat secara bersendirian adalah lemah. Seorang penyair menulis dengan burstiness yang liar dan seorang peguam kontrak dengan hampir tiada langsung, dan kedua-duanya manusia, sebab itulah alat yang serius sentiasa menggabungkan kedua-dua isyarat.
Kebarangkalian token di sebalik tabir
Model bahasa menulis satu token pada satu masa, dan setiap token datang dengan skor kebarangkalian. Pengesan menganggarkan kebarangkalian ini dan menyemak sama ada teks anda berada dalam "zon selesa" pilihan yang berkemungkinan bagi model itu. Apabila sesuatu petikan dibina hampir sepenuhnya daripada token berkebarangkalian tinggi yang disusun dalam rentak sekata, ia sepadan dengan cara ChatGPT, Gemini dan Claude menjana secara lalai, dan pengesan menukar corak itu kepada peratusan yang anda lihat.
Ini juga menjelaskan mengapa cebisan pendek tidak boleh diharap untuk diuji. Dengan hanya satu dua ayat, tidak ada cukup isyarat untuk membezakan manusia yang berhati-hati daripada model, jadi skor berayun dengan liar. Kebanyakan vendor diam-diam bersetuju: beberapa daripadanya enggan menskor apa-apa di bawah beberapa ratus perkataan, kerana di bawah panjang itu pengiraannya lebih hampir kepada lambungan syiling daripada satu pengukuran.
Pengesan statistik lawan pengesan berasaskan pengelas
Alat pengesanan terbahagi kepada dua keluarga, dan mengetahui yang mana satu anda hadapi menjelaskan banyak keputusan yang ganjil. Pengesan statistik menggunakan model bahasa rujukan untuk mengira kebarangkalian secara terus: ia menjalankan teks anda melalui model itu, mengukur perplexity, burstiness dan kuantiti berkaitan, kemudian menetapkan satu ambang. Kaedah penyelidikan seperti GLTR dan DetectGPT berfungsi begini, begitu juga penskoran di sebalik banyak penyemak percuma. Kekuatannya ialah ia tidak memerlukan data latihan berlabel; kelemahannya ialah keputusannya sangat bergantung pada model rujukan mana yang membuat penskoran.
Pengesan berasaskan pengelas pula dilatih. Vendor mengumpulkan korpus besar teks manusia dan teks AI yang telah disahkan, kemudian menala halus sebuah model, selalunya transformer gaya RoBERTa, untuk membezakan kedua-duanya. Turnitin, Originality.ai dan Copyleaks dibina begini. Pengelas menangkap petunjuk halus di luar perplexity mentah, jadi ia cenderung lebih tepat pada teks yang menyerupai data latihannya, tetapi prestasinya merosot pada tulisan daripada model yang lebih baharu, bahasa lain, atau domain yang tidak pernah dilihatnya, dan tiada sesiapa di luar vendor boleh memeriksa apa yang sebenarnya dipelajarinya.
Kebanyakan produk komersial kini merupakan hibrid kedua-dua pendekatan, dan itulah salah satu sebab skornya sukar ditafsir dan lebih sukar lagi dibandingkan antara alat.
Sebab output ChatGPT, Gemini dan Claude ditandai
Model terkehadapan dilatih untuk menjadi jelas, selamat dan fasih, dan pusingan akhir latihan itu memberi ganjaran kepada jawapan yang dinilai oleh kebanyakan penilai sebagai tulisan yang baik. Itu menolak output ke arah ayat yang seimbang, peralihan kemas seperti "tambahan pula" dan "kesimpulannya," serta kosa kata yang kekal di tengah-tengah jalan statistik.
Kualiti yang sama itulah tepatnya yang diburu oleh pengesan. Semakin digilap dan semakin "purata" sesuatu tulisan, semakin rendah perplexity dan burstiness-nya, dan semakin tinggi skor AI-nya. Ironinya, draf manusia mentah yang penuh kesilapan taip dan keanehan sering lulus lebih mudah daripada draf pertama AI yang bersih, kerana kecacatan itulah yang membawa isyarat manusia.
Apa yang sebenarnya disemak oleh GPTZero, Turnitin, ZeroGPT dan lain-lain
Alat-alat utama berkongsi logik teras yang sama tetapi menalanya secara berbeza. GPTZero mempopularkan penskoran perplexity dan burstiness dan melaporkan kedua-duanya pada peringkat ayat. Turnitin AI menyepadukan pengesanan ke dalam suite plagiarismenya untuk sekolah, memecahkan dokumen kepada segmen bertindih dan menandai bahagian yang dipercayai pengelasnya ditulis oleh model.
ZeroGPT menawarkan bacaan pantas dan percuma bagi setiap ayat, manakala Originality.ai menyasarkan penerbit dan pasukan SEO dengan skor ketat berwajaran keyakinan. Copyleaks menekankan liputan berbilang bahasa dan pelaporan peringkat perusahaan. Semuanya bersifat kebarangkalian, sebab itulah tiada satu pun boleh mendakwa dirinya sempurna secara jujur, dan pemasaran ketepatan setiap vendor secara senyap menggambarkan ujian yang direka oleh vendor itu sendiri.
Sebab pengesan tidak sependapat antara satu sama lain
Tampal esei yang sama ke dalam tiga pengesan dan anda boleh mendapat 2% AI daripada satu, 45% daripada yang lain, dan 88% daripada yang ketiga. Sebaran itu bukan pepijat pada salah satu daripadanya; itulah yang berlaku apabila sistem berbeza membuat tekaan berbeza daripada bukti yang sama.
Setiap alat dilatih pada korpusnya sendiri, menskor dengan model rujukannya sendiri, memenggal teks secara berbeza (keseluruhan dokumen berbanding ayat demi ayat), dan menetapkan ambangnya sendiri tentang apa yang dikira "berkemungkinan AI." Alat yang ditentukur untuk mengelakkan tuduhan palsu akan bersikap konservatif dan kurang menandai; alat yang dijual atas dasar menangkap penipu akan bersikap agresif dan berlebihan menandai teks yang sama. Alat-alat ini juga dikemas kini mengikut jadual berbeza, jadi pengesan yang ditala sebelum sesebuah model baharu dilancarkan akan salah menilai gaya model itu selama berbulan-bulan.
Pengajaran praktikalnya ialah tiada satu skor pun yang muktamad, dan percanggahan antara alat ialah bukti langsung betapa banyaknya tekaan yang terlibat. Jika sekolah anda menyemak dengan Turnitin, hanya keputusan Turnitin yang penting, dan skor bersih di tempat lain tidak meramalkan mahupun melindungi anda daripadanya.
Positif palsu: angka yang diterbitkan
Oleh sebab pengesan menilai kebolehramalan, ia kerap tersilap tembak, dan kesilapan itu bukan andaian semata-mata. Pengelas OpenAI sendiri, yang dilancarkan pada Januari 2023, hanya mengenal pasti 26% teks tulisan AI sambil salah melabel 9% teks manusia sebagai AI, dan syarikat itu menamatkannya dalam masa enam bulan kerana ketepatan yang rendah. Turnitin mendakwa kadar positif palsu peringkat dokumen di bawah 1%, tetapi telah mengakui bahawa ayat individu yang ditandai jauh kurang boleh dipercayai, sebab itulah ia menahan skor pada dokumen yang hanya mempunyai sedikit teks AI yang disyaki.
Penemuan yang paling membimbangkan melibatkan penutur bukan natif bahasa Inggeris. Penyelidik Stanford menguji tujuh pengesan popular pada esei yang ditulis oleh pelajar sebenar untuk peperiksaan TOEFL dan mendapati bahawa, secara purata, 61% daripada esei tulisan manusia ini ditandai sebagai dijana AI, dan hampir kesemuanya ditandai oleh sekurang-kurangnya satu pengesan. Esei oleh pelajar AS penutur natif melepasi alat yang sama hampir tanpa disentuh.
Mekanismenya adalah tepat seperti yang diterangkan artikel ini: penulis yang bekerja dalam bahasa kedua cenderung menggunakan kosa kata yang lebih selamat dan struktur ayat yang lebih teratur, yang merendahkan perplexity, yang terbaca sebagai teks mesin. Bias itu tertanam dalam kaedah itu sendiri. Inilah sebabnya sekolah yang bertanggungjawab melayan skor pengesan sebagai permulaan perbualan, bukan sebagai bukti. Angka bukanlah bukti.
Tera air: penyelesaian yang masih belum tiba
Penyelidik telah lama berhujah bahawa penyelesaian sebenar ialah tera air: model AI itu sendiri menanam tanda tangan statistik halimunan semasa penjanaan. Dalam skema yang paling terkenal, model itu secara rahsia mengutamakan "senarai hijau" token yang berputar semasa menulis. Pembaca tidak dapat menyedari coraknya, tetapi pengesan yang memegang kuncinya boleh mengujinya dengan ketepatan yang jauh lebih baik daripada tekaan perplexity.
Ia sebahagian besarnya belum dilancarkan. OpenAI membina penera air teks yang dilaporkan secara dalaman berkesan kira-kira 99.9% pada petikan panjang, dan terus menyimpannya, dengan alasan kebimbangan bahawa parafrasa atau terjemahan menanggalkan tanda itu, bahawa ia boleh menstigmakan penutur bukan natif yang menggunakan AI secara sah untuk menggilap tulisan, dan, dengan alasan yang kurang mulia, bahawa pengguna hanya akan beralih kepada alat yang tidak menera air. SynthID-Text daripada Google ialah pengecualian, berjalan di dalam Gemini dan dikeluarkan sebagai sumber terbuka, tetapi ia hanya menandai output Gemini sendiri.
Itulah masalah terasnya: tera air hanya meliputi model yang pembuatnya bekerjasama, dan model berpemberat terbuka yang boleh dijalankan sesiapa sahaja secara tempatan tidak akan sekali-kali membawanya. Jadi pengesan yang digunakan sekolah atau majikan anda hari ini masih membuat statistik, bukan membaca tera air, dengan segala ketidakpastian yang tersirat daripadanya.
Cara pengesan mengendalikan teks campuran manusia dan AI
Dokumen sebenar jarang seratus peratus satu jenis. Seorang pelajar merangka pendahuluan dengan tangan, meminta ChatGPT mengembangkan dua perenggan isi, kemudian menyunting keseluruhannya. Pengesan menangani ini dengan meluncurkan tetingkap merentasi dokumen, menskor setiap ayat atau segmen secara berasingan, dan menyerlahkan bahagian yang kelihatan seperti dijana.
Pencampuran melemahkan setiap isyarat. Suntingan manusia dalam perenggan AI menaikkan perplexity-nya; ayat AI dalam bahagian manusia menarik rentaknya ke arah keseragaman. Hasilnya ialah skor pertengahan yang boleh bermaksud "separuh AI" atau "semuanya manusia, cuma gaya tulisannya ganjil," dan penyerlahan setiap ayat jelas kurang boleh dipercayai berbanding angka keseluruhan. Turnitin, contohnya, pernah menyatakan penanda peringkat ayatnya membawa kadar ralat lebih tinggi daripada skor dokumennya, dan buat suatu tempoh ia langsung enggan memaparkan peratusan rendah kerana terlalu goyah.
Ringkasnya: semakin bercampur sesuatu dokumen, semakin kabur keputusannya, dan ayat yang diserlahkan dalam laporan patut menerima keraguan yang lebih besar daripada peratusan utamanya.
Cara penginsanan teks menurunkan skor
Jika pengesan memberi ganjaran kepada perplexity dan burstiness yang tinggi, penyelesaiannya ialah menulis dengan lebih menyerupai manusia: pelbagaikan panjang ayat, gunakan pilihan perkataan yang kurang boleh diramal, tambah peralihan semula jadi, dan pecahkan rentak yang seragam. Melakukannya dengan tangan merentasi keseluruhan dokumen adalah lambat, sebab itulah AI humanizer wujud untuk menulis semula teks dan memulihkan variasi manusia itu secara automatik.
Alat seperti Humanize AI menyusun semula frasa output model supaya ia mendapat kembali burstiness semula jadi dan frasa yang kurang boleh diramal, membantunya memintas pengesanan AI sambil mengekalkan makna anda. Paling penting, ia menunjukkan skor sebelum dan selepas daripada pengesan sebenar, jadi anda mengukur perubahan itu dan bukannya sekadar berharap. Matlamatnya bukan penipuan tetapi tulisan yang akhirnya berbunyi seperti anda.
Maksudnya untuk anda dalam amalan
Beberapa tabiat terhasil terus daripada cara teknologi ini berfungsi. Uji sebelum anda hantar, kerana meneka skor adalah sia-sia apabila menyemaknya percuma; anda boleh menjalankan draf anda melalui AI humanizer percuma dan melihat angka pengesan sebelum orang lain melihatnya. Jangan sekali-kali mempercayai keputusan pada petikan pendek, dan anggap penyerlahan peringkat ayat sebagai bukti yang lemah, paling baik pun.
Jika anda menulis dengan jujur, simpan segala rekod anda: versi draf, nota dan sejarah suntingan adalah bukti kepengarangan yang jauh lebih baik daripada mana-mana skor balas, terutamanya jika anda penutur bukan natif yang menulis dalam laras formal yang tidak dipercayai pengesan. Dan jika anda berhadapan dengan penyemak tertentu, pelajari kelakuan khususnya; Turnitin khususnya mempunyai keanehan yang patut diketahui, sebab itulah kami menulis panduan Turnitin sebagai teman kepada artikel ini.
Atas segalanya, ingat apa itu pengesan. Ia pemadan corak yang menskor kebolehramalan, dibina oleh vendor, ditala kepada satu ambang, dan silap pada kadar yang boleh diukur dalam kedua-dua arah. Berguna, kadangkala. Bukti, tidak sekali-kali.
Soalan lazim
Sejauh mana sebenarnya ketepatan pengesan AI?
Kurang tepat daripada yang dicanangkan oleh pemasarannya. OpenAI menamatkan pengesannya sendiri selepas ia hanya menangkap 26% teks AI sambil menandai 9% teks manusia, dan ujian bebas kerap menemui kadar ralat dua digit pada teks yang diparafrasa atau disunting. Alat terbaik memang mengatasi lambungan syiling dengan margin besar pada output AI yang panjang dan tidak disunting, tetapi setiap skor ialah anggaran kebarangkalian, bukan fakta yang disahkan.
Bolehkah pengesan AI membuktikan saya menggunakan ChatGPT?
Tidak. Pengesan mengukur sejauh mana tulisan anda boleh diramal secara statistik; ia tidak boleh mengesahkan siapa yang menaipnya, dan ia tersilap dalam kedua-dua arah pada kadar yang didokumenkan. Skor ialah tekaan yang berbentuk tuduhan. Jika anda menulis kerja itu sendiri, draf, rangka dan sejarah versi ialah bukti sebenar dengan cara yang tidak dapat ditandingi oleh skor balas daripada pengesan lain.
Mengapa dua pengesan memberikan skor yang sama sekali berbeza pada teks yang sama?
Kerana ia peneka yang berbeza. Setiap alat dilatih dengan datanya sendiri, menskor dengan model rujukannya sendiri, memenggal teks secara berbeza, dan menetapkan ambangnya sendiri untuk melabel sesuatu sebagai AI. Alat yang konservatif kurang menandai dan alat yang agresif berlebihan menandai perenggan yang sama. Percanggahan antara pengesan adalah normal, dan ia peringatan yang baik tentang betapa banyaknya ketidakpastian di sebalik setiap peratusan.
Adakah pengesan AI berfungsi pada teks pendek?
Kurang baik. Perplexity dan burstiness memerlukan perkataan yang mencukupi untuk membentuk corak, dan satu dua ayat langsung tidak mengandungi isyarat yang cukup. Skor pada cebisan pendek berayun liar, sebab itulah beberapa vendor enggan menskor apa-apa di bawah beberapa ratus perkataan. Anggap sebarang keputusan pada petikan pendek, termasuk satu ayat yang diserlahkan dalam laporan yang lebih panjang, dengan keraguan yang berat.
Bolehkah saya menurunkan skor pengesanan AI tanpa mengubah makna tulisan saya?
Ya, kerana pengesan menskor gaya, bukan isi. Mempelbagaikan panjang ayat, menggantikan frasa yang selamat secara statistik dengan pilihan perkataan yang lebih spesifik, dan memecahkan rentak seragam semuanya menaikkan perplexity dan burstiness sambil mengekalkan hujah anda. Itulah tepatnya yang diautomasikan oleh AI humanizer percuma, dan ia menunjukkan skor pengesan sebelum dan selepas supaya anda boleh mengesahkan penurunan itu sendiri.
Cuba AI humanizer percuma
Tampal teks anda dan lihat skor AI sebelum/selepas dalam beberapa saat. Tiada log masuk, berfungsi dalam mana-mana bahasa.
Manusiakan teks