چگونه GPTZero را دور بزنیم: چه چیزی واقعاً در سال ۲۰۲۶ کار میکند
GPTZero تشخیصدهندهای است که بیشتر معلمان اول سراغش میروند، و متن خام ChatGPT را ظرف چند ثانیه علامتگذاری میکند. ما آزمایش کردیم که واقعاً چه چیزی یک امتیاز GPTZero را در سال ۲۰۲۶ پایین میآورد، کدام ترفندهای محبوب فقط وقت شما را تلف میکنند، و چگونه از نوشته واقعاً انسانی در برابر مثبتهای کاذب محافظت کنیم.
GPTZero چه چیزی را اندازه میگیرد: پریشانی و انفجاری بودن
GPTZero در اوایل سال ۲۰۲۳ توسط Edward Tian، که آن زمان دانشجوی Princeton بود، ساخته شد، و از آن پس به یکی از پرکاربردترین تشخیصدهندههای هوش مصنوعی در آموزش تبدیل شده است. معلمان یک مقاله مشکوک را میچسبانند، و ظرف چند ثانیه GPTZero یک احتمال برمیگرداند که متن توسط هوش مصنوعی نوشته شده، همراه با برجستهسازی در سطح جمله که بخشهایی را که ماشینگونهترین میداند علامت میزند.
دو آمار حکم را پیش میبرند. پریشانی اندازه میگیرد که انتخاب کلمات شما برای یک مدل زبانی چقدر قابلپیشبینی است. متن هوش مصنوعی با انتخاب مکرر کلمات محتمل بعدی تولید میشود، بنابراین در پریشانی امتیاز پایینی میگیرد، یعنی پیشبینیاش آسان است. انفجاری بودن اندازه میگیرد که ساختار و طول جملات شما در سراسر سند چقدر متغیر است. انسانها یک جمله ۸ کلمهای را با یک جمله ۳۴ کلمهای درمیآمیزند و وقتی ایدهای هیجانزدهشان میکند ریتم را عوض میکنند. مدلهای زبانی از پاراگراف اول تا آخر آهنگی ثابت و یکنواخت را حفظ میکنند.
وقتی هر دو عدد در بازه نوعیِ ماشین بنشینند، GPTZero متن را تولیدشده توسط هوش مصنوعی میخواند. همه چیز در این راهنما به همان دو سیگنال برمیگردد. برای دور زدن GPTZero، متن شما به قابلپیشبینی بودن کمتر و تنوع ریتمیک بیشتری نیاز دارد، چه از راه بازنویسی خودکار، چه ویرایش واقعاً انسانی، و در حالت ایدهآل هر دو.
یک نکته عملی دیگر: هر دو سیگنال با طول تثبیت میشوند. امتیازها روی یک پاراگراف ۱۵۰ کلمهای بالا و پایین میپرند، در حالی که امتیازها روی یک مقاله ۱۰۰۰ کلمهای بسیار سازگارترند، به همین دلیل است که هر آزمون در این راهنما روی اسناد کامل اجرا شد.
چرا متن ChatGPT اینقدر قابلاعتماد علامتگذاری میشود
ChatGPT آموزش دیده که در هر گام امنترین و از نظر آماری محتملترین جمله را تولید کند، که دقیقاً همان چیزی است که تشخیصِ مبتنی بر پریشانی برای گرفتنش طراحی شده است. اگر با تنظیمات پیشفرض رها شود، با طولهای یکنواخت جملات، ساختارهای مرتب پاراگراف، و لحنی صیقلی و خنثی مینویسد که در طول هزار کلمه هرگز از نقش خارج نمیشود. هیچ انسانی چنین یکنواختیای را حفظ نمیکند.
همچنین به یک واژگان کلیشهایِ قابلتشخیص تکیه میکند. عبارتهایی مانند کاوش عمیق در، لازم به ذکر است، در دنیای پرشتاب امروز و در نتیجه بسیار بیشتر از نوشته واقعی دانشجویان در پیشنویسهای هوش مصنوعی ظاهر میشوند، و تشخیصدهندهها آن اثر انگشتها را خوب یاد گرفتهاند. همین درباره عادتهای ساختاری صدق میکند: فهرستهای سهآیتمی همهجا، یک کلمه پیوند در آغاز تقریباً هر پاراگراف، و یک پایانبندی خلاصهوار که مؤدبانه مقدمه را بازگو میکند.
به همین دلیل است که صرفاً دستور دادن به ChatGPT برای اینکه "انسانیتر بهنظر برسد" بهسختی عقربه را تکان میدهد. مدل میتواند لباس مبدلش را عوض کند، اما زیر آن همچنان هر بار یک توکن، کلمات با احتمال بالا را انتخاب میکند، و GPTZero دارد آمار را امتیاز میدهد، نه سبک را.
مدلهای تازهتر این را حل نکردهاند. GPT-4o، Claude و Gemini همگی اندکی کمتر قابلپیشبینی از ChatGPT اولیه مینویسند، و امتیازهای خامشان کمی پایینتر است، اما در آزمایش ما خروجی ویرایشنشده هر مدل اصلی همچنان بسیار بیشتر از آنکه علامتگذاری نشود علامتگذاری شد. تشخیص تا اینجا با تولید همگام مانده است.
آیا GPTZero دقیق است؟ آزمایش ما چه نشان داد
GPTZero دقت بالایی تبلیغ میکند، و در شرایط منصفانه یکی از قابلاعتمادترین تشخیصدهندههای مصرفی است. روی خروجی بلند و ویرایشنشده ChatGPT، اکثریت قریببهاتفاق نمونهها را میگیرد. اما ادعاهای دقتی که روی معیارهای تمیز مطرح میشوند در برخورد با نوشته آشفته دنیای واقعی دوام نمیآورند.
وقتی آزمایشش کردیم، سه ضعف بهطور مداوم نمایان شد. متنهای کوتاهِ زیر تقریباً ۲۵۰ کلمه امتیازهای ناپایداری تولید کردند که پس از ویرایشهای کوچک میتوانستند از عمدتاً انسانی به عمدتاً هوش مصنوعی نوسان کنند. اسناد ترکیبی، که در آنها یک فرد یک پیشنویس هوش مصنوعی را بهشدت ویرایش کرده بود، اغلب برجستهسازی سطحجملهای را گیج میکردند، جملات انسانی را علامت میزدند در حالی که جملات هوش مصنوعی را پاک میکردند. و اسکن دوباره متن یکسان با چند هفته فاصله، گاهی پس از یک بهروزرسانی مدل حکم متفاوتی برمیگرداند.
پژوهش مستقل به همان جهت اشاره میکند. مطالعات تشخیصدهندههای هوش مصنوعی، از جمله یک مقاله پرارجاع Stanford در سال ۲۰۲۳، نرخ مثبت کاذبِ بهطور چشمگیری بالاتری روی مقالههای نوشتهشده توسط سخنوران غیربومی انگلیسی یافتند. پس آیا GPTZero دقیق است؟ آنقدر دقیق که خروجی خام ChatGPT معمولاً گرفته میشود، و آنقدر ناقص که حکمش هرگز نباید بهتنهایی بهعنوان اثبات چیزی تلقی شود.
گامبهگام: چگونه GPTZero را با یک انسانیساز دور بزنیم
این جریان کاریای است که توصیه میکنیم، و همان است که بهطور مداوم نمونههای آزمایشی ما را از بیش از ۹۰٪ هوش مصنوعی به کاملاً انسانی رساند.
گام ۱. پیشنویس خود را کاملاً پیش از انسانیسازی تمام کنید. بازنویسی تکهها یکییکی لحنی ناهماهنگ تولید میکند که میتواند هم برای تشخیصدهندهها و هم برای خوانندگان انسانی مثل چیزی بههمدوخته بهنظر برسد.
گام ۲. پیشنویس را در انسانیساز رایگان هوش مصنوعی بچسبانید، یا فایل را مستقیماً بارگذاری کنید. این ابزار یک امتیاز تشخیص هوش مصنوعی زنده از دو تشخیصدهنده مستقل را پیش و پس از بازنویسی نشان میدهد، تا دقیقاً ببینید از کجا شروع کردهاید. به هیچ حساب یا ورودی نیازی نیست، و در ۴۰ زبان کار میکند.
گام ۳. انسانیساز را اجرا کنید و امتیازهای پیش و پس از کار را کنار هم مقایسه کنید. بازنویسی ریتم جملات را بازساختاردهی میکند و عبارتپردازی آماریِ قابلپیشبینی را جایگزین میکند، که دقیقاً همان چیزی است که امتیازدهی پریشانی و انفجاری بودن به آن واکنش نشان میدهند.
گام ۴. خروجی را با دقت بخوانید. هر جملهای را که معنایش منحرف شده تصحیح کنید، و اگر یک کلمه فنی در بازنویسی نرم شده، اصطلاحات کلیدی خود را بازگردانید.
گام ۵. در هر بخش یک نشانه شخصی اضافه کنید: یک مثال واقعی، یک نظر کوچک، یک عدد مشخص. سپس دوباره اسکن کنید. در هر آزمونی که اجرا کردیم، بازنویسی ماشینی بهعلاوه یک عبور کوتاه انسانی بر هر یک از این دو رویکرد بهتنهایی برتری داشت.
ویرایش دستی که امتیاز GPTZero را پایین میآورد
اگر ترجیح میدهید با دست ویرایش کنید، مستقیماً آن دو آمار را هدف بگیرید. برای انفجاری بودن، طول جملات خود را عمداً متنوع کنید. یک جمله بلند و پرپیچوخم را با یک جمله سهکلمهای دنبال کنید. کار میکند. هر پاراگرافی را که در آن هر جمله شکل یکسانی دارد بشکنید، و آغازگرهای خود را متنوع کنید تا پاراگرافها همگی با یک کلمه پیوند شروع نشوند.
برای پریشانی، عبارتپردازی عمومی را با زبانی مشخص و ملموس جایگزین کنید. "نتایج معنادار بودند" قابلپیشبینی است؛ "نرخ ترک تحصیل در یک نیمسال یکسوم کاهش یافت" نیست. جزئیاتی اضافه کنید که فقط شما میدانید: منبعی که واقعاً خواندهاید، استدلال مقابلی که در نظر گرفتید و رد کردید، یک مکان، یک تاریخ، یک عدد.
لحن محاورهای و پرسشهای بدیهی هم در حاشیه کمک میکنند. مدلها نسبت به نویسندگان واقعی از شکلهای گفتاری و خودمانی کمتر استفاده میکنند، و تقریباً هرگز چیزی از خواننده نمیپرسند. حرکتهای کوچک محاورهای مانند اینها ارزانقیمتاند و متن را بدون دست زدن به استدلال شما، از لحن نوعیِ ماشین دور میکنند.
در پایان، نشانههای هوش مصنوعی را حذف کنید. در نتیجه، بهعلاوه، شایان ذکر است، و هر جملهای را که آنچه تازه گفتهاید خلاصه میکند حذف کنید. متن را با صدای بلند بخوانید و هر چیزی را که هرگز به یک انسان دیگر نمیگفتید بازنویسی کنید. برای نظریه پشت اینکه چرا این ویرایشها امتیاز را جابهجا میکنند، توضیحدهنده ما درباره نحوه کار تشخیصدهندههای هوش مصنوعی هر سیگنال را با جزئیات تشریح میکند.
چه چیزی در برابر GPTZero کار نمیکند
ما میانبرهای محبوب را آزمایش کردیم تا شما مجبور نباشید.
جایگزینی مترادف شکست میخورد. عبور دادن متن از یک فرهنگ مترادفها، یا یک ابزار بازنویسی در حالت مترادف سبک، ساختار زیربنایی جمله را دستنخورده نگه میدارد، و ساختار بیشترِ چیزی است که انفجاری بودن اندازه میگیرد. بدتر از آن، انتخابهای مترادف ناهنجار اغلب برای یک مصحح مثل سالادِ کلمات خوانده میشوند، حتی وقتی امتیاز چند نمره بهبود مییابد.
نویسههای نامرئی و حروف همشکل بهشدت شکست میخورند. درج فاصلههای بیعرض یا جایگزین کردن حروف لاتین با معادلهای شبیه سیریلیک مدتها پیش وصله شد. تشخیصدهندههای امروزی متن را پیش از امتیازدهی نرمالسازی میکنند، و برخی ابزارها اکنون بهصراحت دستکاری نویسه را علامت میزنند، که یک ظنِ مرزی را به شاهدِ قصد و نیت تبدیل میکند.
ترفندهای دستوری بهسختی کمک میکنند. درخواست از ChatGPT برای "نوشتن با انفجاری بودنِ بالا" یا "پرهیز از تشخیص هوش مصنوعی" سبک ظاهری را تغییر میدهد در حالی که آمار توکنبهتوکن نوعیِ ماشین باقی میماند. در آزمونهای ما این دستورها در بهترین حالت امتیازها را در حد یکرقمی جابهجا کردند، و نتایج میان اجراها ناپایدار بودند.
افزودن غلط تایپی بدترین معامله موجود است. اعتبار شما را نزد خواننده انسانی، که مخاطبی است که واقعاً اهمیت دارد، آسیب میزند، در حالی که اثر انگشت آماری را عمدتاً دستنخورده باقی میگذارد.
درخواست از ChatGPT برای بازنویسی خروجی خودش هم ناامیدکننده است. عبور دوم توسط همان ماشینِ احتمالِ عبور اول تولید میشود، بنابراین بازنویسی همان نرمی را به ارث میبرد. ما دیدیم که امتیازها روی برخی نمونهها اندکی افت کردند و روی برخی دیگر بالا رفتند، که یک راهبرد نیست، بلکه شیر یا خط است.
مثبتهای کاذب GPTZero: وقتی نوشته انسانی علامتگذاری میشود
حقیقت ناخوشایند درباره تشخیص هوش مصنوعی این است که آدمهای واقعی را علامتگذاری میکند. نویسندگانی که بیشترین خطر را دارند سخنوران غیربومی انگلیسیاند، که معمولاً از واژگان امنتر و استانداردتری استفاده میکنند که پریشانی پایین امتیاز میگیرد. ژانرهای قالبی هم آسیب میبینند: گزارشهای آزمایشگاهی، نوشته حقوقی، مستندات فنی، و مقاله کلاسیک پنجپاراگرافی، از روی طراحی ساختارمند و یکنواختاند، که دقیقاً همان چیزی است که تشخیصدهندهها آن را با ماشینها مرتبط میدانند.
مثالهای مشهور این نکته را ثابت میکنند. تشخیصدهندهها قانون اساسی آمریکا و بخشهایی از انجیل را بهعنوان تولیدشده توسط هوش مصنوعی علامتگذاری کردهاند، نه به این دلیل که ابزارها خراباند، بلکه چون نثر رسمی و بهشدت ویرایششده از نظر آماری نرم است.
اگر بدون هوش مصنوعی مینویسید و نگران علامتگذاری شدن هستید، پیش از ارسال از خودتان محافظت کنید. در Google Docs یا Word با تاریخچه نسخههای فعال بنویسید، طرحهای کلی و یادداشتهایتان را نگه دارید، و اگر روزی امتیازی علیه شما استفاده شد، خط زمانی بازبینی را برونبری کنید. یک ردپای تاریخدار از پیشنویسهای آشفته شاهدی بهمراتب قویتر از هر درصد تشخیصدهنده است، در هر دو جهت.
کجا دقت GPTZero از هم میپاشد
درک محدودیتها به شما کمک میکند هر امتیازی را که میبینید تفسیر کنید. GPTZero روی متنهای کوتاه، روی اسناد ترکیبیِ بهشدت ویرایششده، و روی نوشته مدلهایی که هنوز در برابرشان تنظیم نشده، ضعیفترین است. برجستهسازیهای سطحجملهایاش بهطور محسوسی کماعتمادتر از امتیاز سطحسندیاشاند، با این حال همان برجستهسازیها هستند که معلمان اغلب هنگام رویارویی با یک دانشجو بر پایهشان عمل میکنند.
امتیازها در طول زمان هم جابهجا میشوند. GPTZero مدلهای خود را مرتباً بهروزرسانی میکند، بنابراین متنی که امروز ۱۲٪ هوش مصنوعی امتیاز میگیرد ممکن است پس از یک بهروزرسانی ۴۰٪ امتیاز بگیرد، بدون هیچ تغییری در نوشته. این رفتار عادیِ یک طبقهبندِ احتمالاتی است، و یک دلیل دیگر که چرا یک اسکن واحد هرگز نباید بهعنوان حقیقت مطلق تلقی شود.
GPTZero همچنین نتایج را با یک اطمینان اعلامشده در دستههای انسانی، ترکیبی و هوش مصنوعی جای میدهد. دسته ترکیبی جایی است که بیشتر پیشنویسهای ویرایششده در آن قرار میگیرند، و کماعتمادترینِ این سه است، که دانستنش ارزش دارد اگر روزی یک حکم ترکیبی علیه شما استناد شود.
این برای هرکسی که میخواهد تشخیصدادهنشده بماند دو لبه دارد. یک امتیاز پاک امروز یک عبور دائمی نیست، و هرکس یک دور زدنِ مادامالعمر تضمینشده میفروشد دارد اغراق میکند. رویکرد پایدار متنی است که واقعاً از نظر ریتم و محتوا انسانی باشد، نه متنی که نسخه فعلی یک تشخیصدهنده را فریب میدهد و امید دارد نسخه بعدی هرگز عرضه نشود.
کارتان را پیش از هر کس دیگری بررسی کنید
بزرگترین مزیت عملیای که میتوانید به خودتان بدهید، دانستن امتیازتان پیش از بازبینتان است. چون Humanize AI نتایج را از دو تشخیصدهنده بهطور همزمان نشان میدهد، یک خوانش سختگیرتر و یک خوانش آسانگیرتر از همان متن میگیرید، که به واقعیتِ ندانستن اینکه معلم یا ویراستار شما از کدام ابزار استفاده میکند نزدیکتر است.
روال پیشنهادی ما: اسکن کنید، انسانیسازی کنید، با دست ویرایش کنید، سپس دوباره اسکن کنید. هدفتان این باشد که هر دو تشخیصدهنده متن را عمدتاً انسانی بخوانند، و درباره رسیدن به ۰٪ هوش مصنوعی وسواس نداشته باشید. تعقیب یک صفر بینقص معمولاً یعنی ویرایش بیش از حد تا رسیدن به نثری خشک و بیروح، و نمونههای کنترلِ انساننوشتهای که آزمایش کردیم هم بههرحال بهندرت صفر مطلق گرفتند.
این ابزار از بارگذاری فایل پشتیبانی میکند و در ۴۰ زبان کار میکند، بنابراین میتوانید یک سند کامل را بررسی کنید، نه یک گزیده چسباندهشده را، که به تشخیصدهندهها هم متن کافی برای امتیازدهی قابلاعتماد میدهد. اگر نقطه شروع شما خروجی خام ChatGPT است، راهنمای همراه ما درباره غیرقابلتشخیص کردن متن ChatGPT جنبه پیشنویسیِ این مسئله را با جزئیات بیشتری پوشش میدهد.
از این بهطور مسئولانه استفاده کنید
یک یادداشت پایانی که در هر راهنما میگنجانیم، چون اهمیت دارد. تشخیصدهندهها مثبت کاذب تولید میکنند، و کمک به نویسندگان صادق برای پرهیز از ظنِ ناعادلانه یک استفاده مشروع از انسانیساز است. صیقل دادن کارِ کمکگرفته از هوش مصنوعی در زمینههایی که کمک مجاز است هم همینطور، که بهطور فزایندهای شامل محیطهای کار، تیمهای بازاریابی و بسیاری از کلاسهای درس با سیاستهای افشای هوش مصنوعی میشود.
ارسال کارِ کاملاً تولیدشده توسط هوش مصنوعی بهعنوان کار خودتان در جایی که ممنوع است موضوع دیگری است. این میتواند عواقب واقعی علمی یا حرفهایای داشته باشد که هیچ ابزاری نمیتواند جبرانشان کند، و نرمافزار تشخیص تنها یکی از راههایی است که این کار کشف میشود. معلمان متوجه میشوند وقتی یک مقاله با نوشته کلاسی شما نمیخواند، و ویراستاران متوجه میشوند وقتی یک نویسنده نمیتواند در یک تماس درباره مقاله خودش صحبت کند.
توصیه ما ساده است: تفکر را از آنِ خودتان نگه دارید، در جایی که مؤسسه شما اجازه میدهد از هوش مصنوعی استفاده کنید، در صورت لزوم افشا کنید، و از ابزارهای انسانیسازی برای اینکه نوشته واقعاً از آن شما شود استفاده کنید، نه برای پنهان کردن کاری که هرگز از آن شما نبوده است.
پرسشهای پرتکرار
GPTZero به متن ChatGPT چه امتیازی میدهد؟
خروجی ویرایشنشده ChatGPT معمولاً در GPTZero امتیاز ۸۰ تا ۱۰۰٪ هوش مصنوعی میگیرد، اغلب با تقریباً هر جمله برجستهشده. در آزمونهای ما، عبور دادن همان متن از یک انسانیساز بهعلاوه یک عبور ویرایش دستی بیشتر نمونهها را به بازه عمدتاً انسانی رساند.
آیا GPTZero آنقدر دقیق هست که تقلب را اثبات کند؟
نه. GPTZero یک احتمال برمیگرداند، نه اثبات، و مثبتهای کاذب مستندی دارد، بهویژه برای سخنوران غیربومی انگلیسی و نوشته قالبی. حتی خود GPTZero به مربیان توصیه میکند امتیازها را بهعنوان آغازگر گفتوگو در نظر بگیرند، نه یک حکم.
آیا بازنویسی با QuillBot، GPTZero را دور میزند؟
معمولاً بهتنهایی نه. حالتهای بازنویسی استاندارد ساختار جمله را تا حد زیادی دستنخورده نگه میدارند، و ساختار بخش مهمی از چیزی است که GPTZero امتیاز میدهد. یک انسانیساز ساختهشده برای همین هدف که ریتم را بازساختاردهی میکند، و بهدنبالش ویرایشهای خودتان، در آزمایش بهمراتب بهتر عمل میکند.
آیا GPTZero میتواند متن GPT-4o، Claude و Gemini را تشخیص دهد؟
بله. GPTZero روی خروجی همه مدلهای اصلی آموزش دیده، نه فقط نسخههای قدیمیتر ChatGPT. مدلهای تازهتر اندکی کمتر قابلپیشبینی مینویسند، که امتیازها را تا حدی پایین میآورد، اما خروجی خام هر مدل اصلی همچنان بیشتر اوقات علامتگذاری میشود.
آیا استفاده از یک انسانیساز هوش مصنوعی تقلب است؟
به قوانینی که تحتشان کار میکنید بستگی دارد. استفاده از یک انسانیساز برای رفع مثبتهای کاذب روی نوشته خودتان، یا برای صیقل دادن پیشنویسهای مجازِ کمکگرفته از هوش مصنوعی، مشروع است. استفاده از آن برای ارسال کاری که انجام ندادهاید در جایی که هوش مصنوعی ممنوع است، سیاستهای درستی علمی را نقض میکند، و هیچ ابزاری این را تغییر نمیدهد.
ابزار رایگان انسانیسازی هوش مصنوعی را امتحان کنید
متن خود را بچسبانید و امتیاز هوش مصنوعی قبل/بعد را در چند ثانیه ببینید. بدون ورود، در هر زبانی کار میکند.
انسانیسازی متن