AI 偵測器到底怎麼運作(以及它們為何標記你)
每當 GPTZero 或 Turnitin 這類工具把你的文字標成「AI 生成」,它執行的是一次統計猜測,不是測謊。理解 AI 偵測器的運作原理,是寫出真正像真人的文字的第一步。
AI 偵測器真正在測量什麼
AI 偵測器並不知道一句話是誰寫的。它從沒看過你的文件,也無法拿它去比對某個隱藏的 ChatGPT 輸出資料庫。它做的是為你文字的可預測性評分,看它和大型語言模型常見的輸出模式有多接近。
現代的偵測器本身就是機器學習模型,用數百萬篇真人與 AI 寫的文章訓練而成。它們尋找生成過程留下的統計指紋,然後輸出一個機率。整條流程中沒有任何環節能驗證作者身分。偵測器看不到你的瀏覽器紀錄,也看不到你打字的過程;它只能說,你的文字和它訓練時見過的機器寫作相似,或不相似。
把它想成垃圾郵件過濾器。它學會了垃圾郵件通常長什麼樣,所以會標記帶有那些特徵的郵件,但它永遠無法對任何一封信百分之百確定。AI 偵測的原理相同,這代表每個分數都是一個披著數字外衣的猜測。這也改變了你解讀結果的方式:「85% AI」不是說你 85% 的文字是機器寫的,而是說偵測器對一個猜測相當有把握。
困惑度:你的用字有多出人意料
困惑度(perplexity)是最重要的單一訊號。它測量語言模型對你選的每個字有多「驚訝」。如果每個下一字都正好是模型會預測的那個,困惑度就低,文字看起來就像機器寫的。真人比較難預測:我們會挑一個古怪的形容詞、打破一條規則,或用略嫌笨拙的方式表達,而每一個這樣的選擇都會推高困惑度。
舉一對具體的句子就一目了然。第一句:「規律運動很重要,因為它能改善身心健康。」第二句:「我持續運動,是因為膝蓋抱怨少了,運動完連收件匣看起來都沒那麼可怕。」兩句都通順,講的也是同一件事,但第一句完全由語言模型會排為最可能的下一個字組裝而成,「規律運動很重要,因為」根本就是模板。第二句冒了點小險:會抱怨的膝蓋、令人畏懼的收件匣。逐字計算機率的模型會覺得第一句毫無意外、第二句真的難以預測,於是第一句讀起來像 AI,第二句讀起來像真人。
這也解釋了為什麼精緻、通用的文字就算每個字都是人寫的,也會被標記。困惑度不衡量努力或誠實,只衡量可預測性,而有些完全出自真人的寫作恰恰非常可預測。
突發度:真實寫作的節奏
突發度(burstiness)測量的是句子結構和長度的變化幅度。人是一陣一陣地寫的:一個綿長曲折的句子後面接一個短句。三個字。然後是一個塞滿細節、拖得比它該有的長度還長的複雜子句。
AI 的輸出平滑得多。在預設狀態下,模型產出的句子長度都在同一個區間徘徊,開頭用類似的結構,收尾帶著同樣均勻的節拍,一段接著一段。把兩者並排放在一起,你往往一個字都不用讀就能看出差別:真人的文字在頁面上參差錯落,機器的文字像砌好的磚牆。
偵測器把這種參差量化了。低突發度加低困惑度是經典的 AI 特徵,兩者同時出現時,偵測器就會相當確信文字是生成的,哪怕主題和文法無可挑剔。不過任何一個訊號單獨來看都很弱。詩人的突發度狂放不羈,契約律師的幾乎是零,但兩者都是人,這也是認真的工具總是把兩個訊號合併使用的原因。
底層機制:token 機率
語言模型一次寫一個 token,每個 token 都帶著一個機率分數。偵測器會近似計算這些機率,檢查你的文字是否落在模型「舒適圈」裡的高機率選擇。當一段文字幾乎完全由高機率 token 以均勻的節奏組成,它就吻合 ChatGPT、Gemini 和 Claude 的預設生成方式,偵測器再把這種吻合換算成你看到的百分比。
這也解釋了為什麼短片段的測試不可靠。只有一兩句話時,訊號不足以把一個用字謹慎的真人和一個模型區分開來,分數會劇烈搖擺。多數廠商其實心照不宣:好幾家拒絕為幾百字以下的文字評分,因為在那個長度以下,這套數學比較接近擲硬幣,而不是測量。
統計式偵測器與分類器式偵測器
偵測工具分成兩大流派,弄清楚你面對的是哪一派,很多奇怪的結果就說得通了。統計式偵測器用一個參考語言模型直接計算機率:把你的文字丟進模型,測量困惑度、突發度和相關數值,再套一個門檻。GLTR 和 DetectGPT 這類研究方法是這樣運作的,許多免費檢測器背後的評分也是。它們的優點是不需要標註過的訓練資料;缺點是判決嚴重取決於由哪個參考模型來評分。
分類器式偵測器則是訓練出來的。廠商蒐集大量已知的真人文字和已知的 AI 文字,然後微調一個模型(通常是 RoBERTa 風格的 transformer)來分辨兩者。Turnitin、Originality.ai 和 Copyleaks 都是這樣打造的。分類器能捕捉原始困惑度之外的細微線索,所以在與其訓練資料相似的文字上通常更準,但面對更新的模型、其他語言或它們沒見過的領域時表現會退化,而且廠商以外沒有人能檢視它們究竟學到了什麼。
如今大多數商業產品都是兩種方法的混合體,這也是它們的分數難以解讀、更難以跨工具比較的原因之一。
ChatGPT、Gemini、Claude 的輸出為何被標記
最前緣的模型被訓練得清晰、安全、流暢,而訓練的最後一關獎勵的是多數評審認為寫得好的答案。這把輸出推向了四平八穩的句子、「moreover」和「in conclusion」式的整潔轉折,以及始終停留在統計中庸地帶的詞彙。
而這些特質恰恰是偵測器獵捕的目標。文字越精緻、越「平均」,它的困惑度和突發度就越低,AI 分數就越高。諷刺的是,滿是錯字和怪癖的真人初稿,往往比乾淨的 AI 一稿更容易過關,因為那些瑕疵才是承載人類訊號的東西。
GPTZero、Turnitin、ZeroGPT 等工具實際檢查什麼
主流工具共用同一套核心邏輯,只是調校不同。GPTZero 讓困惑度和突發度評分廣為人知,並在句子層級同時回報兩者。Turnitin AI 把偵測整合進面向學校的抄襲比對套件,把文件切成重疊片段,標記出其分類器認為由模型撰寫的部分。
ZeroGPT 提供快速、免費的逐句判讀,Originality.ai 鎖定出版方和 SEO 團隊,給出嚴格、按信心加權的分數。Copyleaks 強調多語言涵蓋和企業級報告。它們全都是機率性的,所以沒有一家能誠實地宣稱完美,而每家廠商的準確率行銷,悄悄描述的都是廠商自己設計的測試。
為什麼偵測器之間互相矛盾
把同一篇文章貼進三個偵測工具,你可能拿到一個 2% AI、一個 45%、一個 88%。這種落差不是其中哪個工具壞了,而是不同系統根據同樣的證據做出不同猜測的必然結果。
每個工具都用自己的語料訓練、用自己的參考模型評分、切分文字的方式不同(整份文件對上逐句),並各自設定「疑似 AI」的門檻。一款為了避免冤枉人而校準的工具會偏保守、少標記;一款靠抓作弊做生意的工具會偏激進、對同一段文字多標記。它們更新的節奏也不一樣,所以一個在新模型推出前調校的偵測器,會在之後好幾個月誤判那個模型的文風。
實際的教訓是:沒有任何單一分數是定論,而工具之間的分歧,本身就是猜測成分有多重的直接證據。如果你的學校用 Turnitin 檢查,那就只有 Turnitin 的判定有意義,其他地方的乾淨分數既無法預測它,也保護不了你。
誤判:公開發表的數字
因為偵測器評判的是可預測性,它們經常失手,而這些失誤並非假設。OpenAI 自家的分類器在 2023 年 1 月推出,只辨識出 26% 的 AI 文字,卻把 9% 的真人文字誤標為 AI,公司在六個月內就因準確率太低將它下架。Turnitin 聲稱文件層級的誤判率低於 1%,但也承認個別被標記句子的可靠度差得多,這正是它對疑似 AI 文字很少的文件不顯示分數的原因。
最令人不安的發現與非英語母語者有關。史丹佛的研究人員用七款流行偵測工具測試真實學生為 TOEFL 考試寫的作文,發現這些真人作文平均有 61% 被標成 AI 生成,而且幾乎每一篇都至少被一款偵測工具標記過。美國母語學生的作文卻幾乎毫髮無傷地通過了同樣的工具。
機制正是本文所描述的:用第二語言寫作的人傾向使用較安全的詞彙和較規整的句式,這會壓低困惑度,而低困惑度讀起來就像機器文字。這種偏誤是刻在方法本身裡的。這就是為什麼負責任的學校把偵測分數當成對話的起點,而不是證據。一個數字不是證據。
浮水印:遲遲沒有上路的解方
研究者長期主張,真正的解方是浮水印:讓 AI 模型在生成時自己嵌入一個看不見的統計簽章。在最知名的方案中,模型寫作時會偷偷偏好一份輪替的 token「綠名單」。讀者察覺不到這個模式,但持有金鑰的偵測器可以檢驗它,準確率遠勝靠困惑度猜測。
但它大致上沒有上路。OpenAI 打造了一個內部評估對長文約 99.9% 有效的文字浮水印工具,卻一直壓著不放,理由是改寫或翻譯會抹掉浮水印、它可能讓正當用 AI 潤稿的非母語者蒙受汙名,還有一個不那麼高尚的原因:使用者會乾脆改用不加浮水印的工具。Google 的 SynthID-Text 是例外,它在 Gemini 內部運作並已開源,但它只標記 Gemini 自己的輸出。
這就是核心難題:浮水印只涵蓋製造商願意配合的模型,而任何人都能在本機執行的開放權重模型永遠不會帶浮水印。所以你的學校或雇主今天用的偵測器,依然在做統計,而不是讀浮水印,其中的不確定性也原封不動。
偵測器如何處理人機混寫的文字
真實的文件很少是純粹的。學生親手起草前言,請 ChatGPT 擴寫兩個本文段落,再從頭到尾編輯一遍。偵測器的因應方式是在文件上滑動一個視窗,逐句或逐段分開評分,並把看起來像生成的段落標示出來。
混寫會削弱所有訊號。AI 段落裡的人工修改會拉高它的困惑度;真人段落裡的 AI 句子會把節奏拖向均勻。結果是一個中間地帶的分數,它既可能代表「一半是 AI」,也可能代表「全是人寫的,只是寫法奇怪」,而逐句標示的可靠度明顯低於整體數字。例如 Turnitin 就說過,它的句子層級標記錯誤率高於文件分數,還一度乾脆拒絕顯示低百分比,因為它們實在太不穩。
簡而言之:文件混得越兇,判定就越模糊,報告裡被標示的句子,比頭條的百分比更值得懷疑。
人性化如何降低分數
既然偵測器獎勵高困惑度和高突發度,解法就是寫得更像人:變化句子長度、使用比較難預測的用字、加入自然的轉折、打破均勻的節奏。在整份文件上手工做這些很慢,這正是 AI 人性化工具存在的意義:自動改寫文字,還原那種屬於人的變化。
像 Humanize AI 這樣的工具會改寫模型輸出,讓它重新獲得自然的突發度和較難預測的措辭,幫助它繞過 AI 偵測,同時保住你的原意。關鍵在於,它會顯示來自真實偵測引擎的前後分數,讓你是在測量變化,而不是在祈禱。目標不是欺騙,而是讓文字終於聽起來像你。
這對你的實際意義
從這項技術的運作方式,可以直接推出幾個習慣。繳交前先測試,因為檢查是免費的,瞎猜分數毫無意義;你可以把草稿丟進免費 AI 人性化工具,搶在任何人之前看到偵測數字。永遠不要相信對短文的判定,把句子層級的標示至多當成薄弱的證據。
如果你寫作誠實,請留好憑據:草稿版本、筆記和編輯紀錄,遠比任何反向分數更能證明作者身分,尤其當你是用偵測器不信任的正式語體寫作的非母語者。如果你面對的是某個特定的檢測工具,就去了解它的具體行為;Turnitin 尤其有些值得認識的怪癖,這也是我們寫了 Turnitin 指南作為本文姊妹篇的原因。
最重要的是,記住偵測器是什麼。它是一個為可預測性評分的模式比對器,由某家廠商打造、照某個門檻調校,並在兩個方向上都以可測量的比率出錯。有用,有時候。證據,永遠不是。
常見問題
AI 偵測器到底有多準?
比它們的行銷說的差。OpenAI 在自家偵測器只抓到 26% 的 AI 文字、卻誤標 9% 的真人文字之後把它下架,獨立測試也常在改寫或編輯過的文字上量到兩位數的錯誤率。最好的工具在長篇、未編輯的 AI 輸出上確實遠勝擲硬幣,但每個分數都是機率估計,不是查證過的事實。
AI 偵測器能證明我用了 ChatGPT 嗎?
不能。偵測器測量的是你的寫作在統計上有多可預測;它們無法查證是誰打的字,而且在兩個方向上都有紀錄可查的誤判率。分數只是一個長得像指控的猜測。如果作品確實是你寫的,草稿、大綱和版本紀錄才是真正的證據,另一個偵測工具給的反向分數不是。
為什麼兩個偵測工具對同一段文字給出完全不同的分數?
因為它們是不同的猜測者。每個工具用自己的資料訓練、用自己的參考模型評分、用不同方式切分文字,並各自設定判定 AI 的門檻。保守的工具對同一段文字少標記,激進的工具多標記。偵測工具之間意見不合是常態,也正好提醒我們每個百分比背後藏著多少不確定性。
AI 偵測器對短文有效嗎?
效果很差。困惑度和突發度需要足夠多的字才能形成模式,一兩句話根本不含足夠的訊號。短片段的分數搖擺劇烈,這也是好幾家廠商拒絕為幾百字以下的文字評分的原因。對任何短文的判定,包括長報告裡被單獨標示的一句話,都應保持高度懷疑。
我能在不改變原意的情況下降低 AI 偵測分數嗎?
可以,因為偵測器評的是風格,不是內容。變化句子長度、用更具體的措辭取代統計上安全的說法、打破均勻的節奏,這些都能在論點不動的前提下拉高困惑度和突發度。這正是免費 AI 人性化工具自動化完成的事,它還會顯示前後偵測分數,讓你親自確認降幅。