AI 检测器到底如何工作(以及它们为何标记你)
每当 GPTZero 或 Turnitin 之类的工具把你的文字标为"AI 生成"时,它执行的是一次统计猜测,而不是测谎。理解 AI 检测器的工作原理,是写出真正像真人的文字的第一步。
AI 检测器真正在测量什么
AI 检测器并不知道一句话是谁写的。它从没见过你的文档,也无法拿它去比对某个隐藏的 ChatGPT 输出数据库。它做的是给你的文本的可预测性打分,看它与大语言模型常见的输出模式有多接近。
现代检测器本身就是机器学习模型,训练自数百万篇真人与 AI 写的文本。它们寻找生成过程留下的统计指纹,然后输出一个概率。整个流程中没有任何环节能验证作者身份。检测器看不到你的浏览器历史,也看不到你打字的过程;它只能说,你的文本与它训练时见过的机器写作相似,或者不相似。
把它想成垃圾邮件过滤器。它学会了垃圾邮件通常长什么样,所以会标记具有那些特征的邮件,但它永远无法对任何一封邮件百分之百确定。AI 检测的原理相同,这意味着每个分数都是一个披着数字外衣的猜测。这也改变了你解读结果的方式:"85% AI"并不是说你 85% 的文本是机器写的,而是说检测器对一个猜测相当有把握。
困惑度:你的用词有多出人意料
困惑度(perplexity)是最重要的单一信号。它测量语言模型对你所选的每个词有多"惊讶"。如果每个下一词都恰好是模型会预测的那个,困惑度就低,文本看起来就像机器写的。真人则更难预测:我们会挑一个古怪的形容词、打破一条规则,或者用略显笨拙的方式表达,而每一个这样的选择都会推高困惑度。
举一对具体的句子就一目了然。第一句:"规律运动很重要,因为它能改善身心健康。"第二句:"我坚持运动,是因为膝盖抱怨少了,运动完连收件箱看着都没那么可怕了。"两句都通顺,说的也是同一件事,但第一句完全由语言模型会排为最可能的下一个词组装而成,"规律运动很重要,因为"简直就是模板。第二句冒了些小险:会抱怨的膝盖,令人恐惧的收件箱。逐词计算概率的模型会觉得第一句毫无意外,第二句则真正难以预测,于是第一句读起来像 AI,第二句读起来像真人。
这也解释了为什么精致、通用的文字即使每个字都是人写的也会被标记。困惑度不衡量努力或诚实,只衡量可预测性,而有些完全出自真人的写作恰恰非常可预测。
突发度:真实写作的节奏
突发度(burstiness)测量的是句子结构和长度的变化幅度。人是一阵一阵地写的:一个绵长曲折的句子后面跟着一个短句。三个字。然后是一个塞满细节、拖得比它该有的长度还长的复杂从句。
AI 的输出则平滑得多。在默认设置下,模型产出的句子长度都在同一区间徘徊,开头用相似的结构,落点带着同样均匀的节拍,一段接着一段。把两者并排放在一起,你往往一个字都不用读就能看出差别:真人的文本在页面上参差错落,机器的文本则像砌好的砖墙。
检测器把这种参差量化了。低突发度加低困惑度是经典的 AI 特征,两者同时出现时,检测器就会相当确信文本是生成的,哪怕主题和语法无可挑剔。不过单独任何一个信号都很弱。诗人的突发度狂野奔放,合同律师的几乎为零,但两者都是人,这也是严肃的工具总是把两个信号结合使用的原因。
底层原理:token 概率
语言模型一次写一个 token,每个 token 都带着一个概率分数。检测器会近似计算这些概率,检查你的文本是否落在模型"舒适区"内的高概率选择里。当一段文字几乎完全由高概率 token 以均匀的节奏组装而成时,它就与 ChatGPT、Gemini 和 Claude 的默认生成方式吻合,检测器再把这种吻合换算成你看到的百分比。
这也解释了为什么短片段的测试不可靠。只有一两句话时,信号不足以把一个用词谨慎的真人和一个模型区分开,分数会剧烈波动。多数厂商其实心照不宣:好几家拒绝给几百词以下的文本打分,因为在那个长度之下,这套数学更接近抛硬币,而不是测量。
统计式检测器与分类器式检测器
检测工具分为两大流派,弄清你面对的是哪一派,很多古怪的结果就说得通了。统计式检测器用一个参考语言模型直接计算概率:把你的文本喂给模型,测量困惑度、突发度及相关指标,然后套一个阈值。GLTR 和 DetectGPT 这类研究方法是这样工作的,许多免费检测器背后的打分也是。它们的优势是不需要标注训练数据;劣势是判决严重依赖于由哪个参考模型来打分。
分类器式检测器则是训练出来的。厂商收集大量已知的真人文本和已知的 AI 文本,然后微调一个模型(通常是 RoBERTa 风格的 transformer)来区分两者。Turnitin、Originality.ai 和 Copyleaks 都是这样构建的。分类器能捕捉到原始困惑度之外的微妙线索,所以在与其训练数据相似的文本上往往更准,但面对更新的模型、其他语言或它们从未见过的领域时表现会退化,而且厂商之外没有人能检查它们究竟学到了什么。
如今大多数商业产品都是两种方法的混合体,这也是它们的分数难以解读、更难以跨工具比较的原因之一。
ChatGPT、Gemini、Claude 的输出为何被标记
前沿模型被训练得清晰、安全、流畅,而训练的最后一环奖励的是大多数评审认为写得好的答案。这把输出推向了均衡的句子、"moreover"和"in conclusion"式的整洁过渡,以及始终停留在统计中间地带的词汇。
而这些特质恰恰是检测器猎取的目标。文字越是精致、越是"平均",它的困惑度和突发度就越低,AI 分数就越高。讽刺的是,满是错字和怪癖的真人初稿,往往比干净的 AI 一稿更容易通过,因为那些瑕疵才是承载人类信号的东西。
GPTZero、Turnitin、ZeroGPT 等工具实际检查什么
主流工具共享同一套核心逻辑,只是调校不同。GPTZero 让困惑度和突发度打分广为人知,并在句子级别同时报告两者。Turnitin AI 把检测集成进面向学校的查重套件,将文档切分为重叠片段,标记出其分类器认为由模型撰写的部分。
ZeroGPT 提供快速、免费的逐句读数,Originality.ai 面向出版方和 SEO 团队,给出严格、按置信度加权的分数。Copyleaks 强调多语言覆盖和企业级报告。它们全都是概率性的,所以没有一家能诚实地宣称完美,而每家厂商的准确率营销,悄悄描述的都是厂商自己设计的测试。
为什么检测器之间互相矛盾
把同一篇文章粘进三个检测器,你可能得到一个 2% AI、一个 45%、一个 88%。这种落差不是其中某个工具坏了,而是不同系统基于同样的证据做出不同猜测的必然结果。
每个工具都在自己的语料上训练、用自己的参考模型打分、切分文本的方式不同(整篇文档还是逐句),并且各自设定"疑似 AI"的阈值。一款为避免冤枉人而校准的工具会偏保守、少标记;一款靠抓作弊卖钱的工具会偏激进、对同一段文字多标记。它们的更新节奏也不一样,所以一个在新模型发布之前调校的检测器,会在之后好几个月里误判那个模型的文风。
实际的教训是:没有任何单一分数是定论,而工具之间的分歧本身就是猜测成分有多大的直接证据。如果你的学校用 Turnitin 检查,那么只有 Turnitin 的判定有意义,别处的干净分数既不能预测它,也不能保护你。
误报:公开发表的数字
因为检测器评判的是可预测性,它们经常失手,而且这些失误并非假设。OpenAI 自家的分类器于 2023 年 1 月发布,只识别出 26% 的 AI 文本,却把 9% 的真人文本误标为 AI,公司在六个月内就因准确率过低将其下线。Turnitin 声称文档级误报率低于 1%,但也承认单个被标记句子的可靠性要差得多,这正是它对疑似 AI 文本很少的文档不显示分数的原因。
最令人不安的发现涉及非英语母语者。斯坦福的研究人员用七款流行检测器测试了真实学生为 TOEFL 考试写的作文,发现这些真人作文平均有 61% 被标为 AI 生成,而且几乎每一篇都至少被一款检测器标记过。美国母语学生的作文却几乎毫发无损地通过了同样的工具。
其机制正是本文所描述的:用第二语言写作的人倾向于使用更安全的词汇和更规整的句式,这会降低困惑度,而低困惑度读起来就像机器文本。这种偏见是刻在方法本身里的。这就是为什么负责任的学校把检测器分数当作对话的起点,而不是证据。一个数字不是证据。
水印:迟迟没有落地的解决方案
研究者长期主张,真正的解决方案是水印:让 AI 模型在生成时自己嵌入一个不可见的统计签名。在最著名的方案中,模型写作时会秘密偏爱一份轮换的 token"绿名单"。读者察觉不到这种模式,但持有密钥的检测器可以对其进行检验,准确率远高于靠困惑度猜测。
可它基本上没有落地。OpenAI 造出了一个据内部报告对长文本约 99.9% 有效的文本水印器,却一直压着不发,理由是改写或翻译会抹掉水印、它可能让正当用 AI 润色的非母语者蒙受污名,还有一个不那么高尚的原因:用户会干脆转投不打水印的工具。Google 的 SynthID-Text 是个例外,它在 Gemini 内部运行并已开源,但它只标记 Gemini 自己的输出。
这就是核心困境:水印只覆盖制造商愿意配合的模型,而任何人都能本地运行的开放权重模型永远不会带水印。所以你的学校或雇主今天使用的检测器,依然在做统计,而不是读水印,其中的不确定性也一并保留。
检测器如何处理人机混写的文本
真实的文档很少是纯粹的。学生亲手起草引言,让 ChatGPT 扩写两个正文段落,再通篇编辑一遍。检测器的应对办法是在文档上滑动一个窗口,逐句或逐段单独打分,并高亮那些看起来像生成的部分。
混写会削弱所有信号。AI 段落里的人工修改会拉高它的困惑度;真人段落里的 AI 句子会把节奏拖向均匀。结果是一个中间区间的分数,它既可能意味着"一半是 AI",也可能意味着"全是人写的,只是写法奇怪",而逐句高亮的可靠性明显低于整体数字。比如 Turnitin 就说过,它的句子级标记的错误率高于文档分数,还曾一度干脆拒绝显示低百分比,因为它们实在太不稳定。
简而言之:文档混合得越厉害,判定就越模糊,报告里被高亮的句子比头条百分比更值得怀疑。
人性化如何降低分数
既然检测器奖励高困惑度和高突发度,解法就是写得更像人:变化句子长度,使用不那么可预测的措辞,添加自然的过渡,打破均匀的节奏。在整篇文档上手工做这些很慢,这正是 AI 人性化工具存在的意义:自动重写文本,恢复那种属于人的变化。
像 Humanize AI 这样的工具会改写模型输出,让它重获自然的突发度和更难预测的措辞,帮助它绕过 AI 检测,同时保持你的原意。关键在于,它会展示来自真实检测器的前后分数对比,让你是在测量变化,而不是在祈祷。目标不是欺骗,而是让文字终于听起来像你。
这对你的实际意义
从这项技术的工作方式可以直接推出几条习惯。提交前先测试,因为检查是免费的,瞎猜分数毫无意义;你可以把草稿放进免费 AI 人性化工具,抢在任何人之前看到检测器的数字。永远不要相信对短文本的判定,把句子级高亮至多当作薄弱的证据。
如果你写作诚实,请留好凭据:草稿版本、笔记和编辑历史,远比任何反向分数更能证明作者身份,尤其当你是用检测器不信任的正式语域写作的非母语者时。如果你面对的是某个特定的检测工具,就去了解它的具体行为;Turnitin 尤其有一些值得了解的怪癖,这也是我们写了Turnitin 指南作为本文姊妹篇的原因。
最重要的是,记住检测器是什么。它是一个给可预测性打分的模式匹配器,由某个厂商构建,按某个阈值调校,并在两个方向上都以可测量的比率出错。有用,有时候。证据,永远不是。
常见问题
AI 检测器到底有多准?
比它们的营销说的要差。OpenAI 在自家检测器只抓到 26% 的 AI 文本、却误标 9% 的真人文本之后将其下线,而独立测试也经常在改写或编辑过的文本上发现两位数的错误率。最好的工具在长篇、未编辑的 AI 输出上确实远胜抛硬币,但每个分数都是概率估计,不是经过核实的事实。
AI 检测器能证明我用了 ChatGPT 吗?
不能。检测器测量的是你的写作在统计上有多可预测;它们无法核实是谁敲下的字,而且在两个方向上都有成文记录的误判率。分数只是一个长得像指控的猜测。如果作品确实是你写的,草稿、提纲和版本历史才是真正的证据,另一个检测器给出的反向分数不是。
为什么两个检测器对同一段文字给出完全不同的分数?
因为它们是不同的猜测者。每个工具用自己的数据训练、用自己的参考模型打分、以不同方式切分文本,并各自设定判定 AI 的阈值。保守的工具会对同一段文字少标记,激进的工具会多标记。检测器之间意见不合是常态,也恰好提醒我们每个百分比背后藏着多少不确定性。
AI 检测器对短文本有效吗?
效果很差。困惑度和突发度需要足够多的词才能形成模式,一两句话根本不含足够的信号。短片段的分数波动剧烈,这也是好几家厂商拒绝给几百词以下的文本打分的原因。对任何短文本的判定,包括长报告中被单独高亮的一句话,都应保持高度怀疑。
我能在不改变原意的情况下降低 AI 检测分数吗?
能,因为检测器打分的是风格,不是内容。变化句子长度、用更具体的措辞替换统计上安全的表达、打破均匀的节奏,这些都能在论点不动的前提下拉高困惑度和突发度。这正是免费 AI 人性化工具自动化完成的事,它还会显示前后检测分数,让你亲自确认降幅。