Cómo funcionan realmente los detectores de IA (y por qué te marcan)
Cada vez que una herramienta como GPTZero o Turnitin etiqueta tu escritura como "generada por IA", está haciendo una conjetura estadística, no una prueba de polígrafo. Entender cómo funcionan los detectores de IA es el primer paso para escribir texto que se lea como genuinamente humano.
Qué mide realmente un detector de IA
Un detector de IA no sabe quién escribió una oración. Nunca ha visto tu documento antes y no puede compararlo con una base de datos oculta de respuestas de ChatGPT. En cambio, puntúa qué tan predecible es tu texto en comparación con los patrones que suelen producir los grandes modelos de lenguaje.
Los detectores modernos son a su vez modelos de aprendizaje automático entrenados con millones de pasajes humanos y de IA. Buscan las huellas estadísticas que deja la generación y luego devuelven una probabilidad. Nada en ese proceso verifica la autoría. Un detector no puede ver tu historial de navegación ni observarte teclear; solo puede decir que tu texto se parece, o no se parece, a la escritura de máquina con la que fue entrenado.
Piénsalo como un filtro de spam. Ha aprendido cómo suele verse el correo basura, así que marca los mensajes que comparten esos rasgos, pero nunca puede estar seguro de un correo concreto. La detección de IA funciona igual, lo que significa que cada puntuación es una corazonada disfrazada de número. Eso también cambia cómo debes leer un resultado: "85% IA" no significa que el 85% de tu texto lo escribió una máquina. Significa que el detector está bastante seguro de una conjetura.
Perplejidad: qué tan sorprendentes son tus palabras
La perplejidad es la señal más importante de todas. Mide cuánto le sorprende a un modelo de lenguaje cada palabra que elegiste. Si cada palabra siguiente es exactamente la que el modelo habría predicho, la perplejidad es baja y el texto parece escrito por una máquina. Los humanos somos menos predecibles: usamos un adjetivo raro, rompemos una regla o formulamos algo de un modo un poco torpe, y cada una de esas decisiones sube la perplejidad.
Un par de ejemplos concretos lo hace visible. Oración uno: "El ejercicio regular es importante porque mejora la salud física y mental". Oración dos: "Sigo haciendo ejercicio porque mis rodillas se quejan menos y mi bandeja de entrada da menos miedo después". Ambas son gramaticales y ambas dicen básicamente lo mismo, pero la primera está armada por completo con palabras que un modelo de lenguaje clasificaría como la siguiente opción más probable; "el ejercicio regular es importante porque" es prácticamente una plantilla. La segunda asume pequeños riesgos: rodillas que se quejan, una bandeja de entrada que asusta. Un modelo que puntúa la probabilidad palabra por palabra encuentra la primera oración nada sorprendente y la segunda genuinamente difícil de predecir, así que la primera se lee como IA y la segunda como humana.
Por eso la escritura pulida y genérica se marca incluso cuando una persona escribió cada palabra. La perplejidad no mide el esfuerzo ni la honestidad, solo la previsibilidad, y hay escritura perfectamente humana que es muy predecible.
Burstiness: el ritmo de la escritura real
La burstiness mide la variación en la estructura y la longitud de las oraciones. Las personas escriben a ráfagas: una oración larga y sinuosa seguida de una corta. Tres palabras. Luego una cláusula compleja cargada de detalle que se alarga más de lo que probablemente debería.
La salida de la IA es más lisa. Con sus ajustes por defecto, un modelo produce oraciones que rondan la misma longitud, abren con construcciones similares y aterrizan con la misma cadencia uniforme, párrafo tras párrafo. Pon los dos textos lado a lado y a menudo puedes notar la diferencia antes de leer una palabra: el texto humano se ve irregular en la página, el texto de máquina parece un muro de ladrillos.
Los detectores cuantifican esa irregularidad. Baja burstiness más baja perplejidad es la firma clásica de la IA, y cuando ambas están presentes el detector gana confianza en que el texto fue generado, aunque el tema y la gramática sean impecables. Sin embargo, cada señal por sí sola es débil. Un poeta escribe con una burstiness desbordada y un abogado de contratos casi sin ninguna, y ambos son humanos, y por eso las herramientas serias siempre combinan las dos.
La probabilidad de tokens por dentro
Los modelos de lenguaje escriben un token a la vez, y cada token viene con una puntuación de probabilidad. Los detectores aproximan esas probabilidades y comprueban si tu texto se mantiene dentro de la "zona de confort" de elecciones probables del modelo. Cuando un pasaje está construido casi por completo con tokens de alta probabilidad dispuestos en un ritmo uniforme, coincide con la forma en que ChatGPT, Gemini y Claude generan por defecto, y el detector convierte ese patrón en el porcentaje que ves.
Esto también explica por qué los fragmentos cortos son poco fiables para hacer pruebas. Con solo una o dos oraciones no hay señal suficiente para distinguir a un humano cuidadoso de un modelo, así que las puntuaciones oscilan sin control. La mayoría de los proveedores lo admite en silencio: varios se niegan a puntuar cualquier cosa por debajo de unos cientos de palabras, porque por debajo de esa longitud la matemática se parece más a lanzar una moneda que a una medición.
Detectores estadísticos vs detectores basados en clasificadores
Las herramientas de detección se dividen en dos familias, y saber cuál tienes delante explica muchos resultados extraños. Los detectores estadísticos usan un modelo de lenguaje de referencia para calcular probabilidades directamente: pasan tu texto por el modelo, miden la perplejidad, la burstiness y magnitudes relacionadas, y luego aplican un umbral. Métodos de investigación como GLTR y DetectGPT funcionan así, igual que la puntuación detrás de muchos verificadores gratuitos. Su fortaleza es que no necesitan datos etiquetados de entrenamiento; su debilidad es que el veredicto depende mucho de qué modelo de referencia hace la puntuación.
Los detectores basados en clasificadores, en cambio, se entrenan. El proveedor reúne grandes corpus de texto humano confirmado y de IA confirmada y luego ajusta un modelo, a menudo un transformador tipo RoBERTa, para distinguirlos. Turnitin, Originality.ai y Copyleaks están construidos así. Los clasificadores captan pistas sutiles más allá de la perplejidad bruta, así que tienden a ser más precisos con texto parecido a sus datos de entrenamiento, pero se degradan con la escritura de modelos más nuevos, de otros idiomas o de dominios que nunca vieron, y nadie fuera del proveedor puede inspeccionar qué aprendieron en realidad.
La mayoría de los productos comerciales son ahora híbridos de ambos enfoques, y esa es una de las razones por las que sus puntuaciones son difíciles de interpretar y aún más difíciles de comparar entre herramientas.
Por qué se marca la salida de ChatGPT, Gemini y Claude
Los modelos de frontera están entrenados para ser claros, seguros y fluidos, y la ronda final de ese entrenamiento premia las respuestas que la mayoría de los evaluadores califica como bien escritas. Eso empuja la salida hacia oraciones equilibradas, transiciones ordenadas como "además" y "en conclusión", y un vocabulario que se queda en el punto medio estadístico del camino.
Esas mismas cualidades son exactamente lo que los detectores buscan. Cuanto más pulida y "promedio" es la escritura, más bajas son su perplejidad y su burstiness, y más alta la puntuación de IA. Irónicamente, los borradores humanos en bruto, llenos de erratas y rarezas, suelen pasar con más facilidad que un primer borrador limpio de IA, porque los defectos son los que llevan la señal humana.
Qué comprueban realmente GPTZero, Turnitin, ZeroGPT y otros
Las herramientas principales comparten la misma lógica central pero la ajustan de forma distinta. GPTZero popularizó la puntuación de perplejidad y burstiness y reporta ambas a nivel de oración. Turnitin AI integra la detección en su paquete antiplagio para escuelas, dividiendo los documentos en segmentos superpuestos y marcando los que su clasificador cree escritos por un modelo.
ZeroGPT ofrece una lectura rápida y gratuita por oración, mientras que Originality.ai apunta a editoriales y equipos de SEO con una puntuación estricta ponderada por confianza. Copyleaks pone el énfasis en la cobertura multilingüe y los informes empresariales. Todas son probabilísticas, y por eso ninguna puede afirmar honestamente que es perfecta, y el marketing de precisión de cada proveedor describe, sin decirlo, pruebas diseñadas por el propio proveedor.
Por qué los detectores no se ponen de acuerdo entre sí
Pega el mismo ensayo en tres detectores y puedes obtener 2% de IA en uno, 45% en otro y 88% en un tercero. Esa dispersión no es un fallo de uno de ellos; es lo que pasa cuando sistemas distintos hacen conjeturas distintas a partir de la misma evidencia.
Cada herramienta se entrena con su propio corpus, puntúa con su propio modelo de referencia, trocea el texto de forma diferente (documento completo frente a oración por oración) y fija su propio umbral de lo que cuenta como "probablemente IA". Una herramienta calibrada para evitar acusaciones falsas será conservadora y marcará de menos; una herramienta que se vende para atrapar tramposos será agresiva y marcará de más el mismo texto. También se actualizan en calendarios distintos, así que un detector ajustado antes del lanzamiento de un modelo nuevo juzgará mal el estilo de ese modelo durante meses.
La lección práctica es que ninguna puntuación aislada es definitiva, y el desacuerdo entre herramientas es evidencia directa de cuánta conjetura hay en juego. Si tu escuela revisa con Turnitin, solo importa el veredicto de Turnitin, y una puntuación limpia en otra parte ni lo predice ni te protege de él.
Falsos positivos: los números publicados
Como los detectores juzgan la previsibilidad, fallan con regularidad, y los fallos no son hipotéticos. El propio clasificador de OpenAI, lanzado en enero de 2023, identificó solo el 26% del texto escrito por IA mientras etiquetaba mal como IA el 9% del texto humano, y la compañía lo retiró en seis meses por baja precisión. Turnitin afirma una tasa de falsos positivos a nivel de documento inferior al 1%, pero ha reconocido que las oraciones marcadas individualmente son mucho menos fiables, y por eso retiene puntuaciones en documentos con solo pequeñas cantidades de texto sospechoso de IA.
El hallazgo más preocupante afecta a los hablantes no nativos de inglés. Investigadores de Stanford probaron siete detectores populares con ensayos escritos por estudiantes reales para el examen TOEFL y encontraron que, en promedio, el 61% de esos ensayos escritos por humanos fue marcado como generado por IA, y casi todos fueron marcados por al menos un detector. Los ensayos de estudiantes estadounidenses nativos pasaron por las mismas herramientas casi sin tocarse.
El mecanismo es exactamente el que describe este artículo: quienes escriben en una segunda lengua tienden a usar vocabulario más seguro y estructuras de oración más regulares, lo que baja la perplejidad, lo que se lee como texto de máquina. El sesgo está incrustado en el método mismo. Por eso las escuelas responsables tratan la puntuación de un detector como el inicio de una conversación, no como prueba. Un número no es evidencia.
Marcas de agua: la solución que no ha llegado
Los investigadores llevan tiempo sosteniendo que la solución real es la marca de agua: que el propio modelo de IA incruste una firma estadística invisible en el momento de generar. En el esquema más conocido, el modelo favorece en secreto una "lista verde" rotatoria de tokens mientras escribe. Un lector no puede notar el patrón, pero un detector que tenga la clave puede buscarlo con una precisión muy superior a la de adivinar por perplejidad.
En su mayor parte, no ha llegado a producción. OpenAI construyó un marcador de texto del que se informó internamente que era efectivo en torno al 99.9% en pasajes largos, y lo ha guardado en un cajón, citando la preocupación de que el parafraseo o la traducción borran la marca, de que podría estigmatizar a hablantes no nativos que usan la IA legítimamente para pulir y, de forma menos noble, de que los usuarios simplemente migrarían a herramientas que no marcan. SynthID-Text de Google es la excepción: funciona dentro de Gemini y se publicó como código abierto, pero solo marca la salida del propio Gemini.
Ese es el problema de fondo: una marca de agua solo cubre los modelos cuyos creadores cooperan, y los modelos de pesos abiertos que cualquiera puede ejecutar en local nunca la llevarán. Así que el detector que tu escuela o tu empleador usa hoy sigue haciendo estadística, no leyendo marcas de agua, con toda la incertidumbre que eso implica.
Cómo manejan los detectores el texto mixto humano y de IA
Los documentos reales rara vez son una sola cosa. Un estudiante redacta la introducción a mano, le pide a ChatGPT que amplíe dos párrafos del cuerpo y luego edita el conjunto. Los detectores lo afrontan deslizando una ventana por el documento, puntuando cada oración o segmento por separado y resaltando los tramos que parecen generados.
La mezcla debilita todas las señales. Las ediciones humanas dentro de un párrafo de IA suben su perplejidad; las oraciones de IA dentro de una sección humana arrastran su ritmo hacia la uniformidad. El resultado es una puntuación intermedia que podría significar "mitad IA" o "todo humano, escrito de forma rara", y los resaltados por oración son notablemente menos fiables que el número global. Turnitin, por ejemplo, ha dicho que sus marcas a nivel de oración tienen una tasa de error mayor que su puntuación de documento, y durante un tiempo se negó a mostrar porcentajes bajos porque eran demasiado inestables.
En resumen: cuanto más mezclado el documento, más borroso el veredicto, y las oraciones resaltadas en un informe merecen aún más escepticismo que el porcentaje del titular.
Cómo humanizar baja la puntuación
Si los detectores premian la perplejidad y la burstiness altas, la solución es escribir más como una persona: variar la longitud de las oraciones, usar elecciones de palabras menos predecibles, añadir transiciones naturales y romper el ritmo uniforme. Hacerlo a mano en un documento completo es lento, y por eso existe el humanizador de IA: para reescribir el texto y restaurar esa variación humana automáticamente.
Una herramienta como Humanize AI reformula la salida del modelo para que recupere una burstiness natural y una redacción menos predecible, ayudándola a eludir la detección de IA mientras mantiene intacto tu significado. Lo crucial es que muestra una puntuación de antes y después con detectores reales, así que mides el cambio en lugar de esperar que ocurra. La meta no es el engaño, sino una escritura que por fin suene a ti.
Qué significa esto para ti en la práctica
De cómo funciona la tecnología se desprenden algunos hábitos directos. Haz la prueba antes de entregar, porque adivinar una puntuación no tiene sentido cuando comprobarla es gratis; puedes pasar tu borrador por el humanizador de IA gratuito y ver los números de los detectores antes que nadie. Nunca confíes en un veredicto sobre un pasaje corto, y trata los resaltados a nivel de oración como evidencia débil en el mejor de los casos.
Si escribes con honestidad, guarda tus comprobantes: las versiones del borrador, las notas y el historial de edición son una prueba de autoría mucho mejor que cualquier contrapuntuación, sobre todo si eres un hablante no nativo que escribe en el registro formal del que los detectores desconfían. Y si te enfrentas a un verificador concreto, aprende su comportamiento concreto; Turnitin en particular tiene peculiaridades que vale la pena conocer, y por eso escribimos la guía de Turnitin como complemento de esta.
Sobre todo, recuerda qué es un detector. Es un comparador de patrones que puntúa previsibilidad, construido por un proveedor, ajustado a un umbral y equivocado a una tasa medible en ambas direcciones. Útil, a veces. Prueba, nunca.
Preguntas frecuentes
¿Qué tan precisos son realmente los detectores de IA?
Menos precisos de lo que sugiere su marketing. OpenAI retiró su propio detector después de que atrapara solo el 26% del texto de IA mientras marcaba el 9% del texto humano, y las pruebas independientes encuentran con regularidad tasas de error de dos dígitos en texto parafraseado o editado. Las mejores herramientas sí superan por mucho el azar con salida de IA larga y sin editar, pero cada puntuación es una estimación de probabilidad, no un hecho verificado.
¿Puede un detector de IA probar que usé ChatGPT?
No. Los detectores miden qué tan estadísticamente predecible es tu escritura; no pueden verificar quién la tecleó, y fallan en ambas direcciones a tasas documentadas. Una puntuación es una conjetura con forma de acusación. Si hiciste el trabajo tú mismo, los borradores, los esquemas y el historial de versiones son evidencia real de un modo en que una contrapuntuación de otro detector no lo es.
¿Por qué dos detectores dan puntuaciones completamente distintas sobre el mismo texto?
Porque son adivinadores distintos. Cada herramienta se entrena con sus propios datos, puntúa con su propio modelo de referencia, trocea el texto de otra manera y fija su propio umbral para llamar IA a algo. Una herramienta conservadora marca de menos y una agresiva marca de más exactamente el mismo párrafo. El desacuerdo entre detectores es normal, y es un buen recordatorio de cuánta incertidumbre hay detrás de cada porcentaje.
¿Funcionan los detectores de IA con textos cortos?
Mal. La perplejidad y la burstiness necesitan suficientes palabras para formar un patrón, y una o dos oraciones simplemente no contienen señal suficiente. Las puntuaciones sobre fragmentos oscilan sin control, y por eso varios proveedores se niegan a puntuar nada por debajo de unos cientos de palabras. Trata cualquier veredicto sobre un pasaje corto, incluida una sola oración resaltada en un informe largo, con mucho escepticismo.
¿Puedo bajar una puntuación de detección de IA sin cambiar mi significado?
Sí, porque los detectores puntúan el estilo, no el fondo. Variar la longitud de las oraciones, sustituir frases estadísticamente seguras por elecciones de palabras más específicas y romper el ritmo uniforme suben la perplejidad y la burstiness dejando tu argumento intacto. Eso es exactamente lo que automatiza el humanizador de IA gratuito, y muestra puntuaciones de antes y después para que confirmes la bajada tú mismo.
Prueba el humanizador de IA gratuito
Pega tu texto y observa la puntuación de IA antes y después en segundos. Sin registro y funciona en cualquier idioma.
Humanizar texto