HackTheTeacher
Red + Blue· 9 min

Detectores de IA en 2026: cuáles pillan ChatGPT y cuáles no

Detectores de IA en 2026 comparados: Turnitin, GPTZero, Copyleaks y Originality.ai. Precisión real, falsos positivos y qué hacer cuando uno te señala.

María tardó tres meses en escribir su TFG. Investigación real, fuentes comprobadas, argumentos propios. Lo entregó, y a los dos días llegó el correo del tutor: Turnitin la marcaba con un 34% de escritura generada por IA. El tutor no la acusaba directamente, pero tampoco descartaba nada. Ella no sabía si llorar o explotar.

Lo que María necesitaba saber ese día —y lo que te cuento ahora— es que ese 34% no significa lo que parece. Y que ese número cambia radicalmente según qué detector use tu centro y en qué tipo de texto.

Pantalla dividida rojo-azul: a la izquierda un detector de IA marcando porcentaje sospechoso sobre texto académico, a la derecha un escudo cian de integridad académica
Cuatro detectores, un mismo texto, cuatro resultados distintos. La pregunta no es si son precisos: es cuánto te juegas cuando fallan.Imagen generada con IA

Aquí va el mapa rápido de los cuatro detectores más usados en educación ahora mismo:

DetectorPlan gratuitoResistencia a humanizersFalsos positivos (tests independientes)
TurnitinNo (institucional)MediaAfirma <1%; Vanderbilt lo rebatió
GPTZeroSí (limitado)Baja: cae al 54% con texto humanizado~20% en análisis externos
Originality.aiNo (por créditos)Alta: mantiene el 89%Bajo en inglés; sube con español académico
CopyleaksNo (trial)Media~12% en benchmark de marzo 2026

Cómo funcionan todos (y por qué fallan igual)

Todos los detectores de IA comparten el mismo mecanismo de base: miden la perplejidad del texto —lo previsible que es la siguiente palabra— y la burstiness —qué tan uniforme es el ritmo entre frases—. La IA escribe de forma predecible y plana; los humanos, a ráfagas y con variedad. Si quieres el fondo técnico completo y la historia de los humanizers, está en la guía de humanizar IA vs Turnitin.

El problema de fondo es que "previsible" no equivale a "escrito por máquina". Una redacción académica bien estructurada, con vocabulario técnico estándar y sin muletillas personales, también puntúa alto en previsibilidad. Y ahí es donde el detector puede señalarte aunque no hayas abierto el ChatGPT. La prosa correcta paga un precio que la prosa descuidada no paga.

Los números reales en 2026, uno por uno

Turnitin

El más extendido en universidades españolas, y el que más angustia provoca precisamente por eso. Su afirmación oficial: tasa de falsos positivos inferior al 1%. Su historia real: Vanderbilt lo desactivó en agosto de 2023 porque ese 1% sobre 75.000 trabajos anuales significaba unas 750 acusaciones falsas. Un número que suena minúsculo hasta que lo multiplicas por una universidad entera.

El post de Víctor Yepes del 12 de junio de 2026 —catedrático en la UPV con décadas de experiencia docente— lo condensó en cinco verdades incómodas: Turnitin no es infalible, y ningún educador debería usarlo como única base para una acción disciplinaria. Lo dice quien lo usa.

En tests independientes de 2025-2026, Turnitin oscila entre el 60% y el 80% de precisión según el tipo de texto: mejor con textos 100% generados sin editar, peor con textos mixtos o que han pasado por un humanizer.

GPTZero

La alternativa gratuita más popular entre profesores sin acceso a Turnitin. Su punto fuerte: plan gratuito suficiente para revisar trabajos puntuales, con desglose frase a frase que permite ver exactamente qué párrafo le ha sonado sospechoso.

Su punto débil es el más importante: es el más vulnerable ante los humanizers. La revisión sistemática de Universo Abierto de junio de 2026 recoge que su precisión cae de alrededor del 81% con texto sin modificar hasta solo un 54% cuando el texto ha pasado por una herramienta de humanización básica. Si el alumno ha usado un humanizer, GPTZero detecta apenas la mitad de lo que debería.

Originality.ai

El más resistente de los cuatro cuando el texto ha sido retocado. La misma evaluación sistemática de junio de 2026 le otorga un 89% de acierto incluso sobre texto que ya ha pasado por parafraseo automático. No tiene plan gratuito —funciona por créditos— y el precio puede escalar con alto volumen, pero para el profesor que quiere la señal más fiable ante trabajo humanizado, es el más sólido disponible ahora mismo.

Copyleaks

El que más presume de soporte multilingüe y de cifras propias rozando el 99%. El problema es que un benchmark independiente de marzo de 2026 con 2.400 muestras, recogido por eyesift.com en su comparativa de detectores de IA, lo bajó a un 79% de precisión global, con un 12% de falsos positivos y un 22% de falsos negativos. Es decir, dejó pasar sin detectar uno de cada cuatro textos generados por IA. Sigue siendo útil para flujos de trabajo con mucho volumen, pero la promesa del 99% no sobrevive a pruebas reales con texto variado.

El sesgo del español académico

Hay un problema que ningún detector ha resuelto y que en España importa especialmente. La prosa académica formal en español activa más alarmas falsas que el inglés coloquial. Un texto sin errores, con vocabulario de manual, bien estructurado y sin muletillas personales, puntúa alto en previsibilidad aunque lo haya escrito una persona que simplemente escribe bien.

El fenómeno ya estaba documentado en inglés: el estudio de Stanford (Liang et al.) encontró que siete detectores marcaron como IA el 61,22% de redacciones de estudiantes no nativos mientras casi no fallaban con nativos. El mecanismo es el mismo en español académico: el detector mide "previsibilidad", y quien escribe sin florituras, con vocabulario estándar, se parece estadísticamente a una máquina.

Si eres alumno y escribes bien, el detector puede señalarte aunque no hayas tocado la IA. Si eres profe y ves una tasa alta en Turnitin sobre un alumno con un historial consistente de buena escritura, ese porcentaje solo te dice que tienes que mirar más, no que ya tienes la respuesta.

Lo que calcula el alumno

Si has usado IA para tu trabajo y ahora te preguntas qué detector usará tu profe, la respuesta honesta es: probablemente Turnitin si estás en una universidad con acuerdo institucional; quizás GPTZero si es un profe que busca opciones gratuitas. Originality.ai es el más difícil de pasar si has usado un humanizer, y es cada vez más frecuente en centros que han migrado de Turnitin.

Pero hay dos señales que ningún detector toca y que son las que de verdad te pillan: el historial de edición de tus Docs y la defensa oral. Un trabajo real tiene cientos de microediciones a lo largo de días; un texto pegado de golpe aparece como un bloque único a las 23:47 de la víspera. Eso lo tienes explicado en detalle en la guía de humanizar IA vs Turnitin, junto con cómo funciona la bibliografía inventada.

El cálculo real no es "¿qué detector evito?". Es: ¿sé explicar lo que he entregado? Porque si llega la defensa oral y no puedes defender el párrafo tres, el porcentaje del detector ya da igual.

Qué debe hacer el profe cuando un detector señala

Si eres profesor y un detector te ha dado un porcentaje raro sobre el trabajo de un alumno, lo que no debes hacer es tomar ninguna acción disciplinaria basándote solo en eso. Lo que sí conviene:

Revisar el historial de edición. En Google Docs (Archivo → Historial de versiones) o en el control de cambios de Word se ve cómo creció el documento. Un bloque de texto que aparece de golpe a las 23:47 del día antes de la entrega habla más que cualquier porcentaje.

Pedir una mínima defensa oral. No hace falta un tribunal: basta con pedir al alumno que explique un párrafo o justifique una cita. Quien escribe algo puede defenderlo; quien pega texto ajeno, no.

Revisar la bibliografía. Los modelos de lenguaje fabrican referencias plausibles que no existen. Buscar las citas en Google Scholar cuesta cinco minutos y tiene mucho más peso legal y académico que cualquier cifra de un detector.

Considerar el contexto del alumno. Si siempre ha escrito correctamente y su nivel es consistente, un 30% en Turnitin es ruido. Si es la primera vez que entrega algo así y su historial apunta en otro sentido, merece una conversación, no una sanción.

Si quieres un sistema de evaluación que no dependa de los detectores —rúbricas que incluyen el proceso, entregas por fases, defensa integrada—, en tusalumnos.com trabajamos exactamente eso: evaluar lo que la IA no puede falsificar. Y en el canal @HackTheTeacher en YouTube hay episodios sobre cómo diseñar exámenes y entregas que aguantan la IA sin necesitar perseguir a nadie con un porcentaje.

Una evaluación que no necesita detectores

La alternativa más sólida a largo plazo no es encontrar el detector más preciso: es diseñar evaluaciones donde detectar se vuelva secundario. Preguntar por el proceso, no solo por el resultado. Exigir que el alumno explique su razonamiento. Usar la IA como tutor en vez de como ghostwriter. Lo trabajamos en cómo estudiar con IA de verdad: la IA que te interroga sobre tus propios apuntes enseña más que la IA que escribe por ti, y no activa ningún detector porque lo que entregas es tuyo.

En resumen

En 2026, los detectores de IA han mejorado pero siguen siendo herramientas de probabilidades, no de certezas. Originality.ai es el más robusto ante texto humanizado (89% de acierto); GPTZero, el más accesible pero el más manipulable con humanizers (54%); Turnitin, el más extendido pero con un historial de falsos positivos que obliga a usarlo con cabeza; Copyleaks, más modesto en tests independientes de lo que sus cifras propias sugieren. La evaluación sistemática publicada en Universo Abierto el 19 de junio de 2026 lo confirma: ninguno alcanza por sí solo el umbral para fundamentar una acción disciplinaria.

Para el alumno, la pregunta correcta no es qué detector evitar, sino si puede defender lo que entrega. Para el profe, la pregunta correcta no es qué porcentaje salió, sino qué otras señales acompañan ese porcentaje. Los detectores son el punto de partida. El juicio humano, el punto de llegada.

Preguntas frecuentes

¿Cuál es el detector de IA más preciso en 2026?
Depende de qué texto analices y si ha sido humanizado. Con texto humanizado, Originality.ai aguanta mejor (89% de acierto) que GPTZero, que cae al 54% según una revisión sistemática de junio de 2026. Las cifras propias de los vendedores no sobreviven a tests independientes. Ninguno debe usarse como única prueba para una acción disciplinaria.
¿Puede un detector de IA marcarme si escribí yo el texto?
Sí, y no es raro. Los falsos positivos son frecuentes con prosa académica formal y escritores no nativos. El estudio de Stanford (Liang et al.) encontró que siete detectores marcaron como IA el 61% de redacciones de no nativos. Que te señale un detector no es prueba de nada: es una señal que requiere investigación adicional.
¿Turnitin es fiable para detectar textos escritos por IA?
Turnitin publica una tasa de falsos positivos inferior al 1%, pero Vanderbilt lo desactivó en agosto de 2023 porque sobre 75.000 trabajos anuales ese 1% significaba 750 acusaciones falsas. Úsalo como señal de partida, no como veredicto, y combínalo con el historial de edición y la defensa oral.
¿Qué detector de IA debe usar un profesor?
Si tu centro ya tiene Turnitin, úsalo como punto de partida. Para triage sin coste, GPTZero tiene plan gratuito. Si quieres resistencia ante texto humanizado, Originality.ai aguanta mejor. Copyleaks es más robusto para volúmenes altos o contextos multilingüe. En todos los casos, el detector abre la investigación; no la cierra.
¿Se puede pasar un detector de IA con texto de ChatGPT humanizado?
Con un humanizer se puede bajar la puntuación de Turnitin o GPTZero, pero Originality.ai mantiene un 89% de acierto incluso con texto humanizado según datos de junio de 2026. Y los detectores son solo la mitad del problema: el historial de edición y la defensa oral no los engaña ningún humanizer.