HackTheTeacher
Blue Team· 10 min

Exámenes que la IA no puede responder: guía para profesores

Cómo rediseñar las preguntas de examen para que la IA no pueda responderlas: tipos de evaluación AI-resistant, ejemplos concretos y cómo aplicarlos en el aula.

El miércoles por la tarde corriges veinte exámenes escritos y los veinte responden igual. No igual de tema — igual de estructura, de argumentos, de giros de frase. Los mismos tres puntos desarrollados en el mismo orden. La misma frase de cierre casi palabra por palabra. O los alumnos se pusieron de acuerdo, o todos le preguntaron a ChatGPT.

Lo segundo es lo más probable. Y el problema no es que hayan usado IA: el problema es que el examen que pusiste tiene respuesta en tres segundos si sabes preguntar.

Profesor con escudo azul digital bloqueando un robot de IA rojo que intenta responder hojas de examen, estética ciberpunk de fondo oscuro
Rediseñar la evaluación es más efectivo que intentar detectar si el alumno usó IA después.Imagen generada con IA

Antes de hablar de soluciones, un segundo de honestidad: los detectores de IA no son la respuesta. Las tasas de falso positivo son demasiado altas para sancionar con ellos, y los alumnos que saben usar las herramientas de bypass los evitan sin esfuerzo. Rediseñar la evaluación elimina el problema en origen. Es más trabajo al principio, pero después el examen se defiende solo.

Esto es lo que hay que saber para hacerlo.

Por qué las preguntas clásicas son fáciles para la IA

Primero, el diagnóstico. Hay un tipo de pregunta que la IA responde bien, casi siempre mejor que un alumno medio. Son preguntas con una respuesta correcta bien documentada en internet:

  • Define / enumera / clasifica: "Define el concepto de ecosistema." ChatGPT tiene cien definiciones indexadas. La tuya ya es una más.
  • Explica la causa de X: "Explica las causas de la Primera Guerra Mundial." Cualquier LLM ha leído mil libros de historia. La pregunta es trivial.
  • Compara A y B: "Compara el metabolismo aeróbico y el anaeróbico." Hay tablas comparativas por miles en internet. La IA las conoce.
  • Resume / sintetiza: Pedir un resumen de un texto que el alumno podría haber subido al modelo directamente.

El patrón común: la pregunta pide información que ya existe de forma pública. La IA es, entre otras cosas, una base de datos masiva con capacidad de síntesis. Si la respuesta está en esa base de datos, la pregunta está resuelta.

Diagrama de dos columnas: a la izquierda preguntas que la IA responde fácilmente en rojo, a la derecha preguntas AI-resistant en azul con ejemplos de cada tipo
La diferencia no es el tema, es si la respuesta existe en los datos de entrenamiento de la IA.Imagen generada con IA

Los 5 tipos de preguntas que la IA no puede responder bien

1. Lo que pasó en tu clase específica

La IA sabe mucho, pero no sabe qué dijiste tú en clase el jueves pasado. No sabe qué resultado dio el experimento que hicisteis en el laboratorio. No sabe cómo salió el debate, quién dijo qué o cómo resolvisteis el caso clínico de la semana pasada.

Antes: "Explica el proceso de fermentación láctica." Después: "Describe qué ocurrió en el experimento de fermentación de la semana pasada, en qué se diferenció el resultado del grupo A del del grupo B, y por qué crees que fue así."

La IA puede explicar la fermentación de memoria. No puede saber lo que pasó en tu laboratorio. El alumno que no estuvo o no prestó atención no tiene material para responder esto bien.

2. La experiencia personal del alumno

Cualquier pregunta que pida lo que el alumno vivió, pensó o sintió tiene una respuesta que solo el alumno puede dar. La IA puede generar texto en primera persona, pero si el profe conoce mínimamente al alumno, el texto genérico se nota.

Ejemplos:

  • "¿Qué te costó más entender de este tema y qué hiciste para superarlo?"
  • "Describe una situación de tu vida en la que hayas aplicado, o podrías aplicar, lo que hemos visto en esta unidad."
  • "¿Hubo algún momento durante el proyecto en el que cambiaste de opinión sobre algo? ¿Cuándo y por qué?"

El riesgo de este tipo de preguntas es que el alumno que no reflexionó de verdad puede escribir algo genérico sin necesitar IA. El antídoto: cruzar con una aclaración oral corta si la respuesta no convence.

3. Análisis de un caso concreto y reciente

La IA tiene un corte de conocimiento. Y aunque lo tenga actualizado, el caso concreto que tú eliges puede ser suficientemente específico para que no haya respuesta lista.

  • Un artículo de periódico local de esa semana, con preguntas de análisis crítico.
  • Un dato real del instituto (el porcentaje de abandono escolar de tu localidad, la normativa específica de tu comunidad autónoma en vigor este año).
  • Una noticia de actualidad que salió hace dos días.

La pregunta tiene que exigir análisis, no solo descripción: "¿Qué factores económicos, según lo que hemos estudiado, pueden explicar este dato? ¿Qué política pública crees que funcionaría mejor en este contexto concreto y por qué?"

4. El proceso, no solo el resultado

Los chatbots dan respuestas terminadas. No muestran el proceso de razonamiento del alumno a menos que se lo pidas de forma muy específica, y aun así, el proceso queda plano.

Antes: "¿Cuál es la solución correcta para este circuito?" Después: "Describe cada paso de tu razonamiento para resolver el circuito. Indica en qué punto tuviste dudas y cómo las resolviste. Si cometiste un error durante el proceso, explica cuándo lo detectaste."

Esto se aplica especialmente a resolución de problemas en matemáticas, física o química. La respuesta numérica final la da la IA en segundos. El razonamiento paso a paso con reflexión sobre el error ya es mucho más difícil de fabricar.

5. La defensa oral

Es el tipo más resistente y el más costoso. Una defensa oral de diez minutos donde el alumno tiene que explicar sus respuestas, responder preguntas de seguimiento y sostener su argumento es prácticamente imposible de externalizar a una IA.

El modelo de Brown University es instructivo: el catedrático Roberto Serrano no usó software de detección. Detectó el fraude comparando las notas del examen online con las del presencial. El caso es claro: cincuenta de ochenta y seis alumnos habían copiado el parcial online. En el examen presencial posterior, esos mismos alumnos sacaron una media de cuarenta y ocho sobre cien.

Alumno exponiendo oralmente un trabajo ante un evaluador en un aula moderna, con diagramas en la pizarra, estética educativa realista
La defensa oral es la prueba más resistente a la delegación en IA: la IA no puede estar allí.Imagen generada con IA

Cómo rediseñar una pregunta sin reescribir el banco entero

No tienes que tirar tus exámenes actuales. La mayoría se pueden adaptar con un ajuste pequeño. El patrón es siempre el mismo: añadir un ancla de contexto específico que la IA no tiene.

Pregunta originalAjuste AI-resistant
"Explica el ciclo del agua""Explica el ciclo del agua y relaciona cada fase con lo que observamos en el vídeo de la depuradora que vimos en clase"
"Analiza las consecuencias de la industrialización""Analiza las consecuencias de la industrialización a partir de los datos de tu localidad que consultamos la semana pasada"
"¿Cuáles son las ventajas del trabajo en equipo?""Describe una ventaja concreta del trabajo en equipo que hayas experimentado durante el proyecto de este trimestre"
"Resume los argumentos a favor y en contra de X""Resume los argumentos que surgieron en el debate del martes y añade tu posición personal razonada"

El ancla puede ser muy pequeña: una referencia a la clase, al laboratorio, al debate, a los datos que trabajasteis. Eso ya filtra al alumno que no estuvo o no prestó atención.

La evaluación auténtica: el marco detrás del método

Lo que estamos describiendo tiene un nombre en pedagogía: evaluación auténtica. Es un enfoque en el que las tareas de evaluación se parecen a lo que el alumno haría en un contexto real: resolver un caso clínico con datos reales, analizar un contrato legal auténtico, diseñar una campaña de comunicación para un cliente ficticio pero con restricciones concretas.

La razón por la que funciona contra la IA no es que sea difícil, sino que es difícil sin contexto. La IA puede generar texto sobre marketing digital en abstracto. No puede generar la propuesta de campaña para la cooperativa de tu pueblo con un presupuesto de doce mil euros y un público objetivo de cincuenta años para arriba, a menos que le pases exactamente ese briefing. Y si el alumno le pasa ese briefing a la IA, al menos ha tenido que elaborar el briefing, lo que ya implica comprensión del tema.

Diagrama circular de evaluación auténtica: tarea situada en contexto real → proceso documentado por el alumno → defensa o entrega → retroalimentación
La evaluación auténtica no excluye la IA del proceso, pero sí requiere que el alumno aporte algo que solo él puede dar.Imagen generada con IA

Una aclaración importante: la evaluación auténtica no implica que el alumno no pueda usar IA. Puede usarla y es legítimo. Lo que cambia es que la IA no puede hacer el trabajo entero, porque el trabajo requiere contexto, experiencia o proceso que el alumno tiene que aportar.

Lo que no puedes hacer solo con esto

Un par de límites honestos que conviene tener claros.

No todo se rediseña en un fin de semana. Si tienes un banco de doscientas preguntas de test para la asignatura, convertirlas en evaluación auténtica es un proyecto de varios meses, no de un día. La estrategia más realista es aplicar el rediseño al próximo examen, no al histórico completo.

Los tests de opción múltiple son los más difíciles de hacer AI-resistant. Con un prompt bien hecho, cualquier LLM acierta el ochenta por ciento de los tests de conocimiento factual. Si el test es inevitablemente de opción múltiple (oposiciones, evaluaciones externas), el único recurso es el examen presencial con supervisión y dispositivos controlados. Para ese escenario, el post sobre cómo configurar Safe Exam Browser en Moodle es el punto de partida técnico.

El alumno con más recursos siempre encontrará el atajo. Esto no va a cambiar. Pero la evaluación AI-resistant sube el coste de copiar lo suficiente para que la mayoría decida que es más fácil aprender que rodear. El objetivo no es la impermeabilidad total, es subir el umbral lo suficiente para que el esfuerzo de trampa supere al de estudio.

Si quieres complementar el rediseño de preguntas con una rúbrica bien calibrada, en el post de rúbricas de evaluación con IA tienes el método para construirlas y los prompts exactos para que la IA te ayude a calibrar los niveles.

Y si tu centro tiene volumen de corrección grande y quieres automatizar parte del proceso de evaluación manteniendo el control pedagógico, el equipo de Happy Grades trabaja con herramientas de corrección asistida en fase de acceso anticipado.

En resumen

La IA responde bien las preguntas cuya respuesta existe en internet. Para hacer exámenes que no puedan resolverse con ChatGPT, la clave no es el software de detección sino el diseño de la pregunta: ancla al contexto de la clase, pide la experiencia personal del alumno, usa casos concretos y recientes que la IA no conoce, exige el proceso además del resultado, y recurre al oral cuando el escrito no basta. El ajuste no requiere reescribir el banco entero — una capa de contexto específico sobre las preguntas existentes ya cambia el juego.

Preguntas frecuentes

¿Qué tipos de preguntas no puede responder la IA?
Las preguntas que piden experiencia personal del alumno, referencias a lo que pasó en clase (debate, experimento, explicación del profe), análisis de un caso concreto local y reciente, o respuestas que exigen razonamiento a partir de información que el alumno tiene pero que no está en internet. La IA falla cuando no tiene fuente.
¿Basta con hacer el examen oral para evitar que la IA copie?
El examen oral bien diseñado es el más resistente, pero también el más costoso en tiempo. Una estrategia mixta (escrito AI-resistant + oral de aclaración sobre las respuestas más dudosas) suele dar mejor resultado en grupos grandes sin multiplicar el tiempo de evaluación.
¿Puedo convertir mis exámenes actuales en AI-resistant sin rehacerlos enteros?
Sí. El cambio más sencillo es añadir una capa de contexto: en vez de preguntar 'explica X', preguntar 'explica X y aplícalo al caso que vimos en clase el martes'. La IA no sabe qué pasó ese martes. Eso no requiere reescribir el banco de preguntas, solo añadir el ancla de contexto específico.
¿Los detectores de IA no son suficientes?
Los detectores tienen tasas de falso positivo que pueden sancionar a alumnos que no han copiado, y tasas de falso negativo que dejan pasar texto generado con herramientas de bypass. Rediseñar la evaluación elimina el problema en origen, sin depender de software que se equivoca y puede dar pie a recursos.
¿Qué es la evaluación auténtica?
Es un enfoque en el que las tareas de evaluación se parecen a lo que el alumno haría en la vida real: resolver un caso clínico real, analizar datos de un experimento propio, presentar un proyecto ante una audiencia. Al ser situaciones únicas y contextualizadas, son difíciles de delegar en la IA porque la IA no tiene ese contexto.