Cómo generar rúbricas de evaluación con IA en dos minutos
Genera rúbricas analíticas y holísticas con ChatGPT en minutos: prompt base, ejemplos por asignatura y los errores que hacen que la IA no discrimine niveles.
Son las cuatro de la tarde. Tienes que entregar la programación del primer trimestre el lunes y tres asignaturas que evalúan por rúbrica: doce criterios mínimo, cuatro niveles por criterio, descriptores para cada casilla. A mano, con el cerebro en modo fin de semana, eso son cuatro horas como mínimo. En dos minutos con el prompt correcto.

Copia esto, rellena los corchetes y pégalo en ChatGPT:
Eres un experto en evaluación educativa.
Asignatura: [ASIGNATURA]
Nivel: [ESO / Bachillerato / FP / Universitario]
Actividad a evaluar: [DESCRIPCIÓN BREVE]
Nota máxima: [PUNTOS]
Número de criterios: [entre 3 y 5]
Genera una rúbrica analítica con:
1. Los criterios de evaluación más relevantes para esta actividad.
2. Para cada criterio: 4 niveles de logro (Excelente / Notable / Suficiente / Insuficiente).
3. Descriptores CONDUCTUALES para cada nivel — nada de "respuesta correcta" ni
"ideas bien expresadas". Qué hace exactamente el alumno en ese nivel.
4. Ponderación de cada criterio (que sumen [PUNTOS] en total).
IMPORTANTE: Los descriptores deben permitir distinguir entre un 0, un aprobado
justo y una nota de 9 sin que yo tenga que interpretar nada.El resultado, sin retocar, ya es mejor que la mayoría de las rúbricas que circulan en los departamentos. En las próximas secciones te cuento por qué a veces no lo parece — y cómo corregirlo.
Rúbrica analítica vs. holística: cuándo usar cada una
La distinción no es académica. Determina si la rúbrica te sirve para corregir o solo para poner la nota.
Analítica: cada criterio puntúa de forma independiente. Si el alumno domina la argumentación pero falla en las fuentes, eso queda reflejado exactamente en la nota y en el feedback. Es la que mejor funciona cuando luego quieres que la IA corrija de forma consistente, porque el modelo tiene un estándar claro para cada dimensión.
Holística: una sola nota global con una descripción del nivel. Más rápida de aplicar, suficiente para trabajos donde el producto final importa más que el proceso, y útil cuando no tienes tiempo de desglosar criterio a criterio. En actividades expresivas breves (una presentación oral de cinco minutos, un comentario de texto en clase) puede ser la opción pragmática.

Para añadir el modo holístico al prompt base, sustituye el bloque de instrucciones por:
Genera una rúbrica holística con 4 niveles de logro (Excelente / Notable /
Suficiente / Insuficiente). Para cada nivel, una descripción de 3-4 líneas
que capture el conjunto de la actuación del alumno. Los descriptores deben
ser conductuales: qué hace el alumno, no qué "tiene" o "demuestra".El error que convierte la rúbrica en inútil
ChatGPT, sin instrucción explícita, genera descriptores vagos. El tipo de cosa que cualquier profe que lleve tres años en el sistema ya sabe que no sirve:
"El alumno muestra comprensión del tema y articula sus ideas de forma coherente."
¿Eso es un 10 o un 5? Tú lo decides en el momento de corregir, que es exactamente lo que ibas a hacer antes de la rúbrica. La IA ha copiado el formato sin aportar el estándar.
El descriptor conductual deja poco margen:
Excelente (2,5 pts): Articula mínimo tres argumentos históricos con causa, consecuencia y evidencia textual. Conecta dos o más contextos cronológicos distintos.
Notable (2 pts): Articula dos argumentos con causa y consecuencia. Las evidencias son genéricas o poco precisas.
Suficiente (1 pt): Menciona hechos del texto sin establecer relaciones causales. La argumentación es descriptiva, no explicativa.
Insuficiente (0 pts): Copia frases del texto sin reformular. No aparece ningún argumento propio.

Si el primer borrador de ChatGPT sigue siendo demasiado genérico, añade al final del prompt:
Revisa los descriptores del nivel Suficiente. Cada uno debe incluir:
a) una acción observable del alumno (verbo concreto)
b) la cantidad mínima o el umbral que distingue ese nivel del Insuficiente
c) lo que le falta respecto al nivel Notable.Una vuelta de refinamiento y el estándar ya es tuyo.
Tres ejemplos por asignatura
Historia — Comentario de texto selectividad
Cuatro criterios para 10 puntos. Diseñado para el modelo PAU (prueba de acceso a la universidad), donde el comentario de texto vale entre el 30% y el 40% de la nota final.

Prompt específico:
Asignatura: Historia de España
Nivel: Bachillerato (PAU)
Actividad: Comentario de texto histórico (fuente primaria, 20 líneas)
Nota máxima: 10 puntos
Criterios: 4
1. Identificación y contextualización de la fuente (2 pts)
2. Análisis del contenido y argumentación (3 pts)
3. Relación con el contexto histórico (3 pts)
4. Expresión escrita y estructura (2 pts)
Genera la rúbrica con 4 niveles por criterio. Descriptores conductuales.Inglés — Redacción escrita (Writing)
Para nivel B1-B2 (3.º o 4.º ESO, Bachillerato). Cuatro criterios siguiendo el modelo de las pruebas Cambridge y las PAU de idiomas:
Asignatura: Inglés
Nivel: Bachillerato (B2)
Actividad: Redacción argumentativa (180-220 palabras)
Nota máxima: 10 puntos
Criterios: 4
1. Cumplimiento de la tarea (3 pts): ¿responde a lo pedido? ¿incluye los puntos exigidos?
2. Coherencia y cohesión (2,5 pts): estructura, conectores, progresión temática.
3. Rango léxico (2,5 pts): variedad y precisión del vocabulario.
4. Corrección gramatical (2 pts): errores que impiden la comprensión vs. errores menores.
Descriptores conductuales en inglés (los alumnos verán la rúbrica).Nota: pedir los descriptores en inglés para Inglés no es capricho — si vas a compartir la rúbrica con el alumno antes de la actividad (que es la práctica recomendada), tiene más sentido que esté en la lengua que van a usar.
Matemáticas — Resolución de problemas
El error más frecuente en las rúbricas de Mates es evaluar solo el resultado final (bien o mal). La IA puede ayudarte a desglosar el proceso:
Asignatura: Matemáticas
Nivel: 4.º ESO / Bachillerato
Actividad: Problema de aplicación (geometría analítica o estadística)
Nota máxima: 10 puntos
Criterios: 4
1. Comprensión del problema (2 pts): identifica datos, incógnita y condición.
2. Planteamiento (3 pts): estrategia correcta, uso del modelo matemático adecuado.
3. Desarrollo y cálculo (3 pts): procedimiento, notación, coherencia de unidades.
4. Verificación y comunicación (2 pts): comprueba el resultado, responde la pregunta formulada.
El nivel Insuficiente de cada criterio debe describir el error típico que comete
el alumno en ese punto, no solo "no lo hace".La última instrucción — describir el error típico — es especialmente útil en Mates, donde el fallo suele ser el mismo siempre (invertir el denominador, olvidar la condición del problema, no verificar si el resultado tiene sentido físico).
Lo que ChatGPT no puede saber
La rúbrica que genera es válida para el grupo estándar. No sabe si tienes una alumna con dislexia que necesita tiempo extra, un alumno recién llegado sin base de la lengua vehicular, o que tu clase tiene el nivel real de 2.º aunque estés en 4.º.
Dos complementos que puedes añadir al prompt cuando el contexto lo pide:
Mi grupo tiene alumnos con dificultades lectoras. Señala qué criterios
admiten adaptación sin modificar los objetivos de etapa (no me des la ACI,
solo dónde hay margen).El nivel real del grupo es inferior al curricular. Añade una fila de
"Nivel inicial (0,5 pts)" en los criterios 2 y 3 para reconocer el
esfuerzo sin inflar la nota.El resultado no sustituye la revisión del departamento de orientación, pero sí te da un punto de partida para la conversación con el orientador o el PT.
El paso siguiente: que la IA corrija con tu rúbrica
Una rúbrica con descriptores conductuales específicos es el input que necesita un LLM para corregir de forma consistente. Sin ella, el modelo aplica su propio criterio en cada corrección y los resultados varían. Con ella, el estándar es tuyo y la IA lo aplica.
El flujo completo — cómo pegar la rúbrica, cómo estructurar las respuestas de los alumnos y cómo manejar los casos límite — está en cómo corregir exámenes con IA. Si llegas ahí con la rúbrica ya generada desde este post, la mitad del trabajo ya está hecho.
Y si el punto de partida es la planificación — quieres que la rúbrica encaje con los criterios de evaluación de la unidad didáctica — el flujo completo desde los objetivos LOMLOE hasta los instrumentos de evaluación está en cómo generar una unidad didáctica con IA.
Para el seguimiento de cómo cada alumno evoluciona en los criterios de la rúbrica a lo largo del trimestre, tusalumnos.com centraliza eso sin que tengas que montarte una hoja de cálculo.
Si quieres profundizar en la evaluación con IA de forma estructurada, en academy.hacktheteacher.com tienes el catálogo de formación actualizado para este curso.
En resumen
Dos minutos de prompt dan una rúbrica mejor que la mayoría de las que hay en los cajones de los departamentos — siempre que le fuerces a usar descriptores conductuales. El error que mata la rúbrica es el descriptor vago: "la respuesta es correcta" no es un estándar, es diferir la decisión al momento de corregir. Pídele que concrete qué hace el alumno en cada nivel, añade una vuelta de refinamiento si el borrador sigue siendo genérico, y tendrás un instrumento que aguanta tanto una corrección humana como una corrección con IA.
Preguntas frecuentes
- ¿Cuál es la diferencia entre una rúbrica analítica y una holística?
- La analítica descompone la nota en criterios separados (cada uno puntúa de forma independiente) y es la que mejor funciona con IA porque permite dar feedback preciso por criterio. La holística asigna una única puntuación global a partir de una descripción del nivel general — útil para correcciones rápidas cuando no necesitas desglosar el detalle.
- ¿ChatGPT genera rúbricas que de verdad discriminan niveles?
- Sí, si el prompt lo obliga a escribir descriptores conductuales específicos. Sin instrucción explícita, genera descriptores vagos como 'la respuesta es correcta', que no te dicen nada. La clave está en pedir comportamientos observables: qué hace exactamente el alumno en cada nivel, no qué 'tiene' o 'demuestra'.
- ¿Cuántos criterios debe tener una rúbrica de evaluación?
- Entre 3 y 6 para que sea manejable. Con menos de 3 pierdes granularidad; con más de 6, la corrección se convierte en un formulario. Para actividades de 10 puntos, 4-5 criterios con pesos de 2-3 puntos cada uno es lo más común en ESO y Bachillerato.
- ¿Puedo usar esta rúbrica para que la IA corrija los exámenes?
- Exacto: ese es el siguiente paso. Una rúbrica con descriptores conductuales específicos es el input que necesita un LLM para corregir de forma consistente. Sin rúbrica clara, la IA aplica su propio criterio en cada corrección. Con ella, el estándar es tuyo.
- ¿Tengo que adaptar la rúbrica para alumnos con NEE?
- ChatGPT no sabe quién está en tu clase. La rúbrica que genera es válida para el grupo-clase estándar; si tienes alumnos con adaptaciones curriculares, añade al final del prompt: 'Indica qué criterios admiten adaptación sin modificar los objetivos de etapa.' El resultado no te da la ACI, pero sí te señala dónde hay margen.