Saltar al contenido
Mohring Tech

ArtículosCiencia

La retroalimentación de la IA sirve en el primer borrador, no para calificar

En tres cursos de biología, ChatGPT-5 coincidió de forma moderada con el profesor al revisar borradores, pero se alejó en la versión corregida. Los estudiantes confiaron más en el profesor.

Enrique Barraza MohringPublicado el 23 de setiembre de 20263 min de lectura

Fuente

Evaluating Artificial Intelligence, Peer, and Instructor Feedback Across Scientific Communication Assignments in Undergraduate Biology

Autores
Boies L
Publicado en
Ecology and Evolution, 2026
Revisión por pares
Licencia
CC BY
DOI
10.1002/ece3.74365
Repositorio
Europe PMC

Leer el paper completo

Qué encontraron

Escribir para explicar ciencia es una de las mejores formas de aprenderla, pero corregir esos trabajos toma mucho tiempo. Este estudio probó si la IA puede ayudar en esa tarea.

Durante el semestre de otoño de 2025, en St. Mary's University (San Antonio, Texas), estudiantes de tres cursos de biología hicieron infografías o artículos explicativos. Cada borrador recibió comentarios de tres fuentes: ChatGPT-5, un compañero y el profesor, todos con la misma rúbrica.

Los resultados:

  • En los puntajes totales del borrador, la IA, los compañeros y el profesor coincidieron bien en dos de las tres tareas y de forma moderada en la tercera, según el coeficiente de correlación intraclase (0,79 y 0,80 frente a 0,54).
  • En la versión corregida, la IA se alejó con frecuencia del profesor, sobre todo en los criterios más exigentes: la precisión del contenido y el razonamiento propio de la biología.
  • La coincidencia fue más alta en los artículos que en las infografías.
  • Los estudiantes consideraron más útil y confiable la retroalimentación del profesor. La de la IA la percibieron de forma parecida a la de un compañero. El esfuerzo para aplicar los comentarios fue el mismo en los tres casos.

Qué significa

La conclusión del paper es que la IA funciona mejor como un primer apoyo durante la escritura que como herramienta para poner la nota final. El dato que lo sostiene es el cambio entre borrador y revisión: cuando el texto ya está razonablemente escrito, lo que queda por corregir son errores de fondo, y ahí la IA coincide menos con quien conoce la disciplina.

La lectura más prudente es que la IA ayuda a detectar problemas de forma y organización, que son muchos en un primer borrador, pero no reemplaza el juicio experto sobre si la biología está bien explicada. Esto sugiere, no prueba, que un flujo de tres capas (IA primero, compañeros después, profesor al final) podría ahorrar tiempo sin perder calidad.

Es la misma lógica con la que se hacen los artículos de este sitio: el agente redacta y una verificación separada revisa contra la fuente, pero las correcciones de los lectores y los especialistas siguen siendo la última palabra.

Límites

  • Una sola institución y pocos estudiantes. Tres cursos de matrícula modesta en una universidad. Los resultados pueden no repetirse en otros contextos.
  • Variables mezcladas. El tipo de tarea, el curso y la experiencia de los estudiantes cambiaban a la vez, así que no se puede saber cuál explica cada diferencia.
  • Opiniones con la fuente a la vista. Al responder la encuesta, los estudiantes sabían qué comentario venía de quién. Su preferencia por el profesor puede reflejar tanto la calidad de los comentarios como la autoridad que le reconocen.
  • Un solo modelo de IA. Solo se probó ChatGPT-5. Otros modelos, o el mismo con otras instrucciones, podrían dar resultados distintos.
  • Estudio exploratorio. La propia autora lo presenta como una primera aproximación, no como una evaluación definitiva.

Para el debate

Si la IA acierta más al revisar la forma que el razonamiento científico, ¿qué parte de la corrección de trabajos debería seguir siendo siempre humana?

Responde a hola@mohring.tech. Las mejores respuestas se publican en el boletín.

Fragmentos citados del paper (7)
  1. El estudio comparó la retroalimentación de ChatGPT-5, de compañeros y del profesor en infografías y artículos explicativos de tres cursos de biología.

    This exploratory study compared AI (specifically ChatGPT‐5), peer, and instructor feedback across infographic and academic explanatory article assignments implemented in three undergraduate biology courses representing diverse student populations.
  2. Se hizo en el semestre de otoño de 2025 en St. Mary's University, una institución que atiende a una alta proporción de estudiantes hispanos en San Antonio, Texas.

    This study was conducted during the Fall 2025 semester at St. Mary's University (StMU), a private, Catholic, Hispanic‐serving institution located in San Antonio, Texas.
  3. La coincidencia en los puntajes totales fue buena en dos tareas y moderada en la tercera.

    Overall agreement for total rubric scores was good for the BL 2311 infographic assignment (ICC = 0.79, 95% CI 0.66 to 0.88) and the BL 4411 academic explanatory article (ICC = 0.80, 95% CI 0.62 to 0.91), whereas agreement for the BIO 3310 infographic assignment was moderate (ICC = 0.54, 95% CI −0.07 to 0.82).
  4. La IA coincidió de forma moderada con el profesor en el borrador, pero se alejó después de la revisión, sobre todo en precisión del contenido y razonamiento disciplinar.

    AI demonstrated moderate agreement with instructor feedback during the draft stage, but agreement frequently diverged following student revision, particularly for higher‐order rubric criteria such as content accuracy and disciplinary reasoning.
  5. Los estudiantes consideraron la retroalimentación del profesor más útil y confiable, y percibieron la de la IA de forma parecida a la de sus compañeros.

    Students perceived instructor feedback as more useful and trustworthy than either peer or AI feedback, whereas the effort required to apply feedback did not differ across feedback sources. AI feedback was generally perceived similarly to peer feedback.
  6. El estudio se hizo en una sola institución, con tres cursos de matrícula modesta.

    The study was conducted at a single institution using three undergraduate biology courses with modest enrollment, which may limit the generalizability of the results.
  7. Los estudiantes conocían la fuente de cada comentario al responder la encuesta, así que sus opiniones incluyen la credibilidad que le atribuyen a cada una.

    Consequently, survey responses reflect students' perceptions of identified feedback sources rather than blinded evaluations of feedback quality and likely incorporate perceptions of source credibility in addition to judgments of feedback usefulness.

Redactado por un agente de IA (claude-opus-5-5) a partir del paper citado y verificado de forma automática contra la fuente antes de publicarse: cifras, DOI, retracciones y licencia. ¿Encontraste un error? Escribe a hola@mohring.tech; la corrección se publica con fecha al pie.

Un correo por semana con los artículos de los temas que elijas. Suscríbete al boletín