Saltar al contenido
Mohring Tech

ArtículosSalud

En Alemania, la IA ayudó a detectar más cáncer de mama sin aumentar las rellamadas

Un estudio con 463 094 mujeres encontró una tasa de detección 17,6 % mayor cuando los radiólogos usaron IA, con una tasa de rellamada similar.

Enrique Barraza MohringPublicado el 22 de setiembre de 20264 min de lectura

Fuente

Nationwide real-world implementation of AI for cancer detection in population-based mammography screening

Autores
Eisemann N, Bunk S, Mukama T, Baltus H, Elsner SA, Gomille T y otros
Publicado en
Nature Medicine, 2025
Revisión por pares
Licencia
CC BY 4.0
DOI
10.1038/s41591-024-03408-6
Repositorio
Europe PMC

Leer el paper completo

Qué encontraron

PRAIM evaluó la IA dentro de un programa real de tamizaje de cáncer de mama, no en datos de archivo. Siguió el programa alemán, que invita a mujeres de 50 a 69 años, en 12 sedes, entre julio de 2021 y febrero de 2023. Participaron 463 094 mujeres y 119 radiólogos.

En Alemania cada mamografía la leen dos radiólogos por separado. En el estudio, cada radiólogo decidía, examen por examen, si leía con el visor de siempre o con un visor que incorporaba IA. Así se tamizaron 260 739 mujeres con apoyo de IA y el resto sin ella.

La IA hacía dos cosas. Marcaba como "normales" los exámenes que consideraba muy poco sospechosos. Y funcionaba como red de seguridad: si el radiólogo daba por normal un examen que la IA consideraba muy sospechoso, el sistema lo alertaba y le señalaba la zona. La decisión final siempre fue humana.

Los resultados, ajustados por las diferencias entre grupos:

  • Con IA se detectaron 6,7 cánceres por cada 1000 mujeres; sin IA, 5,7. Es un 17,6 % más, con un intervalo de confianza de 95 % entre +5,7 % y +30,8 %.
  • La tasa de rellamada, es decir, las mujeres citadas para más pruebas, fue de 37,4 por cada 1000 con IA y de 38,3 sin IA.
  • De cada rellamada con IA, una proporción mayor terminó en cáncer: el valor predictivo positivo subió de 14,9 % a 17,9 %.
  • La red de seguridad llevó a 204 diagnósticos de cáncer en exámenes que los radiólogos habían leído primero como normales.

La IA marcó como normales el 56,7 % de los exámenes, y los radiólogos dedicaron 43 % menos tiempo a esos casos.

Qué significa

Lo relevante no es que la IA "lea mejor" que un radiólogo. Es que, integrada en el flujo de trabajo, aumentó la detección sin disparar las falsas alarmas. Ese era el punto débil de estudios anteriores, que encontraban más cánceres pero con resultados inconsistentes en las rellamadas.

La lectura más prudente: el diseño importa tanto como el algoritmo. La red de seguridad solo aparece después de que el radiólogo emite su juicio, lo que reduce el riesgo de que el médico se limite a seguir a la máquina. Un programa que quiera replicar el resultado tendría que copiar esa forma de uso, no solo comprar el software.

El otro hallazgo práctico es el tiempo. Donde faltan radiólogos, que la IA separe los casos claramente normales puede liberar horas para los difíciles. Esto sugiere, no prueba, que un programa podría ampliar su cobertura con el mismo personal.

Límites

  • No es un ensayo aleatorizado. Los radiólogos eligieron cuándo usar la IA, y los autores detectaron que algunos preferían usarla en los casos marcados como normales. Corrigieron ese sesgo con métodos estadísticos, pero un diseño observacional no descarta del todo factores no medidos.
  • Conflicto de interés. El estudio lo financió Vara, la empresa que desarrolla el software, y la empresa participó en el diseño, el análisis y la redacción. Tres autores son empleados de Vara.
  • Falta el dato que más importa. Más detección no equivale a menos muertes. El estudio aún no mide los cánceres de intervalo, los que aparecen entre dos tamizajes, ni el estadio al diagnóstico. Eso llegará en análisis de seguimiento de 2 a 3 años.
  • Sobrediagnóstico. Los autores advierten que la IA podría aumentar la detección de carcinoma ductal in situ, con el riesgo de tratar lesiones que nunca habrían causado daño.
  • Contexto. El resultado es de un programa organizado, con doble lectura y conferencias de consenso. No se traslada automáticamente a sistemas con otra organización o con un solo lector.

Para el debate

Si la IA ya clasifica como normales más de la mitad de las mamografías, ¿qué tendría que demostrarse para que una sola lectura humana reemplace a la doble lectura?

Responde a hola@mohring.tech. Las mejores respuestas se publican en el boletín.

Fragmentos citados del paper (10)
  1. El estudio PRAIM siguió el tamizaje organizado de mujeres de 50 a 69 años en 12 sedes de Alemania, entre julio de 2021 y febrero de 2023.

    PRAIM is an observational, multicenter, real-world, noninferiority, implementation study comparing the performance of AI-supported double reading to standard double reading (without AI) among women (50–69 years old) undergoing organized mammography screening at 12 sites in Germany.
  2. Participaron 463 094 mujeres y 119 radiólogos; 260 739 mujeres se tamizaron con apoyo de IA.

    From July 2021 to February 2023, a total of 463,094 women were screened (260,739 with AI support) by 119 radiologists.
  3. Con IA, la tasa de detección fue de 6,7 por cada 1000 mujeres, frente a 5,7 sin IA, un 17,6 % más.

    Radiologists in the AI-supported screening group achieved a breast cancer detection rate of 6.7 per 1,000, which was 17.6% (95% confidence interval: +5.7%, +30.8%) higher than and statistically superior to the rate (5.7 per 1,000) achieved in the control group.
  4. La tasa de rellamada fue de 37,4 por cada 1000 con IA y de 38,3 sin IA.

    The recall rate in the AI group was 37.4 per 1,000, which was lower than and noninferior to that (38.3 per 1,000) in the control group
  5. El valor predictivo positivo de la rellamada subió de 14,9 % a 17,9 %.

    The positive predictive value (PPV) of recall was 17.9% in the AI group compared to 14.9% in the control group.
  6. La red de seguridad llevó a 204 diagnósticos de cáncer que los radiólogos habían leído primero como normales.

    In the AI group ( n = 260,739), the safety net was triggered for 3,959 (1.5%) examinations, shown in 2,233 (0.9%) examinations and accepted in 1,077 (0.4%) examinations, leading to 541 (0.2%) recalls and 204 (0.08%) breast cancer diagnoses.
  7. Los radiólogos dedicaron 43 % menos tiempo a los exámenes marcados como normales.

    Overall, radiologists spent 43% less time interpreting examinations tagged as normal, with a mean reading time of 39 s for normal examinations compared to 67 s for examinations not tagged as normal
  8. El estudio es observacional y los radiólogos eligieron cuándo usar la IA, lo que introduce riesgo de sesgo.

    PRAIM is an observational study with no random assignment of screening examinations to the AI-supported and standard-of-care groups. Thus, there was a risk that confounding factors influenced radiologists’ decision to use AI to interpret examinations, which could bias the findings.
  9. La empresa que desarrolla el software financió el estudio y participó en su diseño y redacción.

    The study was funded by Vara. Vara was involved in study design, collection, interpretation of data, and in the writing of the report.
  10. El efecto sobre el cáncer de intervalo y el estadio al diagnóstico queda para análisis de seguimiento.

    The important downstream effects of AI-supported screening on overall program performance metrics, including interval cancer rate and stage-at-diagnosis distribution at subsequent screening rounds, are subject to follow-up investigations.

Este artículo explica una investigación. No es una recomendación médica ni reemplaza la consulta con un profesional de salud.

Redactado por un agente de IA (claude-opus-5-5) a partir del paper citado y verificado de forma automática contra la fuente antes de publicarse: cifras, DOI, retracciones y licencia. ¿Encontraste un error? Escribe a hola@mohring.tech; la corrección se publica con fecha al pie.

Un correo por semana con los artículos de los temas que elijas. Suscríbete al boletín