Saltar al contenido
Mohring Tech

ArtículosSalud

Un modelo de IA con análisis de sangre detecta tumores digestivos, pero da muchas falsas alarmas

Con siete indicadores de laboratorio, el modelo tuvo 95,4 % de sensibilidad en un hospital de China. Cuando el tumor es poco frecuente, la mayoría de sus positivos serían falsos.

Enrique Barraza MohringPublicado el 23 de setiembre de 20263 min de lectura

Fuente

Serum Cystatin 4 combined with routine clinical laboratory indicators: A support vector machine diagnostic model for early screening of gastrointestinal tumors

Autores
Bi H, Yin L, Fang W, Shen J
Publicado en
PLOS ONE, 2026
Revisión por pares
Licencia
CC BY
DOI
10.1371/journal.pone.0353753
Repositorio
Europe PMC

Leer el paper completo

Qué encontraron

Un equipo de dos hospitales de Hefei, en China, quiso saber si análisis de sangre que ya se hacen de rutina podían ayudar a detectar tumores del aparato digestivo sin recurrir primero a una endoscopía.

Compararon 214 pacientes con tumores gastrointestinales y 130 personas sin tumor. De 38 indicadores de laboratorio, seleccionaron siete, entre ellos la edad, el hematocrito, las plaquetas y una proteína llamada cistatina 4. Con esos siete datos entrenaron 11 algoritmos de aprendizaje automático. El mejor fue una máquina de vectores de soporte.

En el grupo de prueba, ese modelo obtuvo:

  • un AUC de 0,85, una medida general de capacidad para distinguir enfermos de sanos;
  • una sensibilidad de 95,4 %: detectó a casi todas las personas con tumor;
  • una especificidad de 61,5 %: acertó con poco más de la mitad de las personas sanas;
  • un valor predictivo positivo de 80,5 % y uno negativo de 88,9 %.

Qué significa

La cifra que más importa no está en el titular del paper, sino en su discusión. En el estudio, el 62,2 % de las personas tenía un tumor, una proporción muy alta porque se eligieron así a propósito. En ese escenario, cuando el modelo dice "positivo", acierta en el 80,5 % de los casos.

Pero en una consulta real el tumor es mucho menos frecuente. Los autores calculan que, si solo el 5 % de las personas evaluadas tuviera un tumor, el valor predictivo positivo caería a cerca de 11,5 %. Es decir, la gran mayoría de los positivos serían falsas alarmas, y cada una llevaría a una endoscopía de confirmación. Con una especificidad de 61,5 %, cerca de 38,5 % de las personas sanas saldrían positivas.

La lectura más prudente es que el modelo sirve mejor para descartar que para confirmar. Un resultado negativo es bastante confiable; uno positivo, casi nunca es suficiente por sí solo.

Este paper es un buen ejemplo de por qué la precisión de una herramienta de IA en salud no se puede resumir en un solo número: depende de a quién se le aplica.

Límites

  • Sin validación externa. El modelo no se probó en pacientes de otro hospital o región. Los propios autores lo califican como una limitación crítica.
  • Diseño que infla el rendimiento. Es un estudio retrospectivo, de un solo centro, con casos y controles elegidos por separado. Los autores advierten que ese diseño puede dar mejores resultados que un tamizaje real.
  • No sirve para la población general. Por su especificidad modesta, los autores lo proponen solo como apoyo para personas de alto riesgo.
  • Solo datos de laboratorio. No incluye síntomas, antecedentes ni imágenes, que en la práctica pesan en la decisión de hacer una endoscopía.

Para el debate

¿Qué debería exigirse a un modelo de diagnóstico antes de usarlo fuera del hospital donde se entrenó, cuando su precisión depende tanto de a quién se le aplica?

Responde a hola@mohring.tech. Las mejores respuestas se publican en el boletín.

Fragmentos citados del paper (7)
  1. El estudio comparó 214 pacientes con tumores gastrointestinales y 130 personas sin tumor, a partir de 38 indicadores de laboratorio.

    A retrospective study included 214 gastrointestinal tumor patients (observation group) and 130 non-tumor individuals (control group). Thirty-eight laboratory indicators were detected, and seven core variables (HCT, Age, TP, ALB, PLT, WBC, CST4) were identified via feature selection.
  2. El mejor modelo, una máquina de vectores de soporte, obtuvo un AUC de 0,85, sensibilidad de 95,4 % y especificidad de 61,5 %.

    The SVM model showed the best performance: AUC = 0.85 (95% CI: 0.78–0.92), sensitivity = 95.4% (95% CI: 0.87–0.98), specificity = 61.5% (95% CI: 0.52–0.71), PPV = 80.5% (95% CI: 0.74–0.86), NPV = 88.9% (95% CI: 0.81–0.94) in the test set.
  3. Los valores predictivos reflejan una prevalencia de 62,2 % en el estudio; con 5 %, el valor predictivo positivo cae a cerca de 11,5 %.

    The observed PPV and NPV reflect the high study prevalence (62.2%); in low-prevalence settings (e.g., 5% in high-risk clinics), PPV decreases to ~ 11.5%, while NPV remains high, highlighting the model’s value as a rule-out test.
  4. Con una especificidad de 61,5 %, cerca de 38,5 % de las personas sin tumor tendrían un falso positivo.

    However, the specificity of 61.5% implies that ~ 38.5% of non-tumor individuals would yield false-positive results, necessitating confirmatory endoscopy for a substantial proportion.
  5. El modelo no se validó en un grupo independiente de otro centro, y los autores lo reconocen como una limitación crítica.

    However, external validation on an independent, prospectively recruited cohort from a different center or geographic region was not performed in this study, which is acknowledged as a critical limitation per TRIPOD-AI Item 19a.
  6. El diseño retrospectivo de un solo centro puede inflar el rendimiento respecto de un tamizaje real.

    Second, the single-center retrospective design and case-control sampling may inflate diagnostic performance compared with real-world screening populations.
  7. Los autores lo proponen como apoyo para grupos de alto riesgo, no para tamizar a la población general.

    Due to its modest specificity, it is suitable as an auxiliary risk stratification tool for high-risk individuals but not for general population screening.

Este artículo explica una investigación. No es una recomendación médica ni reemplaza la consulta con un profesional de salud.

Redactado por un agente de IA (claude-opus-5-5) a partir del paper citado y verificado de forma automática contra la fuente antes de publicarse: cifras, DOI, retracciones y licencia. ¿Encontraste un error? Escribe a hola@mohring.tech; la corrección se publica con fecha al pie.

Un correo por semana con los artículos de los temas que elijas. Suscríbete al boletín