CHNSpec Technology (Zhejiang)Co.,Ltd chnspec@colorspec.cn 86--13732210605
En el diagnóstico patológico, la tinción de Hematoxilina-Eosina (H&E) es un método comúnmente utilizado para observar la morfología tisular. La hematoxilina tiñe los núcleos celulares de azul-púrpura, mientras que la eosina tiñe el citoplasma y la matriz extracelular de rosa. Los patólogos observan estas secciones teñidas bajo un microscopio para juzgar si las células han sufrido cambios cancerosos. En el proceso de determinación de tipos de cáncer, la identificación precisa de la región del citoplasma del cáncer es un paso clave.
En los últimos años, la tecnología de imagen hiperespectral ha entrado gradualmente en el campo de la investigación patológica. En comparación con las cámaras CMOS convencionales, las cámaras hiperespectrales pueden adquirir información celular más rica. Sin embargo, esta tecnología se enfrenta a dos problemas realistas en aplicaciones prácticas.
El primer problema es la dificultad de adquisición de datos. El costo de adquisición de imágenes hiperespectrales es alto y establecer un conjunto de datos anotado a gran escala no es fácil. Sin embargo, los modelos de aprendizaje profundo requieren precisamente una gran cantidad de datos para funcionar de manera efectiva. El segundo problema es el ruido del instrumento. Las cámaras hiperespectrales basadas en el modo de barrido lineal a menudo generan ruido de rayas verticales u horizontales, desplazamientos de píxeles y otros problemas durante el proceso de imagen. Estos ruidos varían según las características del equipo y los entornos operativos, lo que dificulta su evitación completa.
Para abordar estos problemas, se publicó un estudio en la revista Informatics in Medicine Unlocked. Propusieron un método de aumento de datos que utiliza imágenes CMOS para generar imágenes hiperespectrales pseudo que simulan el ruido real del instrumento, que luego se utilizan para entrenar un modelo de segmentación U-Net.
![]()
1. ¿Por qué usar imágenes CMOS para la aumentación?
Una consideración directa es el costo de anotación. La textura del citoplasma del cáncer en imágenes hiperespectrales es compleja y anotarla manualmente en imágenes en escala de grises es tanto laborioso como requiere mucho tiempo. En contraste, las imágenes CMOS son visualmente claras y su eficiencia de anotación es mucho mayor. La idea del equipo de investigación es: usar imágenes CMOS fáciles de anotar para generar imágenes hiperespectrales pseudo con ruido, y luego usar estas imágenes para entrenar el modelo.
![]()
El enfoque específico se divide en tres pasos:
El primer paso es la conversión de color y el ajuste de brillo. Convierta la imagen CMOS RGB en una imagen en escala de grises y ajuste el brillo mediante corrección gamma y ecualización de histograma para que se acerque al efecto visual de las imágenes hiperespectrales en una banda de longitud de onda específica (como 580 nm).
El segundo paso es agregar ruido del instrumento. Agregue aleatoriamente líneas de ruido verticales y horizontales a la imagen para simular el ruido de rayas generado en las cámaras hiperespectrales reales debido a diferencias en la sensibilidad del sensor o el procesamiento de la señal. El número de líneas de ruido verticales está entre 19 y 29, y las posiciones y anchos de las líneas de ruido horizontales también se aleatorizan. Además, se simula la pérdida de información y los desplazamientos de píxeles.
![]()
El tercer paso es la transformación geométrica. Realice operaciones como recorte, volteo y traslación en las imágenes pseudo generadas para expandir aún más el conjunto de datos.
A través de este flujo de trabajo, 44 imágenes CMOS originales generaron 792 imágenes hiperespectrales pseudo, que, después de fusionarse con 44 imágenes hiperespectrales originales, llevaron el conjunto de entrenamiento a 836 imágenes.
![]()
2. ¿Cómo fue el efecto experimental?
El equipo de investigación evaluó el rendimiento del modelo utilizando validación cruzada de 5 pliegues, empleando IoU (Intersección sobre Unión) y el coeficiente Dice como indicadores.
Cuando se entrenó solo con 44 imágenes hiperespectrales originales, el IoU fue de 0.5786 y el coeficiente Dice fue de 0.7304. Después de agregar las imágenes hiperespectrales pseudo, el IoU aumentó a 0.6458 y el coeficiente Dice aumentó a 0.7820 — el IoU mejoró en aproximadamente un 11.6% y el coeficiente Dice mejoró en aproximadamente un 7.1%.
![]()
El estudio también encontró que el brillo de la imagen y la densidad celular afectan los resultados de la segmentación. Los tipos de imágenes más oscuras y los tipos de imágenes con núcleos celulares densos mostraron una precisión de segmentación relativamente menor. Esto indica que el modelo tiene cierta dependencia de la calidad de la imagen y también sugiere direcciones para futuras mejoras.
3. ¿Cuál es la importancia de esta investigación?
Para el procesamiento de imágenes patológicas hiperespectrales, la escasez de datos y el ruido del instrumento son dos obstáculos ineludibles. Este estudio proporciona una idea práctica: en lugar de eliminar minuciosamente el ruido, es mejor dejar que el modelo aprenda a lidiar con el ruido durante la etapa de entrenamiento. La generación de imágenes hiperespectrales pseudo con ruido del instrumento a partir de imágenes CMOS no solo resuelve la dificultad de la anotación, sino que también mejora la robustez del modelo contra el ruido.
Por supuesto, este estudio también tiene limitaciones. Los datos experimentales provinieron de muestras de tumores mamarios caninos y solo hubo siete tipos de imágenes. Todavía se necesitan acumular gradualmente tipos de muestras más complejos y conjuntos de datos más grandes.
Sin embargo, desde una perspectiva metodológica, este concepto de "usar imágenes fáciles de anotar para generar muestras de entrenamiento que contengan ruido" proporciona un camino práctico valioso para la aplicación de la imagen microscópica hiperespectral en el diagnóstico patológico. Con la popularización gradual de los equipos de imagen hiperespectral en los departamentos de patología, métodos de aumento de datos similares podrían ayudar a los investigadores a entrenar modelos de manera más eficiente, reduciendo la dependencia de la anotación manual a gran escala.
Descargo de responsabilidad
Este contenido se compila y edita a partir de literatura académica abierta (enlace a la literatura: https://www.sciencedirect.com/science/article/pii/S2352914826000213). Solo se utiliza para discusión técnica industrial y aprendizaje de divulgación científica, y no hace ningún compromiso relacionado con fines comerciales, ni puede utilizarse como base de referencia de inversión. Los diversos datos experimentales y conclusiones enumerados en el texto se verán interferidos por múltiples variables como el entorno de prueba, las diferencias individuales de las muestras y los esquemas de construcción del modelo. Si se aplica en escenarios reales, los efectos relevantes deben verificarse mediante pruebas independientes en combinación con los propios escenarios.