Full text
Equation Chapter 1 Section 1 Trabajo Fin de Grado Grado en Ingeniería de las Tecnologías de Telecomunicación Extracción y selección de características para el análisis de la profundidad del melanoma Dpto. Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Autor: María De la Cruz Arriero Tutoras: Begoña Acha Piñero Maria Del Carmen Serrano Gotarredona Sevilla, 2024
iii Trabajo Fin de Grado Grado en Ingeniería de las Tecnologías de Telecomunicación Extracción y selección de características para el análisis de la profundidad del melanoma Autora: María De la Cruz Arriero Tutoras: Begoña Acha Piñero María del Carmen Serrano Gotarredonda Catedráticas de Universidad Dpto. de Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2024
v Trabajo Fin de Grado: Extracción y selección de características para el análisis de la profundidad del melanoma Autora: María De la Cruz Arriero Tutoras: Begoña Acha Piñero María Del Carmen Serrano Gotarredonda El tribunal nombrado para juzgar el Trabajo arriba indicado, compuesto por los siguientes miembros: Presidente: Vocales: Secretario: Acuerdan otorgarle la calificación de: Sevilla, 2024 El Secretario del Tribunal
vii A mi familia A mis maestros
ix Agradecimientos Quisiera expresar mi más sincero agradecimiento a todas las personas involucradas en la realización de este trabajo. A mi familia, cuyo apoyo incondicional, paciencia y confianza han sido fundamentales para alcanzar esta meta. Este logro es tan mío como suyo, y les dedico con gratitud cada esfuerzo reflejado en estas páginas.
3.2. Carga y procesamiento de los datos 24 3.2.1. Dataset2 24 3.2.2. Variables 25 3.3. Funciones 25 3.3.1 Vectores de características 28 3.4. Procesamiento de imágenes 30 3.5 Entrenamiento, validación y evaluación del modelo SVM 32 3.5.1 Selección de características 33 4 Resultados 35 4.1. Metricas de evaluación 35 4.1.1. Verdadero positivo (TP) 35 4.1.2. Verdadero negativo (TN) 35 4.1.3. Falso positivo (FP) 35 4.1.4. Falso negativo (FN) 36 4.1.5. Precision 36 4.1.6. Sensibilidad 36 4.1.7. Matriz de confusión 37 4.1.8. Valor promedio 37 4.1.9. Desviación estandar 37 4.2. Resultados obtenidos 39 4.2.1. Espacio de color CIELAB 39 4.2.1.1 CIELAB con selección de características SBS 40 4.2.2. Espacio de color CAM16UCS 41 4.2.1.1 CAM16UCS con selección de características SFS 43 4.2.3. Espacio de color CAM16 44 4.2.1.1 CAM16 con selección de características SFS 46 5 Conclusiones 49 Referencias 11 Índice de Conceptos 15 Glosario 16
xvii ÍNDICE DE TABLAS Tabla 1-1. Regla del ABCD 5 Tabla 1-2. Lista de los 7 puntos 5 Tabla 1-3. Método de Menzies para el diagnóstico del melanoma 6 Tabla 1-4. Etapas del melanoma 8 Tabla 3-1. Dataset Proyecto 24 Tabla 4-1. Matriz de confusión 37 Tabla 4-2. Resultados del clasificador SVM en espacio Lab con K-Fold 39 Tabla 4-3. Importancia de las características (PI Value) en espacio LAB 39 Tabla 4-4. Resultados del clasificador SVM en espacio Lab con SBS y K-Fold 40 Tabla 4-5. Importancia de las características (PI Value) en espacio LAB con SBS 41 Tabla 4-6. Resultados del clasificador SVM en espacio CAM16UCS con K-Fold 42 Tabla 4-7. Importancia de las características (PI Value) en espacio CAM16UCS 42 Tabla 4-8. Resultados del clasificador SVM en espacio CAM16UCS con SFS y K-Fold 43 Tabla 4-9. Importancia de las características (PI Value) en espacio CAM16UCS con SFS 43 Tabla 4-10. Resultados del clasificador SVM en espacio CAM16 con K-Fold 44 Tabla 4-11. Importancia de las características (PI Value) en espacio CAM16 44 Tabla 4-12. Resultados del clasificador SVM en espacio CAM16 con SFS y K-Fold 46 Tabla 4-13. Importancia de las características (PI Value) en espacio CAM16 con SFS 46
xix ÍNDICE DE FIGURAS Figura 1-1. Melanoma cutáneo maligno 2 Figura 1-2. Capas de la piel y sus células 3 Figura 1-3. Niveles de Clark para el melanoma maligno 8 Figura 2-1. Atributos perceptuales para expresar un determinado color 13 Figura 2-2. SVM hiperplano de margen máximo con sus vectores de soporte 19 Figura 2-3. Esquema de una validación cruzada con 5 folds (K=5) 20 Figura 3-1. Vector de características LAB 28 Figura 3-2. Vector de características CAM16UCS 29 Figura 3-3. Vector de características CAM16 30 Figura 3-4. Matriz de características en el espacio de color LAB 31 Figura 4-1. Matriz de confusión del Clasificador SVM LAB 39 Figura 4-2. Matriz de confusión del Clasificador SVM LAB con SBS 40 Figura 4-3. Matriz de confusión del Clasificador SVM CAM16UCS 41 Figura 4-4. Matriz de confusión del Clasificador SVM CAM16UCS con SFS 43 Figura 4-5. Matriz de confusión del Clasificador SVM CAM16 44 Figura 4-6. Matriz de confusión del Clasificador SVM CAM16 con SFS 46
xxi Notación ML Machine Learning (Aprendizaje Automático) IA Inteligencia Artificial SVM Support Vector Machines (Máquinas de Vectores de Soporte) SBS Sequential Backward Selection (Selección Secuencial hacia atrás) SFS. Sequential Forward Selection (Selección Secuencial hacia adelante) SEOM Sociedad Española de Oncología Médica TDS Total Dermatoscopic Score (Indice Dermatoscópico Total) PI Permutation Importance (Importancia por permutación) CIE Comisión Internacional de Iluminación CAM Color Appearance Models UCS Uniform Color Space (Espacio de color uniforme) RBF Radial Basis Function (Núcleo radial) CNNs Redes neuronales convolucionales BT Breslow Thickness (Profundidad de Breslow) KD Knowledge Distillation (Destilación de conocimiento) DLS Deep Transfer Learning (Aprendizaje Profundo por Transferencia) TP True Positive (Verdadero Positivo) TN True Negative (Verdadero Negativo) FP False Positive (Falso Positivo) FN False Negative (Falso Negativo)
1 1 INTRODUCCIÓN a motivación de este estudio radica en la necesidad de mejorar el diagnóstico y la evaluación de los melanomas cutáneos. El melanoma es una forma agresiva de cáncer de piel que puede ser mortal si no se detecta y trata a tiempo. La precisión en la estimación de la profundidad del melanoma es crucial, ya que esta medida está estrechamente relacionada con el pronóstico y el plan de tratamiento del paciente. Sin embargo, los métodos actuales de diagnóstico presentan limitaciones significativas. En este contexto, el uso de técnicas de Machine Learning (ML) ofrece una solución prometedora. ML puede analizar grandes volúmenes de datos de imágenes dermatoscópicas y detectar patrones complejos que podrían no ser evidentes para el ojo humano. Estas técnicas permiten una evaluación más precisa y automática de la profundidad del melanoma, mejorando así la precisión y eficiencia del diagnóstico médico en una variable de contextos. 1.1 Objetivos El objetivo principal de este trabajo es obtener resultados favorables en la diferenciación entre melanomas superficiales y profundos utilizando características de color extraídas de imágenes dermatológicas, aplicando técnicas de machine learning. Además, se plantean los siguientes objetivos específicos: - Entender la importancia del factor profundidad en el melanoma. - Explorar y conocer las características de los espacios de color CIELAB, CAM16 UCS y CAM16. - Implementar un modelo de clasificación SVM (Support Vector Machine), optimizando su rendimiento mediante la validación cruzada K-Fold. - Aplicar técnicas de selección de características como SBS (Sequential Backward Selection) y SFS (Sequential Fordward Selection). - Procesar y analizar los resultados obtenidos para evaluar el rendimiento del modelo. L “The goal of machine learning in dermatology is to assist clinicians in making faster, more accurate diagnoses”. - Ofer Mandelboim, dermatólogo y experto en IA -
Introducción 2 1.2 Inteligencia Artificial y Machine Learning La inteligencia artificial (IA), un término acuñado por el profesor emérito de Stanford John McCarthy en 1955, fue definido por él como "la ciencia y la ingeniería de hacer máquinas inteligentes". [1] Es un campo de estudio dedicado a la creación de sistemas que pueden realizar tareas que requieren inteligencia humana. [2] Dentro de la IA, el machine learning (ML) o aprendizaje automático es un subcampo que estudia cómo los agentes informáticos pueden mejorar su percepción, conocimiento, pensamiento o acciones a partir de la experiencia o los datos. Dentro del aprendizaje automático tenemos subcategorías como el aprendizaje supervisado, una computadora aprende a predecir etiquetas dadas por humanos y el aprendizaje no supervisado no requiere etiquetas, a veces generando sus propias tareas de predicción. [1] En resumen, la IA es un concepto más amplio que permite que una máquina o un sistema detecte, actúe o se adapte como una persona, mientras que el ML es una aplicación de la IA que hace posible que las máquinas extraigan conocimientos de los datos y aprendan de ellos de forma automática. 1.3 Análisis médico 1.3.1 Melanoma El melanoma es un tipo de cáncer de piel que se desarrolla cuando los melanocitos (las células que dan a la piel su color bronceado o marrón) comienzan a crecer sin control. El melanoma es mucho menos común que otros tipos de cáncer de piel, sin embargo, es más peligroso porque tiene una mayor probabilidad de propagarse a otras partes del cuerpo si no se detecta y trata a tiempo. [3] Un lunar, llaga, úlcera o tumor sobre la piel pueden ser un signo de melanoma o de otro tipo de cáncer de piel. Una úlcera o tumor que sangra o cambia de color también puede ser un signo de cáncer de piel. [5] Figura 1-1. Melanoma cutáneo maligno.
3 3 Extracción y selección de características para el análisis de la profundidad del melanoma La mayoría de los cánceres de piel comienzan en la capa superior de la piel, llamada epidermis. Hay tres tipos de células en esta capa: • Células escamosas: Estas son células planas en la parte superior (externa) de la epidermis, que se desprenden constantemente a medida que se forman nuevas. • Células basales: Estas células se encuentran en la parte inferior de la epidermis, llamada capa basal. Estas células se dividen constantemente para formar nuevas células que reemplazan a las células escamosas que se desprenden de la superficie de la piel. A medida que estas células se mueven hacia arriba en la epidermis, se aplanan, convirtiéndose eventualmente en células escamosas. • Melanocitos: Estas son las células que pueden convertirse en melanoma. Normalmente producen un pigmento marrón llamado melanina, que da a la piel su color bronceado o marrón. La melanina protege las capas más profundas de la piel de algunos de los efectos dañinos del sol. Figura 1-2. Capas de la piel y sus células [3] La epidermis está separada de las capas más profundas de la piel (dermis y tejido subcutáneo) por la membrana basal. Cuando un cáncer de piel se vuelve más avanzado, generalmente crece a través de esta barrera y penetra en las capas más profundas. [3] Según ha publicado la SEOM: Sociedad Española de Oncología Médica el 22 de mayo de 2024, la incidencia de melanoma cutáneo en España está al alza. La tasa anual por edad por cada 100.000 personas se ha incrementado de 2003 a 2024. En concreto, ha pasado de 12,0 a 15,1 casos en mujeres y de 12,0 a 15,4 en hombres, lo que supone una subida anual del 1,1% y del 1,2% respectivamente y lo que sitúa al melanoma cutáneo como el 8.º cáncer más frecuente en el primer caso y el 11.º, en el segundo. Respecto a la mortalidad cabe destacar que en 2021 se contabilizaron 1.056 defunciones (2 por cada 100.000 personas/año), 586 en hombres y 471 en mujeres. Estas cifras sitúan al melanoma cutáneo en el 17.º lugar como el cáncer más mortal, en el primer caso, y en el 18.º en el segundo. Además, se observa que en los hombres la tasa ha crecido un 0,1% de forma anual entre 2003 y 2021 mientras en las mujeres ha bajado un 0,4%. [4]
Introducción 10 Resultados obtenidos • Clasificación según BT: El enfoque semi-supervisado alcanzó un AUC 1 promedio de 0.8768, superando al mejor modelo supervisado, que obtuvo un AUC de 0.8329. • Clasificación Mis vs Miv: El modelo semi-supervisado logró un AUC promedio de 0.8547, frente a 0.7743 del supervisado. • Clasificación multicategoría (Mis, Miv<0.8 mm, Miv≥0.8 mm): Aunque los resultados fueron inferiores (AUC de 0.7787 en semi-supervisado), se destaca la dificultad añadida por la similitud entre Mis y melanomas invasivos finos. 1.4.2 Hernández Rodriguez et. al (2023) Hernández-Rodríguez et al. presentan un estudio centrado en la predicción de la profundidad de invasión del melanoma (Breslow thickness, BT) utilizando técnicas de deep transfer learning (DTL) 2 . Se comparan tres redes neuronales convolucionales preentrenadas (ResNetV2, EfficientNetB6 e InceptionV3) para clasificar melanomas en dos tareas principales: [28] 1. Clasificación entre melanomas in situ (Mis) e invasivos. 2. Clasificación por BT, distinguiendo melanomas con profundidad < 0,8 mm o ≥ 0,8 mm. El estudio emplea un conjunto de datos retrospectivo compuesto por 1315 imágenes dermatoscópicas de melanomas confirmados histopatológicamente. Las imágenes provienen de el Hopital Universitario Virgen del Rocío, repositorios de la International Skin Imaging Collaboration y la base de datos de Polesie et al. Los datos se etiquetaron según el diagnóstico histopatológico para las dos tareas, y se dividieron en conjuntos de entrenamiento (80%), validación (10%) y prueba (10%). Resultados obtenidos • Tarea Mis vs. Invasivo: - EfficientNetB6 presentó la mayor precisión diagnóstica (61%) y sensibilidad (72%), aunque con una especificidad más baja (39%). - El AUC promedio fue de 0.59 para ResNetV2, 0.63 para InceptionV3 y 0.54 para EfficientNetB6. • Tarea BT < 0,8 mm o ≥ 0,8 mm: - EfficientNetB6 obtuvo la mayor precisión diagnóstica (75%) y especificidad (84%), con un AUC promedio de 0.69. - ResNetV2 y InceptionV3 alcanzaron un AUC promedio de 0.76 y 0.75, respectivamente, superando a los dermatólogos (AUC promedio de 0.70). 1 El AUC (Area Under the Curve, por sus siglas en inglés) es una métrica utilizada en modelos de clasificación para evaluar su desempeño. Representa el área bajo la curva ROC (Receiver Operating Characteristic), que es una gráfica que muestra la relación entre la sensibilidad o recall (verdaderos positivos) y la especificidad o specificity (falsos positivos) del modelo en diferentes umbrales de decisión. AUC = 1.0: Desempeño perfecto del modelo; separa correctamente todas las clases. 2 Deep Transfer Learning (DLS) es una técnica en machine learning que aprovecha los modelos de aprendizaje profundo (deep learning) ya entrenados en un dominio o tarea específica y los reutiliza para resolver otra tarea relacionada.
11 11 Extracción y selección de características para el análisis de la profundidad del melanoma Por lo tanto, EfficientNetB6 destacó como el modelo más eficaz para la clasificación de BT, superando a dermatólogos expertos en la distinción de melanomas de profundidad ≥ 0.8 mm. Sin embargo, resaltan la necesidad de estandarizar las imágenes dermatoscópicas y de incluir poblaciones más diversas para mejorar la generalización de los modelos. 1.4.3 Saez et. al (2016) Sáez et al. [29] presentan un sistema computacional basado en imágenes dermatoscópicas para estimar el grosor del melanoma (Breslow thickness, BT) utilizando técnicas de clasificación supervisada y aprendizaje automático. El estudio utiliza un dataset compuesto por 250 imágenes dermatoscópicas de melanomas extraídas del Interactive Atlas of Dermoscopy, todas ellas con diagnóstico histopatológico confirmado. Estas imágenes se clasificaron en función del grosor (Breslow thickness, BT), dividido en dos esquemas: 1. Clasificación binaria: I. Finos (< 0.76 mm): Incluye 167 melanomas, entre los cuales hay 64 melanomas in situ, ya que comparten características clínicas similares con los melanomas finos invasivos. II. Gruesos (≥ 0.76 mm): Incluye 83 melanomas, distribuidos entre los intermedios y gruesos. 2. Clasificación en tres clases: I. Finos (< 0.76 mm): Mismos 167 melanomas que en el esquema binario. II. Intermedios (0.76-1.5 mm): 54 melanomas, considerados como un grupo de transición en términos de profundidad y pronóstico. III. Gruesos (> 1.5 mm): 29 melanomas, representando los casos más avanzados. El sistema incluye los siguientes pasos: 1. Extracción de características: Inspirada en estudios clínicos, se extrajeron un total de 81 descriptores basados en forma, color, textura y red de pigmnetos. 2. El modelo de clasificación empleado en este estudio es LIPU (Logistic Regression using Initial variables and Product Units), un enfoque híbrido que combina elementos de la regresión logística tradicional y las redes neuronales con unidades producto. Resultados obtenidos • Para la clasificación binaria se obtuvo una precisión del 77,6%. • Para la clasificación en tres clases, ya que el problema radica en la distinción de la etapa II y III, se obtuvo una precisión de más del 55% en la peor clase clasificada.
Introducción 12
13 2 MÉTODO n esta sección se presentan los fundamentos teóricos de los métodos y algoritmos que se aplicarán en el desarrollo de este trabajo, incluyendo los espacios de color CIELAB, CAM16-UCS y CAM16, los métodos de cuantificación de color con K-Means y la dispersión. Se abordan también el clasificador SVM (Support Vector Machines), los enfoques de selección de características SBS (Sequential Backward Selection) y SFS (Sequential Forward Selection), y el Permutation Importance (p-value) como herramienta para evaluar la relevancia de las características. Con ello se establece la base técnica para el desarrollo de los métodos utilizados en el proyecto. 2.1 Espacios de color La importancia del color en el análisis de características en imágenes es fundamental para mejorar la precisión y la fiabilidad de los resultados. El color esta intrínsecamente relacionado con la biología de las lesiones cutáneas, permitiendo a los profesionales de la salud identificar patrones y anomalías que pueden indicar la presencia de cáncer de piel. Para percibir el color se necesita que la luz de un objeto llegue a nuestros ojos y estimule el proceso visual que, como tal tiene un aspecto fisiológico y otro psicológico. Por lo tanto, a la hora de especificar un color, es necesario la intervención de tres factores fundamentales: • El tono o matiz, atributo por el que decimos si el color es un estímulo verde, rojo, azul... • La cantidad de luz, luminosidad o brillo, atributo por el que decimos si el color es claro u oscuro. • La saturación o croma, atributo por el que decimos si el color es más suave o fuerte. Luego lo ideal sería especificar un color mediante tres números relacionados con esos tres atributos. Figura 2-1. Atributos perceptuales para expresar un determinado color A lo largo del tiempo se han ido desarrollando distintos sistemas para conseguir este objetivo, uno de ellos llamado los espacios de color, que son modelos matemáticos que permiten describir colores de manera estándar. [12] E
Método 14 2.1.1 El espacio de color CIE RGB El espacio de representación de color CIE RGB es el que surge al representar en un sistema de ejes cartesianos las coordenadas tricromáticas de los estímulos de color en el sistema de primarios RGB de la CIE (Comisión Internacional de Iluminación). Representa el color como una mezcla de tres componentes: rojo, verde y azul. Los primarios del CIE RGB están definidos en longitudes de onda específicas (700 nm para rojo, 546.1 nm para verde, y 435.8 nm para azul), cada uno contribuyendo a un estímulo percibido que es una combinación lineal de estos tres colores. La representación matemática de cualquier color en este espacio es una combinación lineal de los tres componentes, que se expresa como: 𝐶=𝑅∗𝑟+𝐺∗𝑔+𝐵∗𝑏 (1-1) donde R, G, y B son los valores de intensidad de cada color, y r, g y b son las respuestas espectrales de los primarios rojo, verde y azul. [13] 2.1.2 El espacio de color CIE XYZ El espacio CIE XYZ fue diseñado a partir de la base científica de la percepción del color, especialmente la teoría tricromática, que establece que el ojo humano percibe el color a través de tres tipos de conos. Sin embargo, debido a que los primarios RGB no pueden cubrir todo el espectro visible, se construyeron funciones de igualación de color que permitieron definir tres primarios imaginarios X, Y, y Z. Estos primarios son matemáticamente derivados y no corresponden a colores físicos, pero garantizan una cobertura completa del espectro visible sin valores negativos. Para representar cualquier color percibido por el ojo humano, se usaron funciones de igualación (x‾(λ), y‾(λ), z‾(λ), que describen cómo los colores percibidos responden a distintas longitudes de onda. La representación de un color en CIE XYZ se calcula a partir de su espectro de luz reflejada (S(λ)) y una fuente de luz (E(λ)). Esto se integra con las funciones de igualación: (1-2) (1-3) (1-4) Estos valores tristímulo, X, Y, y Z, representan las cantidades de los primarios imaginarios necesarias para igualar un color dado. En este modelo, la componente Y representa la luminancia y se corresponde con la percepción de brillo del color, mientras que X y Z no tienen correspondencia directa con propiedades visuales específicas. [13] Las coordenadas cromáticas se definen como: 𝑥= 𝑋 𝑋+𝑌+𝑍 (1-5) 𝑦= 𝑌 𝑋+𝑌+𝑍 (1-6)
15 Extracción y selección de características para el análisis de la profundidad del melanoma 2.1.3 El espacio de color CIELAB El espacio de color CIELAB (o CIE L*a*b*), desarrollado por la Comisión Internacional de Iluminación (CIE) en 1976, es un modelo perceptual diseñado para representar los colores de manera más alineada con la percepción humana. Esto hace que CIELAB sea un modelo perceptualmente uniforme, es decir, que los cambios iguales en sus valores representan aproximadamente cambios iguales en la percepción de color. El espacio CIELAB está compuesto por tres componentes principales: 1. L*: Representa la luminosidad o claridad del color y varía entre 0 (negro) y 100 (blanco). 2. a*: Representa la dimensión de verde a rojo, con valores negativos para los tonos verdes y positivos para los tonos rojos. 3. b*: Representa la dimensión de azul a amarillo, con valores negativos para los tonos azules y positivos para los tonos amarillos. Los valores de L*, a* y b* se derivan a partir de los valores tristímulo X, Y, y Z del espacio CIE XYZ mediante una transformación no lineal, que se expresa matemáticamente como: 𝐿∗=116∙𝑓(𝑌 𝑌𝑛)−16 (1-7) 𝑎∗=500∙(𝑓(𝑋 𝑋𝑛)−𝑓(𝑌 𝑌𝑛)) (1-8) 𝑏∗=200∙(𝑓(𝑌 𝑌𝑛)−𝑓(𝑍 𝑍𝑛)) (1-9) donde Xn, Yn , y Zn son los valores tristímulo de referencia del blanco en el entorno de visualización y f(t)f(t)f(t) es una función de transformación que suaviza la respuesta del color: (1-10) con δ=6/29. Al estar diseñado para ser independiente del dispositivo (a diferencia de RGB), CIELAB también asegura una representación consistente en diferentes sistemas de captura y visualización, lo que es crucial en contextos médicos donde la estandarización y la reproducibilidad de los resultados son claves. Además, facilita el procesamiento computacional para segmentación de tejidos y análisis de lesiones, siendo un espacio de color robusto para algoritmos de detección y clasificación en imágenes médicas, como en el caso del análisis de melanomas.[13]
Método 16 2.1.4 Color Appearance Models Los Color Appearance Models (CAM) son herramientas teóricas que predicen cómo los humanos percibimos los colores bajo diversas condiciones de iluminación y contextos visuales. Estos modelos fueron desarrollados para estandarizar la representación del color en varias aplicaciones, como la industria, la impresión y la imagen digital, permitiendo una representación precisa de los colores tal como los percibimos en el mundo real, considerando factores como luminancia, contexto y entorno de visualización [14, 15] 2.1.4.1 El espacio de color CAM16 El modelo CAM16 es una versión avanzada del modelo CIECAM para la gestión del color, que proporciona una representación más precisa de cómo los humanos perciben los colores bajo diversas condiciones de iluminación y contexto visual. CIECAM16 fue desarrollado para mejorar la predicción de la percepción del color y proporciona una evaluación detallada de la apariencia del color, incorporando correlatos perceptuales clave como luminancia, cromatismo y matiz. Los correlatos perceptuales del CAM16 son: - Luminancia (Y): Determina la cantidad de luz que refleja o emite una superficie, influyendo en la percepción del brillo del color. - Chroma (C): Representa la pureza o intensidad del color, indicando colores más saturados o apagados. - Hue (h): Este componente corresponde al matiz o tono del color, como el rojo, verde o azul. Además de estos, el CAM16 incluye atributos adicionales que permiten una representación más rica del color, como: - Brillo (B): Relacionado con la claridad del color, proporcionando una medida más precisa de su luminosidad en comparación con otros modelos. - Saturación (S): La pureza del color en relación con el gris, donde los colores más saturados son percibidos como más intensos y vívidos. - Riqueza (R): Se refiere a la cantidad de color presente en relación con la luminancia, proporcionando contexto sobre cómo se percibe el color bajo diferentes fuentes de luz lo que facilita su aplicación en contextos donde el color necesita ser evaluado de manera precisa y detallada, como en el análisis de imágenes dermatológicas. [14 ] 2.1.4.2 El espacio de color CAM16UCS El espacio CAM16UCS se deriva del modelo CAM16 y fue desarrollado para proporcionar una representación más precisa y perceptualmente uniforme del color, particularmente en condiciones cambiantes de iluminación. UCS significa Uniform Color Space, lo que implica que las diferencias entre colores en este espacio se perciben de manera uniforme, lo que facilita la comparación de colores en diversas aplicaciones prácticas. Los tres principales correlatos perceptuales del CAM16UCS son la Luminancia (Y), el Chroma (C) y el matiz (Hue, h). El modelo CAM16UCS está diseñado para mejorar la coherencia en la representación del color, lo que resulta particularmente útil en sistemas de gestión del color donde la precisión es fundamental. [15]
17 Extracción y selección de características para el análisis de la profundidad del melanoma 2.2 Cuantificación del color con K-means La segmentación es un paso crucial en el procesamiento de imágenes que consiste en dividir una imagen en diferentes regiones o grupos homogéneos, facilitando su análisis posterior. Esta tarea puede abordarse mediante distintos métodos, cada uno centrado en características específicas de la imagen, dependiendo del atributo más relevante para el problema en cuestión. Un enfoque popular para la segmentación es el clustering o agrupamiento, una técnica de aprendizaje no supervisado que clasifica los datos en grupos basándose en su similitud, sin necesidad de información previa sobre las etiquetas o características específicas de los datos. [16] Para llevar a cabo el clustering de nuestras imágenes utilizaremos el algoritmo K-means. El algoritmo K-means [17] es un método de agrupamiento (clustering) ampliamente utilizado en la minería de datos. Su principal función es clasificar patrones en un conjunto de datos en un número predefinido de clústeres. La calidad de los resultados obtenidos por este algoritmo se mide generalmente mediante una función objetivo, como la suma de los cuadrados de las distancias Euclidianas entre cada patrón y su centroide: 𝐽=∑∑||𝑥𝑖(𝑗)−𝜇𝑗||2 (1 − 11) 𝑁𝑗 𝑖=1 𝐾 𝑗=1 Donde: • K es el número de clústeres. • 𝜇𝑗 es el centroide del cluster j. • 𝑁𝑗 es el número de patrones pertenecientes al clúster j. • 𝑥𝑖(𝑗) es el i-ésimo patrón asignado al clúster j. La minimización de esta función, llamada función de costo, garantiza que los puntos dentro de cada cluster estén lo más cerca posible de su centroide, lo que conduce a una agrupación eficiente. La función de costo o dispersión puede revelar diferencias en la uniformidad de color, que pueden correlacionarse con variaciones estructurales y de profundidad en las lesiones cutáneas (González et al., 2018; Raman et al., 2017). Por ejemplo, áreas con alta dispersión podrían corresponder a lesiones con heterogeneidad en el color, un factor importante en el diagnóstico de melanomas. El procedimiento básico del algoritmo K-means es [17]: 1. Inicialización: Se seleccionan aleatoriamente K puntos como los centroides iniciales de los clusters. En nuestro caso estamos utilizando 8 centroides, cada uno correspondiente a un color. 2. Asignación de Clusters: Cada punto xi se asigna al cluster más cercano, basado en una medida de distancia, generalmente la distancia euclidiana. Esto se expresa matemáticamente como: 𝑐𝑖=𝑎𝑟𝑔min 𝑗||𝑥𝑖−𝜇𝑗||2 (1-12) donde ci es el índice del cluster al que se asigna xi y μj es el centroide del cluster j. 3. Actualización de Centroides: Una vez que todos los puntos han sido asignados a un cluster, se recalculan los centroides de cada grupo tomando la media de todos los puntos asignados: 𝜇𝑗=1 |𝑁𝑗|∑𝑥𝑖 𝑥𝑖𝜖𝐶𝑗 (1-13) donde Nj es el conjunto de puntos asignados al cluster j y ∣Nj∣ es el número de puntos en ese cluster.
Método 18 4. Criterio de convergencia: Si se cumple un criterio de convergencia, como un número máximo de iteraciones, la estabilización de los centroides, o una variación aceptable en el valor de la función objetivo, el algoritmo se detiene. En caso contrario, se regresa al paso 2. 2.3 Support Vector Machines Las Máquinas de Vectores de Soporte (por sus siglas en inglés SVM) son algoritmos de aprendizaje supervisado desarrollados para la clasificación y la regresión, introducidas en 1995 por Vapnik y fundamentadas en la teoría del aprendizaje estadístico. Este modelo se basa en encontrar un hiperplano que divida de manera óptima los datos en distintas clases de manera que maximice la distancia entre los puntos más cercanos de cada clase y dicho hiperplano y reducir así el error de clasificación en nuevas muestras. [18, 19] Definiciones clave El objetivo de un modelo SVM es identificar un límite de decisión (hiperplano) que separe los datos de dos clases de forma óptima, manteniendo el mayor “margen” posible entre estas clases. Hiperplano: en un espacio n-dimensional, un hiperplano es un subespacio de dimensión n-1 que divide al espacio en dos mitades. Si es espacio es bidimensional, el hiperplano es una línea y si es tridimensional es un plano. Margen: distancia entre el hiperplano y los puntos más cercanos de cada clase, conocidos como vectores de soporte. Principios matemáticos de los SVM Dado un conjunto de datos de entrenamiento (xi, yi), donde xi ∈ 𝑅𝑛 representa el vector de características de la i-ésima observación (imagen) e yi ∈ {-1, 1} indica su clase, el problema de optimización en SVM puede formularse de la siguiente manera: Para una separación óptima en SVM, el modelo busca un vector de pesos w y un sesgo b que maximicen el margen entre las clases. El hiperplano de decisión se define como: 𝑤∗𝑥+𝑏=0 (1-15) Para un clasificador lineal SVM, el objetivo es satisfacer las siguientes restricciones para todos los puntos xi: 𝑦𝑖 (𝑤∗𝑥+𝑏)≥1 (1-16) Este planteamiento asegura que cada punto esté correctamente clasificado y se encuentre a una distancia de al menos 1/||𝑤|| del hiperplano de separación. Para maximizar el margen, se debe minimizar ||w||, lo que se traduce en el siguiente problema de optimización: min 𝑤,𝑏 1 2 ||𝑤||2 (1-17) sujeto a: 𝑦𝑖 (𝑤∗𝑥𝑖+𝑏)≥1, ∀𝑖 (1-18)
19 Extracción y selección de características para el análisis de la profundidad del melanoma Esta es una optimización cuadrática con restricciones lineales, que puede resolverse mediante métodos de optimización convexa, obteniendo un modelo con un margen óptimo entre las clases. Figura 2-2. SVM: hiperplano de margen máximo con sus vectores de soporte [18] Función de pérdida y Margen blando En muchos casos, no es posible una separación lineal perfecta de los datos, especialmente cuando los datos tienen ruido o no son linealmente separables. Para abordar esto, se introduce el concepto de margen blando mediante variables de relajación ξi, que permite que algunos puntos se encuentren en el margen o incluso en el lado incorrecto del hiperplano de separación. La función de pérdida con margen blando permite al modelo ser más flexible en situaciones en las que los datos no son perfectamente separables en su espacio original. El problema de optimización con margen blando se formula como: min 𝑤,𝑏 1 2 ||𝑤||2+ C∑ξi 𝑛 𝑖=1 (1-19) donde C (por defecto está fijado a 1) es un parámetro que controla el equilibrio entre maximizar el margen y minimizar los errores de clasificación. Está sujeto a: 𝑦𝑖 (𝑤∗𝑥𝑖+𝑏)≥1 − ξi, ξi≥0, ∀𝑖 (1-20) SVM no lineales y Función de núcleo (kernel) Cuando los datos no son linealmente separables en el espacio original, SVM puede aplicar una transformación a un espacio de mayor dimensión, donde sí sean separables. Para evitar la carga computacional de transformar explícitamente los datos, se usa la función de núcleo o kernel, que calcula el producto interno en el espacio transformado sin necesidad de realizar la transformación directamente.
Implementación 26 kmeans_cluster_centroides (imagen, ncolores): Esta función aplica el algoritmo K-means sobre los píxeles de una imagen para obtener los centroides (colores dominantes) y la imagen cuantificada. Parámetros de entrada: - Imagen: imagen convertida a RGB - Ncolores: la cantidad de centroides que queremos, que en este caso son 8. La función nos devuelve: - Centroides - Label: las etiquetas de los pixeles (a que centroide pertenece cada pixel) - Res2: la imagen cuantificada. calcular_dispersion (imagen, labels, centroides): Calcula la dispersión de cada color en la imagen con respecto a sus centroides. Parámetros de entrada: - Imagen: imagen convertida a RGB - Label: las etiquetas de los pixeles - Centroides La función nos devuelve: - Dispersión: una lista con la dispersión promedio para cada color dominante (centroide). convertir_a_cam16ucs (imagen_np): dada una imagen en espacio de color RGB, la convierte al espacio de color CAM16UCS.
27 Extracción y selección de características para el análisis de la profundidad del melanoma convertir_a_cam16(imagen_np): dada una imagen en espacio de color RGB, la convierte al espacio de color CAM16. Usamos XYZ como paso intermedio porque es un espacio estándar y perceptual que representa fielmente los colores para el ojo humano. Esta conversión permite que CAM16 integre propiedades de percepción como claridad, cromaticidad y tono, ajustadas por las condiciones de visualización.
Implementación 28 extraer_caracteristicas (imagen_np, ncolores): Esta función, recibiendo como entrada la imagen original y el numero de centroides (colores) que queremos, en este caso 8, genera las características necesarias para la clasificación de imágenes, transformando la imagen a los espacios de color CIELAB, CAM16 y CAM16-UCS, y aplicando K-means en cada espacio para obtener colores dominantes y dispersiones. Como resultado obtendremos los vectores de características de la imagen en cada espacio de color. 3.3.1 Vectores de características Para cada imagen obtenemos tres vectores de características, uno en el espacio CIELAB, otro en CAM16UCS y en el espacio CAM16. Vamos a ver en profundidad como serán dichos vectores y las características que estamos generando en función del espacio de color usado. Vector características_Lab: El espacio CIELAB, como hemos visto en el apartado 2.1, tenemos 3 componentes (L, a, b). Para cada uno de los 8 centroides obtenidos tenemos esas tres componentes y su dispersión. La estructura del vector de características tiene el siguiente orden: • Primeras 24 posiciones (0 - 23): Cada una de las 3 componentes del espacio repetidas para los 8 centroides. i. 0-2: Las 3 características (L, a, b) para el primer centroide. ii. 3-5: Las 3 características para el segundo centroide. ... (Esto continúa para los 8 centroides). Esto da un total de 3×8= 24 características para las componentes LAB. • Últimas 8 posiciones (24-31): Las dispersiones correspondientes a cada uno de los 8 centroides. Total: 32 características para el espacio CIELAB. Figura 3-1. Vector de características LAB
29 Extracción y selección de características para el análisis de la profundidad del melanoma Vector características_CAM16UCS: El espacio CAM16UCS, como hemos visto en el apartado 2.1, tenemos 3 componentes (Y, C, h). Para cada uno de los 8 centroides obtenidos tenemos esas tres componentes y su dispersión. La estructura del vector de características tiene el siguiente orden: • Primeras 24 posiciones (0 - 23): Cada una de las 3 componentes del espacio repetidas para los 8 centroides. i. 0-2: Las 3 características (Y, C, h) para el primer centroide. ii. 3-5: Las 3 características para el segundo centroide. ... (Esto continúa para los 8 centroides). Esto da un total de 3×8= 24 características para las componentes CAM16UCS. • Últimas 8 posiciones (24-31): Las dispersiones correspondientes a cada uno de los 8 centroides. Total: 32 características para el espacio CAM16UCS. Figura 3-2. Vector de características CAM16UCS Vector características_CAM16: El espacio CAM16, como hemos visto en el apartado 2.1, tenemos 6 componentes (Y, C, h, s, Q, M). Para cada uno de los 8 centroides obtenidos tenemos esas seis componentes y su dispersión. La estructura del vector de características tiene el siguiente orden: • Primeras 48 posiciones (0 - 47): Cada una de las 6 componentes del espacio repetidas para los 8 centroides. i. 0-5: Las 6 características (Y, C, h, s, Q, M) para el primer centroide. ii. 6-11: Las 6 características para el segundo centroide. ... (Esto continúa para los 8 centroides). Esto da un total de 6×8= 48 características para las componentes CAM16. • Últimas 8 posiciones (47-55): Las dispersiones correspondientes a cada uno de los 8 centroides. Total: 56 características para el espacio CAM16.
Implementación 30 Figura 3-3. Vector de características CAM16 3.4 Procesamiento de imágenes Esta sección detalla el proceso de creación de las matrices de características para cada espacio de color, las cuales usaremos posteriormente como datos de entrada para el clasificador. 1. Se recorre la lista de imágenes y sus etiquetas (imagenes_filtradas, etiquetas_filtradas), cargando cada imagen de acuerdo con su ruta y convirtiéndola al formato RGB. La ruta de cada imagen depende de su etiqueta: <0.76mm o >0.76mm, correspondiente a etapa1 o etapa2. 2. Para cada imagen cargada, la función extraer_caracteristicas () extrae sus representaciones en tres espacios de color: Lab, CAM16, y CAM16-UCS. Esta función devuelve tres conjuntos de características que se añaden a las listas X_lab, X_cam16, y X_cam16ucs, respectivamente, mientras que Y se actualiza con la etiqueta correspondiente (0 para <0.76mm, 1 para >0.76mm). Estas listas contienen los datos extraídos de las imágenes, pero en su forma original, no están optimizadas ni estructuradas para operaciones matemáticas rápidas o procesamiento avanzado. 3. Convertimos las listas de características y etiquetas (X_lab, X_cam16, X_cam16ucs y Y) en matrices de tipo numpy (arrays 2D). Esto se hace con el fin de facilitar su manipulación y
31 Extracción y selección de características para el análisis de la profundidad del melanoma procesamiento, ya que las matrices numpy son más eficientes y compatibles con las funciones de aprendizaje automático. 4. Finalmente, estandarizamos las matrices obtenidas. La estandarización es un proceso que transforma las características de los datos para que tengan una media de 0 y una desviación estándar de 1. La clase StandardScaler de la librería scikit-learn es la que se utiliza para estandarizar los datos. Razones por las que estandarizamos: a) Evitas que ciertas características dominen: Si una característica tiene valores muy grandes y otra tiene valores pequeños, la primera podría dominar las decisiones del modelo. b) Mejor rendimiento del modelo: Algunos algoritmos de machine learning (como SVM) funcionan mejor cuando las características están estandarizadas, ya que estas técnicas están basadas en distancias o gradientes. En la Figura 3-4, vemos un ejemplo de cómo quedaría la matriz X_lab. Figura 3-4. Matriz de características en el espacio de color LAB
Implementación 32 3.5 Entrenamiento, validación y evaluación del modelo SVM En este apartado, se presenta el proceso de entrenamiento, validación y evaluación del modelo de clasificación basado en Support Vector Machine (SVM) para la clasificación de imágenes. El código proporcionado a continuación se repite exactamente igual para los distintos espacios de color (Lab, CAM16UCS y CAM16). 1. Para evaluar el rendimiento del modelo, se utiliza la validación cruzada K-Fold con 5 particiones, lo que indica que se harán 5 iteraciones siendo en cada una de ellas el conjunto de datos de prueba una partición diferente. La opción shuffle=True se emplea para mezclar aleatoriamente los datos antes de dividirlos en los diferentes pliegues, asegurando que cada partición sea representativa de todo el conjunto de datos. 2. Las métricas utilizadas para evaluar el rendimiento del modelo son la precisión (precision) y el recall (sensibilidad). Ambas métricas se calculan utilizando el promedio macro, lo que significa que se toman en cuenta los resultados de cada clase por igual, sin importar su frecuencia en los datos. La opción zero_division=1 asegura que no haya errores al calcular la precisión o recall en el caso de que no se detecten ciertos valores en las predicciones. 3. Creamos un clasificador SVM y realizamos la validación cruzada con la matriz de características X_lab generada anteriormente y el vector de etiquetas asociadas a las imágenes. Obtenemos el vector de predicciones Y_pred_kfold, resultado de las predicciones generadas por la validación cruzada. Cada valor en Y_pred_kfold representa la predicción del modelo (el valor predicho por el clasificador SVM) para la clase de la imagen correspondiente.
33 Extracción y selección de características para el análisis de la profundidad del melanoma 4. Una vez obtenidas las predicciones de validación cruzada, se genera la matriz de confusión para evaluar cómo el modelo ha clasificado correctamente las imágenes. Esto se explica en apartado 4. 5. Cálculo de las métricas de precisión y recall, que se realiza para obtener una visión cuantitativa del rendimiento del modelo. Esto se explica en apartado 4. 6. El análisis de la importancia de las características se realiza utilizando la técnica de importancia por permutación. Esta técnica evalúa el impacto de cada característica en el rendimiento del modelo al permutar sus valores y medir la caída en el rendimiento. Las características con mayor caída en el rendimiento indican que son más relevantes para el modelo. Este análisis se realiza: i. Usamos permutation_importance, función de scikit-learn, la cual permuta 10 veces cada característica. Obtenemos pi_lab, un objeto que contiene los resultados de la importancia de cada característica. ii. Se presenta la importancia de las características de forma ordenada, destacando las más influyentes en el modelo, en un formato en que se observa el promedio y la desviación estándar de cada característica. 3.5.1 Selección de características En este estudio, se emplean métodos de selección de características con el objetivo de identificar y conservar las características más relevantes para la clasificación en los espacios de color LAB, CAM16-UCS y CAM16. Estos métodos, Sequential Backward Selection (SBS) y Sequential Forward Selection (SFS), permiten reducir la dimensionalidad del conjunto de datos, lo que disminuye la complejidad del modelo y mejora el rendimiento de clasificación del SVM. Para el espacio Lab, aplicamos SBS donde se parte del conjunto completo y se eliminan, iterativamente, aquellas características que menos aportan al rendimiento del modelo. Este proceso continúa hasta obtener el conjunto óptimo de características que maximiza la precisión del clasificador. El argumento n_features_to_select=None permite que el selector determine automáticamente el número óptimo de características necesarias. La transformación resultante (X_lab_sbs) es un conjunto reducido que contiene solo aquellas características esenciales para el espacio LAB. Después de obtener el vector de predicciones mediante validación cruzada, hacemos lo mismo que hicimos en el apartado anterior para el espacio sin selección de características.
Implementación 34 Para el espacio CAMM16UCS y CAM16, aplicamos SFS el cual comienza con un conjunto vacío de características y, en cada paso, añade aquella característica que maximiza el rendimiento del modelo. Este proceso se repite hasta obtener un conjunto de características que optimiza la capacidad del clasificador SVM. La transformación resultante (X_cam16ucs_sfs y X_cam16_sfs) es un conjunto reducido que contiene solo aquellas características esenciales para el espacio CAM16UCS o CAM16. Después de obtener los vectores de predicciones mediante validación cruzada, hacemos lo mismo que hicimos en el apartado anterior para el espacio sin selección de características.
35 Extracción y selección de características para el análisis de la profundidad del melanoma 4 RESULTADOS a implementación de este estudio se desarrolló utilizando como lenguaje Python en un entorno Jupyter Notebook de Anaconda, lo cual facilitó la escritura, ejecución y depuración del código en un entorno interactivo y visualmente accesible. 4.1 Métricas de clasificación Al evaluar el rendimiento de un modelo de clasificación, es fundamental comprender cómo el modelo clasifica correcta e incorrectamente las muestras, ya que estas métricas reflejan la eficacia y precisión del sistema para identificar correctamente las imágenes en cada categoría de profundidad de la lesión (superficial o profunda). 4.1.1 Verdadero Positivo (TP) Definimos Verdadero Positivo (TP, del inglés True Positive) cuando el modelo clasifica correctamente las imágenes que pertenecen a la etapa II de profundidad de la lesión, es decir, aquellas lesiones con una profundidad mayor a 0,76 mm. En este contexto, un caso se considera como verdadero positivo cuando una imagen que efectivamente representa una lesión profunda es clasificada correctamente por el modelo como profunda. Esta métrica es particularmente importante para asegurar que los casos de mayor riesgo (lesiones profundas) sean identificados adecuadamente por el modelo, permitiendo un diagnóstico más certero en situaciones donde la intervención temprana puede ser crítica. 4.1.2 Verdadero Negativo (TN) Definimos Verdadero Negativo (TN, del inglés True Negative) cuando el modelo clasifica correctamente las imágenes de la etapa I de profundidad de la lesión, es decir, aquellas lesiones que presentan una profundidad menor o igual a 0,76 mm. En este caso, un verdadero negativo ocurre cuando una lesión superficial (etapa I) es clasificada como superficial. La precisión en los verdaderos negativos ayuda a reducir falsos diagnósticos de gravedad, lo que es esencial en contextos médicos, ya que evita tratamientos innecesarios y permite a los pacientes recibir la atención adecuada. 4.1.3 Falso Positivo (FP) Definimos Falso Positivo (FP, del inglés False Positive) cuando el modelo clasifica incorrectamente una imagen de la etapa I (superficial) como si fuera de etapa II (profunda). En otras palabras, un falso positivo ocurre cuando una lesión que debería haberse clasificado como superficial es clasificada erróneamente por el modelo como profunda. Este tipo de error puede tener implicaciones clínicas importantes, ya que podría llevar a decisiones de tratamiento innecesarias o más invasivas para una lesión que no lo requiere. Minimizar los falsos positivos es crucial para aumentar la precisión del modelo y reducir la carga de procedimientos adicionales. L
Resultados 42 Tabla 4-6. Resultados del clasificador SVM en espacio CAM16UCS con K-Fold Métrica Resultado Precision 0.593598153547 Recall 0.593604651163 Tabla 4-7. Importancia de las características (p-value) en espacio CAM16UCS N.º característica Significado característica Resultados (Valor promedio + Desviación) 28 D5 0.027 ± 0.004 21 Y8 0.022 ± 0.006 18 Y7 0.019 ± 0.003 12 Y5 0.018 ± 0.005 11 h4 0.018 ± 0.006 4 C2 0.015 ± 0.004 24 D1 0.015 ± 0.005 19 C7 0.014 ± 0.004 20 h7 0.013 ± 0.005 30 D7 0.013 ± 0.006 6 Y3 0.013 ± 0.007 15 Y6 0.012 ± 0.002 5 h2 0.012 ± 0.005 9 Y4 0.011 ± 0.008 0 Y1 0.011 ± 0.004 31 D8 0.011 ± 0.003 13 C5 0.010 ± 0.003 17 h6 0.010 ± 0.008 8 h3 0.010 ± 0.003 29 D6 0.010 ± 0.004 2 h1 0.009 ± 0.006 7 C3 0.009 ± 0.006 27 D4 0.009 ± 0.005 22 C8 0.008 ± 0.003 1 C1 0.008 ± 0.003 10 C4 0.008 ± 0.004 3 Y2 0.007 ± 0.004 16 C6 0.006 ± 0.005 23 h8 0.006 ± 0.006 25 D2 0.005 ± 0.005 26 D3 0.005 ± 0.003 14 h5 0.005 ± 0.003
43 Extracción y selección de características para el análisis de la profundidad del melanoma 4.2.2.1 CAM16UCS con selección de características SFS Figura 4-4. Matriz de confusión del Clasificador SVM CAM16UCS con SFS Tabla 4-8. Resultados del clasificador SVM en espacio CAM16UCS con SFS y K-Fold Métrica Resultado Precision 0.64935617104 Recall 0.649457323956 Tabla 4-9. Importancia de las características (PI Value) en espacio CAM16UCS con SFS N.º característica Significado característica Resultados (Valor promedio + Desviación) 14 h5 0.045 ± 0.010 9 Y4 0.037 ± 0.005 12 Y5 0.036 ± 0.004 5 h2 0.033 ± 0.009 10 C4 0.033 ± 0.004 7 C3 0.032 ± 0.007 6 Y3 0.032 ± 0.005 15 Y6 0.030 ± 0.007 0 Y1 0.029 ± 0.007 13 C5 0.029 ± 0.004 8 h3 0.028 ± 0.006 11 h4 0.028 ± 0.007 1 C1 0.023 ± 0.007 4 C2 0.021 ± 0.006 2 h1 0.019 ± 0.005 3 Y2 0.018 ± 0.006
Resultados 44 4.2.3 Espacio de color CAM16 Figura 4-5. Matriz de confusión del Clasificador SVM CAM16 Tabla 4-10. Resultados del clasificador SVM en espacio CAM16 con K-Fold Métrica Resultado Precision 0.660866132167 Recall 0.661911374275 Tabla 4-11. Importancia de las características (p-value) en espacio CAM16 N.º característica Significado característica Resultados (Valor promedio + Desviación) 2 h1 0.021 ± 0.006 54 D7 0.013 ± 0.003 38 h7 0.012 ± 0.004 0 Y1 0.011 ± 0.005 15 s3 0.010 ± 0.002 5 M1 0.009 ± 0.003 1 C1 0.009 ± 0.003 4 Q1 0.009 ± 0.004 8 h2 0.008 ± 0.001 32 h6 0.013 ± 0.006 3 s1 0.008 ± 0.003 45 s8 0.008 ± 0.004 18 Y4 0.007 ± 0.004 47 M8 0.007 ± 0.002 43 C8 0.007 ± 0.002 48 D1 0.007 ± 0.005 30 Y6 0.007 ± 0.006 39 s7 0.006± 0.004
45 Extracción y selección de características para el análisis de la profundidad del melanoma 46 Q8 0.006 ± 0.001 52 D5 0.006 ± 0.004 14 h3 0.006 ± 0.002 25 C5 0.006 ± 0.002 29 M5 0.006 ± 0.002 17 M3 0.006 ± 0.004 13 C3 0.006 ± 0.003 9 s2 0.006 ± 0.003 49 D2 0.006 ± 0.005 27 s5 0.005 ± 0.003 53 D6 0.005 ± 0.002 26 h5 0.005 ± 0.007 44 h8 0.005 ± 0.003 40 Q7 0.005 ± 0.004 50 D3 0.005 ± 0.004 22 Q4 0.005 ± 0.002 55 D8 0.005 ± 0.005 28 Q5 0.004 ± 0.003 36 Y7 0.004 ± 0.005 42 Y8 0.004 ± 0.003 34 Q6 0.004 ± 0.005 35 M6 0.004 ± 0.002 31 C6 0.004 ± 0.002 6 Y2 0.004 ± 0.004 10 Q2 0.004 ± 0.004 20 h4 0.003 ± 0.002 33 s6 0.003 ± 0.002 21 s4 0.003 ± 0.004 12 Y3 0.002 ± 0.003 16 Q3 0.002 ± 0.002 24 Y4 0.001 ± 0.002 11 M2 0.001 ± 0.003 7 C2 0.001 ± 0.003 37 C7 0.000 ± 0.003 41 M7 0.000 ± 0.003 23 M4 0.000 ± 0.003 19 C4 0.000 ± 0.003 51 D4 0.000 ± 0.003
Resultados 46 4.2.3.1 CAM16 con selección de características SFS Figura 4-6. Matriz de confusión del Clasificador SVM CAM16 con SFS Tabla 4-12. Resultados del clasificador SVM en espacio CAM16 con SFS y K-Fold Métrica Resultado Precision 0.69648931001 Recall 0.696622384301 Tabla 4-13. Importancia de las características (p-value) en espacio CAM16 con SFS N.º característica Significado característica Resultados (Valor promedio + Desviación) 13 C3 0.034 ± 0.007 27 s5 0.031± 0.009 2 h1 0.020 ± 0.007 16 Q3 0.020 ± 0.007 3 s1 0.017 ± 0.007 21 s4 0.015 ± 0.004 22 Q4 0.014 ± 0.003 25 C5 0.014 ± 0.003 24 Y5 0.014 ± 0.006 19 C4 0.014 ± 0.004 14 h3 0.013 ± 0.006 4 Q1 0.013 ± 0.006 0 Y1 0.013 ± 0.005 26 h5 0.011 ± 0.004 7 C2 0.010 ± 0.004 8 h2 0.010 ± 0.005
47 Extracción y selección de características para el análisis de la profundidad del melanoma 18 Y4 0.010 ± 0.002 20 h4 0.009 ± 0.002 15 s3 0.009 ± 0.004 17 M3 0.009 ± 0.004 23 M4 0.008 ± 0.006 6 Y2 0.008 ± 0.004 5 M1 0.007 ± 0.002 1 C1 0.007 ± 0.002 10 Q2 0.007 ± 0.005 11 M2 0.005 ± 0.006 9 Y2 0.003 ± 0.005 12 Y3 0.003 ± 0.005
Resultados 48
49 Extracción y selección de características para el análisis de la profundidad del melanoma 5 CONCLUSIONES La motivación de este trabajo radica en la importancia que tiene actualmente una detección rápida del melanoma para poder actuar de forma temprana y eficaz. La carga de trabajo de los médicos y la complejidad del diagnóstico pueden llevar más tiempo del deseado y, en algunos casos, la precisión del diagnóstico puede verse limitada. En este contexto, la Inteligencia Artificial ofrece un apoyo valioso para agilizar y mejorar la precisión de estos diagnósticos. Este estudio ha explorado el uso de técnicas de Machine Learning y el análisis de distintos espacios de color, dado que el color es una característica crucial en el análisis de imágenes dermatológicas. Tras analizar los resultados obtenidos, se han alcanzado las siguientes conclusiones: • La clasificación de melanomas superficiales muestra un mejor rendimiento en comparación con la de melanomas profundos, indicando que la profundidad puede influir en la precisión del modelo. • El espacio de color CAM16 proporciona resultados superiores en comparación con los otros espacios de color analizados. Esto se debe a la inclusión de un mayor número de componentes que reflejan con mayor precisión la percepción del color en la visión humana. • La aplicación de técnicas de selección de características mejora la precisión y sensibilidad de los resultados en los tres espacios de color. Tras analizar todos los resultados obtenidos, concluimos que el espacio de color CAM16, combinado con la selección de características mediante SFS, es el que mejor se ajusta a los objetivos de este estudio. Este enfoque permite alcanzar una precisión y sensibilidad en el modelo de aproximadamente un 70%. Además, al analizar la lista ordenada de características según su importancia, se observa que la croma, la saturación y el matiz son factores clave para diferenciar entre clases en la clasificación de melanomas. Aun así, estos resultados no son del todo favorables, ya que el modelo tiene un elevado número de FP y FN, que podrían ser un problema a la hora de la detección correcta del melanoma. Como trabajo futuro se plantea el estudio en detalle de las lesiones que caigan cerca del umbral entre los dos tipos (0,76mm), planteando clasificadores que dividan en más de dos clases. Y, si la base de datos pasa a tener más imágenes, se pueden plantear técnicas de aprendizaje profundo (deep learning).
Conclusiones 50
11 REFERENCIAS [1] Manning, C. (2020). Artificial Intelligence Definitions. Stanford University. Disponible en: https://hai.stanford.edu/sites/default/files/2020-09/AI-Definitions-HAI.pdf [Accedido el 25 de noviembre de 2024]. [2] McCarthy, J., Minsky, M. L., Rochester, N., & Shannon, C. E. (2006). A proposal for the Dartmouth Summer Research Project on Artificial Intelligence. AI Magazine, 27(4), pp. 12-12. [3] American Cancer Society (n.d.). ¿Qué es el cáncer de piel tipo melanoma? Disponible en: https://www.cancer.org/ [Acceso: 25 noviembre 2024]. [4] SEOM (2024). Se incrementa la incidencia interanual de melanoma en España con 7.881 casos nuevos. Sociedad Española de Oncología Médica. Disponible en: https://www.seom.org/ [Acceso: 25 noviembre 2024]. [5] MedlinePlus (n.d.). Melanoma. Disponible en: https://medlineplus.gov/spanish/ency/article/000850.htm [Acceso: 25 noviembre 2024]. [6] Skin Cancer Foundation (2023). Melanoma. Disponible en: http://www.skincancer.org/skincancer-information/melanoma/ [Acceso: 25 noviembre 2024]. [7] Zaballos, P., Carrera, C., Puig, S., & Malvehy, J. (n.d.). Dermoscopic Criteria in the Diagnosis of Melanoma. Disponible en: https://www.medigraphic.com/pdfs/cutanea/mc-2004/mc041b.pdf [Acceso: 25 noviembre 2024]. [8] Rashed, H., Flatman, K., Bamford, M., Teo, K.W. & Saldanha, G., 2017. Breslow density is a novel prognostic feature in cutaneous malignant melanoma. Histopathology, 70(2), pp.264–272. Available at: https://doi.org/10.1111/his.13060. [9] Clark, W. H. Jr., From, L., Bernardino, E. A., & Mihm, M. C. (1969). The histogenesis and biologic behavior of primary human malignant melanomas of the skin. Cancer Research, 29(3), pp. 705–727. [10] National Cancer Institute, 2024. Niveles de Clark. [en línea] Disponible en: https://www.cancer.gov/espanol/publicaciones/diccionarios/diccionario-cancer/def/niveles-de-clark [Accedido el 26 de noviembre de 2024]. [11] arXiv (2024). Robust Melanoma Thickness Prediction via Deep Transfer Learning enhanced by XAI Techniques. Disponible en: https://ar5iv.labs.arxiv.org/html/2406.13441v1 [Acceso: 25 noviembre 2024]. [12] Campos Acosta, J. (n.d.). La especificación del color: espacios de representación del color. Instituto de Física Aplicada (CSIC). Disponible en: http://grupoorion.unex.es/divulgacion/especificacio [Acceso: 25 noviembre 2024]. [13] Fairchild, M.D. (2013). Color Appearance Models. John Wiley & Sons. [14] Li, C.J., Luo, M.R., Brill, M.H., Melgosa, M., Pointer, M.R., Teunissen, C., Wei, M.T. (2022). The CIE