Inteligencia artificial para el reconocimiento automático de fases quirúrgicas en facoemulsificación

16 julio 2026

 

AUTORES

  1. Luca Manuel Bueno Borghi. Servicio de Oftalmología, Hospital Clínico Universitario Lozano Blesa, Zaragoza, España.
  2. Miguel Castillo Fernández. Servicio de Oftalmología, Hospital Clínico Universitario Lozano Blesa, Zaragoza, España.
  3. Ana María Abad Pascual. Servicio de Oftalmología, Hospital Clínico Universitario Lozano Blesa, Zaragoza, España.
  4. Inmaculada Herrero Sánchez. Servicio de Oftalmología, Hospital Clínico Universitario Lozano Blesa, Zaragoza, España.
  5. Cristina Calvo Simón. Servicio de Oftalmología, Hospital Clínico Universitario Lozano Blesa, Zaragoza, España.
  6. Carla Sánchez Remacha. Servicio de Oftalmología, Hospital Clínico Universitario Lozano Blesa, Zaragoza, España.

 

RESUMEN

Objetivo: Evaluar el estado del arte de los algoritmos de inteligencia artificial (IA) basados en aprendizaje profundo (DL) dedicados al reconocimiento de fases y segmentación temporal en cirugías de cataratas, incluyendo la facoemulsificación estándar y la cirugía manual por incisión pequeña (SICS).

Métodos: Revisión narrativa basada en el análisis de una muestra representativa de la literatura científica sobre sistemas de cirugía asistida por computador (CAS) aplicados a la extracción de cataratas.

Resultados: Se constata la evolución desde arquitecturas espaciales simples hacia modelos espaciotemporales sofisticados (redes convolucionales temporales de múltiples etapas, redes SlowFast y redes convolucionales 3D infladas), los cuales alcanzan exactitudes diagnósticas del 85% al 96,5%. El ecosistema de validación incluye bases de datos clásicas (Cataract-101, BigCat) y recientes de gran volumen (Cataract-1K, Cataract-LMM con 3.000 vídeos). Asimismo, se demuestra la viabilidad de su implementación intraoperatoria en tiempo real mediante pantallas de monitoreo clínico.

Conclusiones: El reconocimiento de fases mediante IA es una herramienta robusta y madura con capacidad para redefinir el entrenamiento y los estándares de seguridad en la microcirugía ocular. Su integración clínica definitiva dependerá de superar retos pendientes como la transferencia de dominio, la explicabilidad de los modelos y la brecha tecnológica en países de ingresos bajos y medios.

PALABRAS CLAVE

Facoemulsificación, inteligencia artificial, cirugía asistida por computador, aprendizaje profundo.

ABSTRACT

Objective: To evaluate the state of the art of deep learning (DL)-based artificial intelligence (AI) algorithms for phase recognition and temporal segmentation in cataract surgeries, including standard phacoemulsification and manual small incision cataract surgery (SICS).

Methods: Narrative review based on the analysis of a representative sample of scientific literature on computer-assisted surgery (CAS) systems applied to cataract extraction.

Results: There is an evident evolution from simple spatial architectures to sophisticated spatiotemporal models (multi-stage temporal convolutional networks, SlowFast networks, and inflated 3D convolutional networks), achieving diagnostic accuracies ranging from 85% to 96.5%. The validation ecosystem includes classic datasets (Cataract-101, BigCat) and recent high-volume ones (Cataract-1K, Cataract-LMM with 3,000 videos). Furthermore, the feasibility of real-time intraoperative implementation via clinical monitoring displays is demonstrated.

Conclusions: AI-based phase recognition is a robust and mature tool capable of redefining training and safety standards in ocular microsurgery. Its definitive clinical integration will depend on overcoming pending challenges such as domain transfer, model explainability, and the technological gap in low- and middle-income countries.

KEY WORDS

Phacoemulsification, artificial intelligence, computer-assisted surgery, deep learning.

INTRODUCCIÓN

La prevalencia de la catarata como causa de ceguera evitable ha posicionado a la extracción del cristalino mediante facoemulsificación con implante de lente intraocular (LIO) como una de las intervenciones quirúrgicas de mayor volumen (1). El procedimiento exige un control cinemático preciso; las desviaciones técnicas durante pasos críticos, como la capsulorrexis circular continua, la fractura nuclear o la aspiración cortical, pueden desencadenar complicaciones severas que comprometan el pronóstico visual del paciente2.

Históricamente, la evaluación de las destrezas quirúrgicas ha dependido de la observación directa o la revisión retrospectiva de videos mediante rúbricas estandarizadas, como el ICO-OSCAR (International Council of Ophthalmology Surgical Competency Assessment Rubric)3,4. A pesar de su validez, la evaluación humana presenta limitaciones de escalabilidad. Requiere una alta inversión de tiempo, presenta susceptibilidad al sesgo interobservador y carece de capacidad para la auditoría intraoperatoria en tiempo real5,6.

Paralelamente, la integración de la visión por computador y el aprendizaje profundo ha facilitado el desarrollo de sistemas de cirugía asistida7. Inicialmente, estos algoritmos se orientaron a la identificación y seguimiento bidimensional de instrumental. En la actualidad, la investigación se centra en el reconocimiento automático de fases quirúrgicas8, un proceso definido como la clasificación temporal de cada fotograma en etapas discretas del flujo de trabajo clínico. Esta segmentación permite contextualizar el instrumental utilizado, calcular el tiempo empleado por fase —un indicador establecido de competencia técnica— y detectar desviaciones anómalas6,9.

A pesar de los avances descritos, la implementación clínica de estos algoritmos enfrenta obstáculos metodológicos. En primer lugar, destaca la limitada robustez de los modelos ante variaciones de iluminación y anatomía (transferencia de dominio)3,10, así como la sobresegmentación en las predicciones temporales9. Por otro lado, existe un déficit en la representación de técnicas manuales de incisión pequeña (MSICS), procedimiento prevalente, pero subestudiado frente a la facoemulsificación8,11. Por consiguiente, en esta revisión nos proponemos analizar la evidencia científica acumulada sobre el diseño, rendimiento e implementación de redes neuronales para el reconocimiento de fases en la cirugía de catarata, con el fin de delimitar los desafíos metodológicos pendientes para su estandarización clínica.

OBJETIVOS

Sintetizar la evidencia científica sobre el uso de algoritmos de aprendizaje profundo para el reconocimiento y segmentación automática de fases en videos de facoemulsificación y cirugía manual de incisión pequeña (MSICS).

Evaluar y comparar las características volumétricas y los niveles de anotación de las bases de datos videográficas utilizadas para el entrenamiento y validación de los modelos.

Analizar la eficacia de los distintos enfoques de modelado temporal (redes de convolución temporal, SlowFast y modelos híbridos 2D-3D) para mitigar el ruido de predicción y delimitar las transiciones entre fases quirúrgicas.

Examinar la viabilidad computacional de los algoritmos en tiempo real y el impacto clínico asociado a la implementación de plataformas de guiado automatizado en quirófano.

Discutir las limitaciones metodológicas actuales, incluyendo la capacidad de generalización multicéntrica, la explicabilidad algorítmica y la accesibilidad a herramientas quirúrgicas digitales.

MATERIAL Y MÉTODO

Para la elaboración de esta revisión se llevó a cabo una búsqueda bibliográfica estructurada en la base de datos PubMed/MEDLINE. La estrategia combinó descriptores MeSH (Medical Subject Headings) y términos en texto libre para cruzar las tres variables centrales del estudio: inteligencia artificial, reconocimiento de fases y cirugía de catarata.

La ecuación de búsqueda empleada fue: («Artificial Intelligence»[Mesh] OR «Deep Learning»[Mesh] OR «Machine Learning»[Mesh] OR «artificial intelligence»[tiab] OR «deep learning»[tiab] OR «machine learning»[tiab] OR «computer vision»[tiab] OR «convolutional neural network*»[tiab]) AND («surgical phase»[tiab] OR «phase recognition»[tiab] OR «step recognition»[tiab] OR «surgical workflow»[tiab] OR «workflow analysis»[tiab] OR «phase detection»[tiab]) AND («Phacoemulsification»[Mesh] OR «Cataract Extraction»[Mesh] OR «phacoemulsification»[tiab] OR «cataract surgery»[tiab])

Se aplicó un filtro temporal para limitar los resultados a los estudios publicados en los últimos cinco años (2021-2026).

La estrategia de búsqueda arrojó 14 registros iniciales. Dado el diseño restrictivo de la ecuación booleana, la evaluación por título y resumen confirmó que la totalidad de la muestra abordaba el objeto de estudio. Tras el análisis a texto completo, los 14 registros cumplieron con los criterios de inclusión cualitativa y fueron integrados en la revisión.

RESULTADOS

Paisaje de los conjuntos de datos y variabilidad clínica:

El desarrollo de algoritmos de inteligencia artificial (IA) para cirugía asistida depende de la diversidad, el tamaño y la granularidad de las bases de datos. Históricamente, la escasez de repositorios públicos y la falta de estandarización han limitado la comparativa objetiva de modelos. No obstante, el panorama ha evolucionado con la aparición de diversos conjuntos.

El estándar de referencia inicial fue Cataract-101, que proporciona 101 grabaciones de facoemulsificación con anotaciones temporales básicas. Para avanzar hacia segmentaciones finas, se estableció BigCat, con 190 procedimientos y aproximadamente 4 millones de fotogramas etiquetados con 11 fases (9). Derivaciones como BigCat-Capsulotomy han permitido entrenar redes específicas para pasos complejos, como la capsulorrexis.

La necesidad de datos a gran escala que reflejen la práctica multi-céntrica impulsó la creación de Cataract-LMM. Este benchmark comprende 3.000 videos capturados en dos instituciones (Hospital de Ojos Farabi y Noor, Teherán) por cirujanos con niveles de experiencia heterogéneos (3). Su estructura de cuatro capas permite el desarrollo de modelos multi-tarea y la evaluación de la generalización frente a cambios de centro (cross-domain testing)3. Asimismo, Cataract-1K ofrece 1.000 grabaciones orientadas a identificar irregularidades en el flujo de trabajo10.

Por otro lado, la investigación se ha extendido a regiones de menores recursos, donde predomina la cirugía manual de incisión pequeña (MSICS). El conjunto SICS-105 constituye el primer repositorio público dedicado a esta técnica, con 105 cirugías anotadas bajo un esquema de 13 fases11. La comparación técnica confirma que el modelado en MSICS resulta más complejo que en facoemulsificación debido a la variabilidad de las maniobras manuales y la mayor duración operatoria11.

(Ver Tabla 1).

Modelos espaciotemporales de aprendizaje profundo:

El procesamiento automático ha avanzado mediante el diseño de redes que modelan la dimensión temporal de forma continua. La estrategia de redes espaciotemporales se ilustra en modelos como CatStep, que fusiona un módulo espacial (DenseNet169) con un extractor temporal 3D (Inflated 3D DenseNet), alcanzando un ROC AUC de 0,95 en BigCat9.

Otra aproximación eficiente son las Redes Convolucionales Temporales de Múltiples Etapas (MS-TCN++). Al evaluar esta arquitectura, se observa una exactitud de clasificación del 89,97% en Cataract-101, frente al 85,56% en SICS-105, confirmando la mayor dificultad técnica del abordaje manual (11). Para capturar dependencias de largo rango, la red SF-TMN propone un enfoque de doble vía (lenta y rápida), superando a los modelos recurrentes convencionales12. Complementariamente, el modelo GL-MSTCN utiliza un flujo triple (pupila, instrumental y fotograma completo) para extraer características semánticas finas, logrando precisiones de hasta el 96,5% en Cataract-10113.

En lo relativo a la evaluación técnica, se han desarrollado ensambles (CNN-LSTM + CNN 3D) para clasificar cirujanos en expertos y novatos5. Utilizando estrategias de preprocesamiento como TRandAugment, se ha logrado incrementar el rendimiento entre un 1% y un 6% en tareas de reconocimiento, superando a los métodos de aumento de datos convencionales14.

(Ver Tabla 2).

Integración en tiempo real y supervisión intraoperatoria:

La utilidad clínica de la IA se consolida al operar en tiempo real. Nespolo et al. desarrollaron una plataforma basada en Faster R-CNN que realiza el seguimiento pupilar (Dice score: 90,23%) y proyecta guías circulares dinámicas para la capsulorrexis, obteniendo una alta aprobación de usabilidad por parte de especialistas7.

En el ámbito de la supervisión, el algoritmo DeepSurgery reconoce 12 pasos de la facoemulsificación con una exactitud del 90,30%, detectando desviaciones en la cronología lógica mediante alertas auditivas y visuales6. La validación del impacto operativo fue documentada por el Grupo de Moorfields: tras integrar pantallas auxiliares con IA en 74 cirugías, se constató una reducción significativa en la duración promedio de las operaciones para los consultores, mejorando la fluidez del equipo quirúrgico4.

En cuanto a la capacidad de generalización algorítmica, la evidencia revela una caída de rendimiento al aplicar los modelos en cohortes externas (transferencia de dominio). El algoritmo DeepSurgery, por ejemplo, alcanzó una exactitud del 95,06% en su validación interna, la cual descendió al 88,77% y al 88,34% al ser evaluado en dos conjuntos de datos externos6. Para abordar este déficit, iniciativas recientes como Cataract-LMM han establecido líneas base de adaptación de dominio entrenando modelos en un centro quirúrgico y evaluándolos sistemáticamente en otro, evidenciando que la falta de validación externa generalizada sigue siendo uno de los obstáculos principales en la literatura3.

En conclusión, como señalan Lindegger et al. (2) y Ahuja et al.1, la IA abarca progresivamente el espectro asistencial: desde la optimización preoperatoria de la fórmula del LIO, pasando por el soporte intraoperatorio mediante instrumentos inteligentes, hasta la predicción postoperatoria de la opacificación de la cápsula posterior.

DISCUSIÓN

En nuestro análisis hemos constatado que el reconocimiento automático de fases en la cirugía de catarata presenta viabilidad para la traslación clínica. Los algoritmos de aprendizaje profundo actuales demuestran precisión diagnóstica y latencias de procesamiento compatibles con el tiempo real intraoperatorio. Sin embargo, su implementación definitiva exige solventar limitaciones metodológicas, organizativas y de accesibilidad técnica.

En primer lugar, hemos identificado la transferencia de dominio (domain shift) como el principal obstáculo metodológico. Aunque los modelos alcanzan alta exactitud en validaciones internas, su rendimiento disminuye al evaluarlos con cohortes externas, tal y como objetiva la validación del grupo de DeepSurgery6. Esta variabilidad intercéntrica, secundaria a diferencias en la óptica de los microscopios, los parámetros de iluminación y los factores anatómicos del paciente (pigmentación iridiana o densidad cristaliniana), compromete la generalización algorítmica. Por consiguiente, consideramos que la validación mediante bases de datos multicéntricas masivas, como Cataract-LMM, es necesaria para desarrollar modelos independientes de la institución de origen3.

Por otro lado, la discriminación de fases exige la integración de la dimensión temporal. La evaluación exclusiva de características espaciales bidimensionales genera ruido de sobresegmentación en etapas visualmente análogas, pero cronológicamente distantes; un ejemplo es la infusión de viscoelástico en cámara anterior, que ocurre tanto de forma previa a la capsulorrexis como tras la aspiración cortical. Nuestros resultados confirman que las arquitecturas espaciotemporales mitigan este error al modelar la continuidad lógica del flujo quirúrgico, logrando delimitar las transiciones anatómicas con un margen de error mínimo, tal como demuestran los enfoques de MS-TCN++11, CatStep9 y SF-TMN12.

En el ámbito organizativo, la integración prospectiva de sistemas de IA altera la dinámica del quirófano. La experiencia reportada por el grupo de Moorfields demuestra que el despliegue de pantallas con retroalimentación algorítmica facilita la anticipación del equipo de enfermería e instrumentación a los requerimientos de fases sucesivas (como la preparación del inyector del LIO)4. En nuestra revisión destacamos que esta sincronización proactiva se asocia con una reducción estadísticamente significativa en el tiempo quirúrgico global para los cirujanos consultores, optimizando la eficiencia del equipo humano4.

Adicionalmente, hemos observado una asimetría en el desarrollo tecnológico según la técnica extractiva. Mientras que la literatura se centra en la facoemulsificación, la cirugía manual de incisión pequeña (MSICS) —procedimiento prevalente en países en vías de desarrollo— carece de un volumen equivalente de modelos algorítmicos. Aunque la técnica MSICS conlleva una mayor variabilidad manual que dificulta su modelado informático, redes como MS-TCN++ han demostrado exactitudes del 85,56% en el conjunto SICS-10511. En definitiva, la equidad en la auditoría quirúrgica asistida requiere la creación de repositorios de código abierto específicos para MSICS.

Finalmente, la adopción clínica de estos sistemas exige alta explicabilidad algorítmica. La opacidad intrínseca de los modelos de aprendizaje profundo limita la fiabilidad clínica ante alertas de error. En este sentido, valoramos que las arquitecturas híbridas, que superponen clasificaciones neuronales con algoritmos geométricos deterministas para proyectar límites visuales inteligibles sobre la córnea, constituyen la estrategia más viable para asegurar la interpretabilidad de las predicciones informáticas7.

CONCLUSIONES

  • La integración del modelado temporal continuo atenúa el ruido de sobresegmentación, alcanzando exactitudes de clasificación de fases quirúrgicas de entre el 85% y el 96,5%11,12.
  • La retroalimentación algorítmica intraoperatoria reduce el tiempo quirúrgico global al promover la anticipación y sincronización del equipo de instrumentación y enfermería4.
  • La variabilidad técnica y biológica entre centros reduce el rendimiento algorítmico en validaciones externas, haciendo imperativo el entrenamiento con repositorios multicéntricos para superar el domain shift3,6.
  • Existe un déficit de desarrollo de IA aplicado a la técnica MSICS frente a la facoemulsificación. La ampliación de modelos para MSICS es necesaria para facilitar la formación quirúrgica objetiva en entornos de recursos limitados11.
  • La estandarización de la cirugía de catarata asistida dependerá del desarrollo de arquitecturas multi-tarea que integren simultáneamente el reconocimiento de fases, el seguimiento del instrumental y la predicción de complicaciones1,2.

 

BIBLIOGRAFÍA

1. Ahuja AS, Paredes Iii AA, Eisel MLS, Kodwani S, Wagner I V, Miller DD, et al. Applications of Artificial Intelligence in Cataract Surgery: A Review. Clin Ophthalmol [Internet]. 2024 [cited 2026 May 31];18:2969–75. Available from: http://www.ncbi.nlm.nih.gov/pubmed/39434720

2. Lindegger DJ, Wawrzynski J, Saleh GM. Evolution and Applications of Artificial Intelligence to Cataract Surgery. Ophthalmol Sci [Internet]. 2022 Sep 1 [cited 2026 May 31];2(3):100164. Available from: http://www.ncbi.nlm.nih.gov/pubmed/36245750

3. Ahmadi MJ, Gandomi I, Abdi P, Mohammadi S-F, Taslimi A, Khodaparast M, et al. Cataract-LMM Large-Scale Multi-Source Multi-Task Benchmark for Deep Learning in Surgical Video Analysis. Sci data [Internet]. 2026 May 23 [cited 2026 May 31]; Available from: http://www.ncbi.nlm.nih.gov/pubmed/42173959

4. Shah N, Wawrzynski J, Hussain R, Singh B, Luengo I, Addis C, et al. Application of real-time artificial intelligence to cataract surgery. Br J Ophthalmol. 2025 Dec 1;109(12):1338–44.

5. Tanin U, Duimering A, Law C, Ruzicki J, Luna G, Holden M. Performance evaluation in cataract surgery with an ensemble of 2D-3D convolutional neural networks. Healthc Technol Lett [Internet]. 2024 Apr 1 [cited 2026 May 31];11(2–3):189–95. Available from: http://www.ncbi.nlm.nih.gov/pubmed/38638495

6. Wang T, Xia J, Li R, Wang R, Stanojcic N, Li JPO, et al. Intelligent cataract surgery supervision and evaluation via deep learning. Int J Surg. 2022 Aug 1;104.

7. Garcia Nespolo R, Yi D, Cole E, Valikodath N, Luciano C, Leiderman YI. Evaluation of Artificial Intelligence-Based Intraoperative Guidance Tools for Phacoemulsification Cataract Surgery. JAMA Ophthalmol. 2022 Feb 1;140(2):170–7.

8. Müller S, Jain M, Sachdeva B, Shah PN, Holz FG, Finger RP, et al. Artificial Intelligence in Cataract Surgery: A Systematic Review. Transl Vis Sci Technol. 2024 Apr 1;13(4).

9. Mahmoud O, Zhang H, Matton N, Mian SI, Tannen B, Nallasamy N. CatStep: Automated Cataract Surgical Phase Classification and Boundary Segmentation Leveraging Inflated 3D-Convolutional Neural Network Architectures and BigCat. Ophthalmol Sci [Internet]. 2024 Jan 1 [cited 2026 May 31];4(1):100405. Available from: http://www.ncbi.nlm.nih.gov/pubmed/38054105

10. Ghamsarian N, El-Shabrawi Y, Nasirihaghighi S, Putzgruber-Adamitsch D, Zinkernagel M, Wolf S, et al. Cataract-1K Dataset for Deep-Learning-Assisted Analysis of Cataract Surgery Videos. Sci Data. 2024 Dec 1;11(1).

11. Mueller S, Sachdeva B, Prasad SN, Lechtenboehmer R, Holz FG, Finger RP, et al. Phase recognition in manual Small-Incision cataract surgery with MS-TCN + + on the novel SICS-105 dataset. Sci Rep. 2025 Dec 1;15(1).

12. Zhang B, Sarhan MH, Goel B, Petculescu S, Ghanem A. SF-TMN: SlowFast temporal modeling network for surgical phase recognition. Int J Comput Assist Radiol Surg. 2024 May 1;19(5):871–80.

13. Fang L, Mou L, Gu Y, Hu Y, Chen B, Chen X, et al. Global-local multi-stage temporal convolutional network for cataract surgery phase recognition. Biomed Eng Online [Internet]. 2022 Nov 30 [cited 2026 May 31];21(1):82. Available from: http://www.ncbi.nlm.nih.gov/pubmed/36451164

14. Ramesh S, Dall’Alba D, Gonzalez C, Yu T, Mascagni P, Mutter D, et al. TRandAugment: temporal random augmentation strategy for surgical activity recognition from videos. Int J Comput Assist Radiol Surg [Internet]. 2023 Sep 1 [cited 2026 May 31];18(9):1665–72. Available from: http://www.ncbi.nlm.nih.gov/pubmed/36944845

 

ANEXOS

Tabla 1:

Conjunto de datos Cirugías (N) Fotogramas / Escala Capas de Anotación Quirúrgica Técnica Quirúrgica de Catarata Tipo de Centro y Acceso
Cataract-10111,12 101 10,100 anotados 10 fases temporales básicas Facoemulsificación estándar Monocéntrico, Acceso público
BigCat9 190 approx 4,000,000 11 fases temporales continuas Facoemulsificación Monocéntrico, Retrospectivo
SICS-10511 105 Videos completos 20 fases (compactadas a 13) Cirugía manual de minivía SICS Monocéntrico (Sankara), Público
Cataract-1K10 1000 Gran escala Fases, segmentación, irregularidades Facoemulsificación Multicéntrico, Synapse público
Cataract-LMM3 3000 Masivo, multicentro Fases, píxeles, tracking, ICO-OSCAR Facoemulsificación heterogénea Bicéntrico (Farabi/Noor), Público

 

Tabla 2:

Modelo / Arquitectura Conjunto de Validación Métricas Clave de Rendimiento Propósito Principal del Algoritmo
CatStep

(DenseNet169 + I3D)9

BigCat F1-score: 0.91; ROC AUC: 0.95. Error de borde: 0.1 – 0.3 Segmentación fina de límites de fase quirúrgica
GL-MSTCN (Triple-Stream + TCN)13 Cataract-101 Exactitud: 96.5% (Cataract-101) Reconocimiento de fases con foco local de pupila e instrumental
MS-TCN++ (dilated temporal convolutions) (11) Cataract-101 / SICS-105 Exactitud: 89.97% (Cataract-101); 85.56% (SICS-105) Comparación de rendimiento facoemulsificación vs. SICS manual
Ensamble 2D CNN-LSTM + 3D CNN5 Grabaciones locales (197 videos) Exactitud faco: 0.8494; AUC promedio global: 0.8800 Evaluación objetiva de habilidades técnicas (Experto vs. Novato)
SF-TMN (SlowFast temporal network)12 Cataract-101 Supera a Swin BiGRU en approx 1% ACC y 1.5% recall Clasificación de fases combinando nivel fotograma y segmento

 

Publique con nosotros

Indexación de la revista

ID:3540

Últimos artículos