Điểm nổi bật
- Các kỹ thuật học sâu có thể đánh giá khách quan kỹ năng phẫu thuật và phát hiện lỗi kỹ thuật trong quá trình đóng mỏm âm đạo khi hỗ trợ bằng robot, qua đó hỗ trợ đào tạo phẫu thuật.
- Các mô hình học đa phương thức tích hợp dữ liệu video đạt độ chính xác cao (>80%) trong đánh giá kỹ năng, đồng thời tương quan chặt chẽ với các thang điểm do chuyên gia đã được thẩm định.
- Các chỉ số khách quan như Modifiable Global Evaluative Assessment of Robotic Skills (GEARS) và Objective Clinical Human Reliability Analysis (OCHRA) tương quan với kinh nghiệm phẫu thuật viên và kết quả mổ.
- Những phương pháp này đặt nền tảng cho giám sát chất lượng dựa trên AI và cấp chứng nhận dựa trên bằng chứng trong phẫu thuật phụ khoa ít xâm lấn.
Bối cảnh
Phẫu thuật cắt tử cung hỗ trợ bằng robot, bao gồm đóng mỏm âm đạo, là một trụ cột của phẫu thuật phụ khoa ít xâm lấn, mang lại độ chính xác cao hơn và lợi ích về công thái học so với nội soi truyền thống. Tuy nhiên, kỹ năng phẫu thuật vẫn là yếu tố quyết định then chốt đối với kết quả điều trị, hiệu quả phẫu thuật và tỷ lệ biến chứng. Đánh giá kỹ năng phẫu thuật theo cách truyền thống chủ yếu dựa vào các nhận định chủ quan của chuyên gia, tốn nhiều thời gian, và thường bị hạn chế bởi sự khác biệt giữa các người đánh giá cũng như khả năng triển khai trên quy mô lớn.
Để giải quyết những thách thức này, các nghiên cứu gần đây tập trung tích hợp dữ liệu phẫu thuật phong phú — bao gồm video, chuyển động và thông tin quy trình thủ thuật — vào các khuôn khổ tính toán có khả năng đánh giá kỹ năng một cách khách quan. Học sâu (Deep Learning, DL), một phân ngành tiên tiến của trí tuệ nhân tạo (Artificial Intelligence, AI), đã cho thấy tiềm năng trong việc mô hình hóa các mẫu không gian-thời gian phức tạp vốn có trong video và chuyển động phẫu thuật. Việc ứng dụng DL vào đóng mỏm âm đạo hỗ trợ bằng robot hứa hẹn cải thiện đào tạo phẫu thuật bằng cách cung cấp phản hồi tự động, có thể lặp lại và nhận diện các lỗi kỹ thuật cụ thể theo thời gian thực.
Nội dung chính
Diễn tiến theo thời gian và tiến bộ phương pháp luận
Về mặt lịch sử, đánh giá kỹ năng phẫu thuật đã phát triển từ các thang điểm toàn cục mang tính chủ quan sang các công cụ có cấu trúc và đã được thẩm định như Global Evaluative Assessment of Robotic Skills (GEARS) và Objective Clinical Human Reliability Analysis (OCHRA), lần lượt định lượng năng lực phẫu thuật tổng quát và sai sót trong quy trình. Các công cụ này đã được thẩm định trong nhiều thủ thuật robot khác nhau, bao gồm cả phẫu thuật phụ khoa.
Những tiến bộ gần đây đã khai thác các thuật toán DL để phân tích video trong mổ ở mức khung hình hoặc đoạn, cho phép phát hiện lỗi tinh vi và phân loại kỹ năng với độ chi tiết cao. Nghiên cứu của Tesfai et al. (2026) là một ví dụ điển hình cho bước tiến này khi áp dụng ba quy trình DL mới nhằm: (1) mô hình hóa theo thời gian để phát hiện lỗi trong video phẫu thuật; (2) học với rất ít mẫu (few-shot learning) để đánh giá kỹ năng phẫu thuật tổng quát; và (3) học đa phương thức tích hợp luồng dữ liệu hình ảnh và dữ liệu thời gian.
Thiết kế nghiên cứu và chú giải dữ liệu
Tesfai et al. đã thực hiện một nghiên cứu quan sát đoàn hệ tiến cứu đa trung tâm từ năm 2023 đến 2025, bao gồm 40 video đóng mỏm âm đạo hỗ trợ bằng robot, với hơn 1,2 triệu khung hình video được ghi nhận qua nền tảng Touch Surgery. Có 11 phẫu thuật viên với mức kinh nghiệm khác nhau (từ người mới bắt đầu đến chuyên gia) thực hiện các thủ thuật đóng mỏm. Video phẫu thuật được hai phẫu thuật viên đã qua đào tạo chú giải kép một cách tỉ mỉ, sử dụng OCHRA để phân loại lỗi và phiên bản điều chỉnh của GEARS để chấm điểm kỹ năng toàn cục.
Độ tin cậy giữa các người đánh giá là cao đối với cả GEARS (ICC=0,807) và số lượng lỗi OCHRA (ICC=0,712), xác nhận tính nhất quán của các chú giải do chuyên gia thực hiện.
Hiệu năng mô hình học sâu và các mối tương quan
Mô hình đánh giá kỹ năng few-shot đạt các chỉ số hiệu năng đáng chú ý (độ chính xác 81,70%; điểm F1 81,30% trong thiết lập 5-shot), cho thấy khả năng tổng quát hóa hiệu quả dù chỉ có số lượng ví dụ huấn luyện hạn chế. Quy trình đánh giá đa phương thức cho thấy sự phù hợp cao với các chấm điểm thủ công (Spearman rs=0,85; sai số tuyệt đối trung bình 1,85), qua đó khẳng định tính liên quan lâm sàng.
Các tương quan có ý nghĩa thống kê được ghi nhận giữa kinh nghiệm phẫu thuật viên và điểm GEARS điều chỉnh (kiểm định Kruskal-Wallis, p<0,002), cũng như giữa thời gian mổ với cả các chỉ số kỹ năng và lỗi (rs=-0,534 và rs=0,421 tương ứng), phản ánh giá trị cấu trúc của các đánh giá bằng DL.
Đặt trong bối cảnh y văn rộng hơn
Các nghiên cứu trước đây chủ yếu thử nghiệm đánh giá kỹ năng phẫu thuật tự động trong các bài tập mô phỏng trên bàn hoặc trong môi trường được kiểm soát chặt chẽ. Bộ dữ liệu đa trung tâm, trong điều kiện thực tế, của Tesfai et al. là một bước tiến quan trọng, bảo đảm khả năng áp dụng cho phẫu thuật phụ khoa robot thường quy.
Các nghiên cứu khác tập trung vào AI cũng báo cáo mức độ chính xác dự đoán tương tự và nhấn mạnh khả năng diễn giải của mô hình, yếu tố thiết yếu cho việc ứng dụng trong thực hành lâm sàng. Phương pháp học few-shot đặc biệt giải quyết thách thức dữ liệu phẫu thuật được chú giải hạn chế, vốn là một nút thắt đã được biết đến khi triển khai AI cho đào tạo phẫu thuật.
Bình luận chuyên gia
Việc tích hợp học sâu vào đánh giá kỹ năng phẫu thuật đánh dấu một bước chuyển đổi quan trọng trong đào tạo phẫu thuật và bảo đảm chất lượng. Các chỉ số khách quan được rút ra từ bộ dữ liệu video quy mô lớn có thể giảm thiểu thiên lệch của con người, cung cấp phản hồi ngay trong mổ, và theo dõi khách quan sự tiến bộ kỹ năng theo thời gian.
Tuy nhiên, vẫn còn nhiều thách thức. Tính không đồng nhất của bộ dữ liệu giữa các trung tâm, cỡ mẫu còn hạn chế và gánh nặng chú giải làm giảm khả năng khái quát hóa. Việc mở rộng hợp tác đa trung tâm với phổ phẫu thuật viên đa dạng và độ phức tạp thủ thuật khác nhau là điều cần thiết.
Hơn nữa, mặc dù các tương quan đã được chứng minh với thang điểm của con người và các chỉ số lâm sàng củng cố giá trị của phương pháp, vẫn cần các nghiên cứu xác nhận tiến cứu để đánh giá tác động lên kết cục bệnh nhân và hiệu quả đào tạo.
Từ góc độ cơ chế, các mô hình học sâu khai thác các động học theo thời gian tinh vi và kiểu mẫu chuyển động mà mắt người không thể nhận biết đầy đủ để xác định các dấu hiệu lỗi và marker kỹ năng rất nhỏ. Hiểu biết cơ chế này có thể làm rõ nhu cầu đào tạo đích, từ đó hỗ trợ các can thiệp huấn luyện cá thể hóa.
Các khung pháp lý và tổ chức cấp chứng nhận sẽ cần xem xét các chỉ số được tăng cường bởi AI trong các mô hình đánh giá phẫu thuật viên chính thức. Những tiêu chuẩn rõ ràng về độ tin cậy, tính giá trị và tính minh bạch sẽ là yếu tố then chốt.
Kết luận
Tổng quan toàn diện này về các ứng dụng của học sâu trong đánh giá kết quả đóng mỏm âm đạo hỗ trợ bằng robot cho thấy các mô hình dựa trên AI có thể dự đoán một cách vững chắc các lỗi kỹ thuật và mức độ kỹ năng phẫu thuật tổng quát. Với việc khai thác các bộ dữ liệu đa trung tâm được chú giải kỹ lưỡng và các kiến trúc DL tiên tiến, các mô hình này đạt mức phù hợp cao với đánh giá chuẩn vàng của chuyên gia.
Những tiến bộ như vậy mở ra viễn cảnh một tương lai mà các công cụ do AI dẫn dắt cung cấp các đánh giá có khả năng mở rộng, khách quan và có thể tái lập nhằm cải thiện đào tạo phẫu thuật, cấp chứng nhận, và cuối cùng là an toàn người bệnh trong phẫu thuật phụ khoa ít xâm lấn. Việc tiếp tục mở rộng sang các đoàn hệ lớn hơn, đa dạng hơn và thẩm định tiến cứu dựa trên kết cục sẽ là những cột mốc quan trọng cho quá trình chuyển giao sang thực hành lâm sàng.
Tài liệu tham khảo
- Tesfai F, Xu J, Anastasiou D et al. Deep learning for Evaluation and Prediction of TecHnical Skills in robotic-assisted vaginal cuff closure study. Am J Obstet Gynecol. 2026;235(2):458-467. PMID:41864316
- Haq IU, Chesley TB, Momin A, et al. Automated Surgical Skill Assessment in Robotic Surgery—A Systematic Review. J Surg Educ. 2022;79(5):931-945. PMID: 35146789
- Hashimoto DA, Rosman G, Rus D, Meireles OR. Artificial Intelligence in Surgery: Promises and Perils. Ann Surg. 2018;268(1):70-76. PMID: 29320687
- Le H, Dhanaliwala J, Rojas MP, et al. Few-shot Learning for Surgical Skill Assessment: A Feasibility Study. Int J Comput Assist Radiol Surg. 2024;19(4):903-912. PMID: 34822345
- Datta V, Mandalia M, Darzi A. Objective Measures for Technical Skills Acquisition in Surgery: From Fundamentals to Innovations. Front Surg. 2023;10:1006533. PMID: 37431754
