Khai thác AI No-Code trong phân loại ác tính nốt tuyến giáp bằng siêu âm: Bước tiến tới AI y khoa dễ tiếp cận và có thể tái lập

Điểm nổi bật

  • Một tác nhân AI tự động, no-code đã phát triển bộ phân loại ác tính của nốt tuyến giáp được hiệu chỉnh, sử dụng hình ảnh siêu âm mà không cần chuyên môn về machine learning.
  • Mô hình ResNet-18 đạt hiệu năng phân biệt cao ở tập nội bộ (AUROC 0,94) và tập बाहi kiểm định bên ngoài (AUROC 0,90), vượt trội so với một bộ chuẩn tham chiếu đã được thiết lập.
  • Kiểm định bên ngoài bao gồm nhiều тип mô học ung thư khác nhau, không chỉ giới hạn ở ung thư biểu mô tuyến giáp thể nhú, qua đó tăng tính liên quan trong chuyển dịch lâm sàng.
  • Các trường hợp ác tính bị bỏ sót chủ yếu tập trung ở nhóm u có kiểu hình nang, cho thấy những lĩnh vực cần được tinh chỉnh thêm và kiểm định tiền cứu.

Bối cảnh nghiên cứu

Nốt tuyến giáp rất thường gặp trong dân số nói chung, với tới 50% người trưởng thành có nốt có thể phát hiện được bằng siêu âm. Việc phân biệt nốt lành tính với nốt ác tính có ý nghĩa then chốt để lựa chọn xử trí phù hợp, nhưng vẫn còn là thách thức khi diễn giải siêu âm quy ước do các đặc điểm chồng lấp và sự khác biệt giữa người thực hiện. Ung thư biểu mô tuyến giáp thể nhú (Papillary Thyroid Carcinoma, PTC) là тип mô học ung thư tuyến giáp thường được nghiên cứu nhất trong các mô hình trí tuệ nhân tạo (Artificial Intelligence, AI) hiện có; tuy nhiên, các тип mô học khác như ung thư thể nang và thể tủy cũng đặt ra độ phức tạp chẩn đoán.

Các mạng nơ-ron tích chập học sâu (Convolutional Neural Networks, CNNs) đã cho thấy triển vọng trong phân loại nốt tuyến giáp trên hình ảnh siêu âm, nhưng đa số mô hình trước đây đòi hỏi chuyên môn machine learning chuyên biệt để phát triển và triển khai, đồng thời khả năng kiểm định độc lập bên ngoài còn hạn chế. Điều này tạo ra rào cản đối với chuyển giao lâm sàng và ứng dụng rộng rãi.

Các nền tảng AI no-code hứa hẹn dân chủ hóa việc phát triển bộ phân loại machine learning bằng cách tự động hóa các quy trình như kiểm tra dữ liệu, lựa chọn mô hình, huấn luyện và hiệu chỉnh xác suất. Tuy nhiên, báo cáo về kiểm định lâm sàng của AI tác nhân (agentic) no-code như vậy trong các nhiệm vụ chẩn đoán thực tế còn hiếm, đặc biệt là trên các тип ung thư tuyến giáp đa dạng.

Thiết kế nghiên cứu

Nghiên cứu chẩn đoán tính toán hồi cứu này sử dụng một hệ thống tác nhân AI no-code — Hugging Face ML-Intern — để tự động tạo mô hình phân loại ác tính của nốt tuyến giáp dựa trên hình ảnh siêu âm. Bộ dữ liệu mở TN5000 được dùng làm nguồn huấn luyện và kiểm định nội bộ. Hệ thống thực hiện kiểm tra dữ liệu, lựa chọn mô hình, huấn luyện và hiệu chỉnh xác suất mà không có sự can thiệp của con người.

Kiến trúc mô hình được lựa chọn là mạng nơ-ron tích chập ResNet-18 và được khóa lại sau huấn luyện. Kiểm định bên ngoài được tiến hành trên một đoàn hệ riêng biệt gồm 232 nốt tuyến giáp từ University of Colorado, bao gồm nhiều тип mô học ung thư khác ngoài ung thư biểu mô tuyến giáp thể nhú.

Các chỉ số hiệu năng của mô hình bao gồm diện tích dưới đường cong ROC (Area Under the Receiver-Operating Characteristic Curve, AUROC), độ nhạy, độ đặc hiệu, giá trị dự đoán dương (Positive Predictive Value, PPV) và giá trị dự đoán âm (Negative Predictive Value, NPV). Khả năng phân loại của mô hình sau kiểm định bên ngoài được đối chiếu với một bộ phân loại nốt tuyến giáp đã công bố trước đây và được đánh giá trên cùng bộ dữ liệu bên ngoài.

Kết quả chính

Mô hình do AI no-code tạo ra cho thấy độ chính xác chẩn đoán nội bộ rất tốt, đạt AUROC 0,94 (khoảng tin cậy 95% [CI], 0,92-0,95), với độ nhạy 90% và độ đặc hiệu 81%. Kết quả này phản ánh khả năng phân biệt mạnh giữa nốt ác tính và nốt lành tính trên tập huấn luyện.

Ở kiểm định bên ngoài, mô hình vẫn duy trì hiệu năng chẩn đoán cao với AUROC 0,90 (95% CI, 0,85-0,93). Độ nhạy vẫn rất tốt, đạt 92%, đảm bảo phát hiện được phần lớn trường hợp ác tính, trong khi độ đặc hiệu ở mức trung bình, đạt 68%. Mô hình cho PPV 52% và NPV cao, đạt 96%, phản ánh khả năng loại trừ ác tính đáng tin cậy.

So sánh với mô hình chuẩn tham chiếu trên cùng bộ dữ liệu bên ngoài cho thấy mô hình do AI no-code tạo ra vượt trội có ý nghĩa thống kê (AUROC 0,90 so với 0,83; kiểm định DeLong ghép cặp P = 0,03). Điều này nhấn mạnh hiệu năng cạnh tranh, thậm chí ưu việt, có thể đạt được thông qua quy trình AI tự động.

Phân tích các trường hợp bị phân loại sai cho thấy các ung thư bị bỏ sót chủ yếu là các u có kiểu hình nang, vốn thường khó phân biệt hơn chỉ dựa trên hình ảnh siêu âm. Điều này củng cố một hạn chế đã biết trong các bộ phân loại ác tính tuyến giáp và cho thấy nhu cầu tinh chỉnh trong tương lai, có thể bằng cách tích hợp thêm các phương thức chẩn đoán bổ trợ.

Nhận định của chuyên gia

Nghiên cứu này thể hiện một bước tiến đáng kể trong AI lâm sàng khi xác nhận rằng các nền tảng no-code, agentic có thể tự động tạo ra các bộ phân loại ác tính được hiệu chỉnh và có hiệu năng cao từ các bộ dữ liệu hình ảnh y khoa phức tạp. Bằng cách loại bỏ các rào cản kỹ thuật liên quan đến phát triển machine learning, những quy trình như vậy có thể dân chủ hóa đổi mới AI tại các cơ sở không có nguồn lực khoa học dữ liệu chuyên biệt.

Tuy nhiên, mặc dù các chỉ số hiệu năng hồi cứu rất hứa hẹn, tính hữu ích lâm sàng của mô hình này vẫn cần được kiểm định tiền cứu, đặc biệt là để xử lý các quần thể thực tế đa dạng và biến thiên về kỹ thuật chụp ảnh. Đặc biệt, độ đặc hiệu thấp hơn ở các đoàn hệ bên ngoài có thể phản ánh thiên lệch phổ bệnh hoặc khác biệt trong kỹ thuật siêu âm.

Việc các trường hợp ác tính bị bỏ sót tập trung ở u có kiểu hình nang phù hợp với đặc điểm bệnh học tinh vi của ung thư tuyến giáp, vốn nhiều khi không thể phân biệt trên hình ảnh học với u tuyến nang lành tính. Điều này nhấn mạnh nhu cầu chưa được đáp ứng đối với các cách tiếp cận đa mô thức hoặc các phương pháp học sâu nâng cao nhằm giảm mơ hồ chẩn đoán.

Nhìn chung, nghiên cứu ủng hộ tính tái lập và khả năng kiểm định độc lập của AI y khoa thông qua bộ dữ liệu mở và các mô hình đã được khóa, kiểm định bên ngoài — những trụ cột quan trọng đối với phê duyệt quản lý và niềm tin lâm sàng.

Kết luận

Quy trình AI no-code tự động đã phát triển thành công một bộ phân loại ác tính nốt tuyến giáp được hiệu chỉnh đầy đủ, thể hiện hiệu năng nội bộ vững chắc và vẫn duy trì giá trị chẩn đoán trên một đoàn hệ bên ngoài có nhiều тип mô học ung thư khác nhau. Cách tiếp cận này thúc đẩy phát triển AI y khoa dễ tiếp cận, có thể tái lập và có thể kiểm định độc lập, qua đó giải quyết các rào cản then chốt đối với chuyển giao lâm sàng.

Trước khi triển khai trong thực hành lâm sàng, cần kiểm định tiền cứu, hiệu chỉnh lại mô hình cho các biến thiên hình ảnh tại địa phương, và nghiên cứu tình trạng phân loại sai ở u nang. Dù vậy, bằng chứng khái niệm đầy hứa hẹn này mở ra một mô hình mới, trong đó bác sĩ lâm sàng và nhà nghiên cứu có thể khai thác các công cụ AI no-code để thúc đẩy đổi mới y học và nâng cao độ chính xác chẩn đoán trong đánh giá ung thư tuyến giáp.

Hỗ trợ kinh phí và thử nghiệm lâm sàng

Nghiên cứu này được hỗ trợ bởi các nguồn lực học thuật và thể chế liên quan đến University of Colorado và sáng kiến bộ dữ liệu mã nguồn mở TN5000. Không áp dụng đăng ký thử nghiệm lâm sàng vì đây là một đánh giá chẩn đoán tính toán hồi cứu.

Tài liệu tham khảo

1. Thomas J, Pozdeyev N. An agentic, no-code artificial intelligence workflow for developing a thyroid nodule ultrasound malignancy classifier. The Journal of Clinical Endocrinology and Metabolism. 2026; PMID: 42808848.

2. Haugen BR, Alexander EK, Bible KC, et al. 2015 American Thyroid Association Management Guidelines for Adult Patients with Thyroid Nodules and Differentiated Thyroid Cancer: The American Thyroid Association Guidelines Task Force on Thyroid Nodules and Differentiated Thyroid Cancer. Thyroid. 2016;26(1):1-133.

3. Chen H, Engkvist O, Wang Y, Olivecrona M, Blaschke T. The rise of deep learning in drug discovery. Drug Discovery Today. 2018;23(6):1241-1250.

4. Litjens G, Kooi T, Bejnordi BE, et al. A survey on deep learning in medical image analysis. Medical Image Analysis. 2017;42:60-88.

5. Kim DW, Jang HY, Kim KW, Shin Y, Park SH. Design Characteristics of Studies Reporting the Performance of Artificial Intelligence Algorithms for Diagnostic Analysis of Medical Images: Results from Recently Published Papers. Korean Journal of Radiology. 2019;20(3):405-410.

6. Bongiovanni M, Spitale A, Faquin WC, Mazzucchelli L, Baloch ZW. The Bethesda System for Reporting Thyroid Cytopathology: a meta-analysis. Acta Cytol. 2012;56(4):333-9.

7. Li W, Kang H, Liu J, et al. Ultrasonographic evaluation of follicular thyroid carcinoma. Journal of Ultrasound in Medicine. 2020;39(7):1303-1310.

8. Nitta H, Takieddin M, Agrawal S, et al. External Validation of Deep Learning-Based Ultrasound Thyroid Nodule Risk Stratification System. Endocrine. 2023;78(3):401-410.

Comments

No comments yet. Why don’t you start the discussion?

Để lại một bình luận