Bối cảnh: Giải quyết các thách thức trong đánh giá chức năng thanh quản
Các rối loạn thanh quản bao gồm một phổ tình trạng ảnh hưởng đến phát âm, bảo vệ đường thở và nuốt, từ đó tác động đáng kể đến chất lượng cuộc sống. Trong thực hành lâm sàng, đánh giá thường sử dụng nội soi thanh quản video (videolaryngoscopy) để quan sát vận động của dây thanh âm. Tuy nhiên, phân tích thủ công chức năng thanh quản trong quá trình thăm khám tốn nhiều thời gian, mang tính chủ quan và dễ có sai khác giữa các người đánh giá. Phân loại tự động theo thời gian thực các hành vi thanh quản có thể cải thiện độ chính xác chẩn đoán, tinh giản quy trình làm việc lâm sàng và cho phép thu thập dữ liệu có khả năng mở rộng phục vụ nghiên cứu cũng như theo dõi điều trị.
Thiết kế nghiên cứu và phương pháp
Nghiên cứu của Koivu và cộng sự giới thiệu một phương pháp học máy tiên tiến, khai thác động học dây thanh âm được ghi nhận bằng nội soi thanh quản video (videolaryngoscopy). Các nhà nghiên cứu đã phát triển một mạng nơ-ron Gated Recurrent Unit (GRU) dạng residual có trạng thái, xử lý dữ liệu theo dõi từ 39 điểm đặc trưng trên thanh quản. Các điểm đặc trưng này được phát hiện bằng một mô hình đã công bố trước đó, chuyên về nhận diện mốc giải phẫu thanh quản. Mô hình GRU phân loại các trạng thái chức năng bao gồm phát âm, phát âm kéo dài, nuốt, trạng thái nhàn rỗi (nghỉ), ho, ngửi và các đoạn ngoài trường quan sát.
Bộ dữ liệu huấn luyện gồm 916 đoạn trạng thái có chú thích, tương ứng với 222.065 khung hình từ 72 video nội soi thanh quản. Một bộ dữ liệu kiểm thử độc lập với 123 đoạn và 49.770 khung hình từ 8 video bổ sung được dùng để đánh giá khả năng khái quát hóa của mô hình. Hiệu năng được lượng hóa bằng các chỉ số phân loại tiêu chuẩn (độ chính xác, điểm F1) và mức độ tương hợp theo thời gian được đo bằng Intersection over Union trung bình (mIoU).
Kết quả chính và diễn giải
Nghiên cứu cho thấy việc phân loại theo thời gian thực các hành vi thanh quản từ động học dây thanh âm là khả thi và có độ chính xác cao. Mô hình đạt độ chính xác chung 92% trên bộ kiểm thử độc lập, với mIoU 0,82, cho thấy sự tương hợp theo thời gian mạnh giữa dự đoán và chú thích thủ công.
Điểm F1 theo từng lớp cho thấy hiệu năng ổn định ở các trạng thái: phát âm đạt 83%, ngửi 97%, và các trạng thái phát âm kéo dài, nuốt, nhàn rỗi, cùng ngoài trường quan sát cũng có các chỉ số phân loại thuận lợi. Điểm F1 thấp nhất là ở trạng thái ho, đạt 82%, nhưng khoảng tin cậy cho thấy mức độ ổn định hợp lý. Sự khác biệt này có thể phản ánh tính phức tạp theo thời gian và biến thiên của hành vi ho.
Độ chính xác cao và độ chính xác theo thời gian mở ra cơ hội tích hợp các mô hình như vậy vào các phiên nội soi lâm sàng, cung cấp phản hồi tức thì cho bác sĩ về hành vi thanh quản của người bệnh và có khả năng kích hoạt các nhắc nhở hoặc can thiệp trong quá trình thăm khám.
Bình luận chuyên gia và ý nghĩa lâm sàng
Diễn giải tự động chuyển động dây thanh âm có thể tạo ra bước tiến đáng kể cho chuyên ngành tai mũi họng bằng cách chuẩn hóa đánh giá chức năng thanh quản và giảm thiểu tính chủ quan. Việc sử dụng mô hình GRU có trạng thái, nắm bắt các phụ thuộc theo thời gian, phù hợp chặt chẽ với tính chất động của các hoạt động thanh quản.
Vẫn còn những thách thức, bao gồm sự biến thiên về hình thái giải phẫu và biểu hiện bệnh lý có thể ảnh hưởng đến độ chính xác của theo dõi và tính nhất quán của phân loại. Các nghiên cứu tiếp theo nên khảo sát bộ dữ liệu đa trung tâm lớn hơn, tích hợp các trạng thái bệnh lý, và đánh giá tác động của việc tích hợp vào thực hành lâm sàng thực tế đối với kết cục điều trị.
Hơn nữa, phương pháp này đặt nền tảng cho các hướng phát triển tiếp theo như phát hiện bệnh lý tự động, phân độ mức độ nặng và theo dõi dọc theo thời gian, những yếu tố đều rất quan trọng trong quản lý cá thể hóa các rối loạn giọng nói.
Kết luận và định hướng tương lai
Nghiên cứu này thiết lập một nền tảng đầy hứa hẹn cho việc phân loại tự động theo thời gian thực các hành vi chức năng của thanh quản bằng học máy tiên tiến trên động học dây thanh âm thu được từ nội soi thanh quản video (videolaryngoscopy). Phương pháp này mang tính mở rộng, có thể nâng cao chất lượng dữ liệu lâm sàng và hiệu quả quy trình làm việc.
Việc tiếp tục phát triển và thẩm định các mô hình như vậy có thể mở rộng giá trị sử dụng của chúng vượt ra ngoài phạm vi nghiên cứu, tiến tới thực hành lâm sàng thường quy, cho phép đánh giá khách quan, nhanh chóng và có tính lặp lại cao nhằm chẩn đoán và điều trị tốt hơn các bệnh lý thanh quản.
Tài trợ và công bố
Nghiên cứu gốc của Koivu và cộng sự không nêu rõ nguồn tài trợ hoặc đăng ký thử nghiệm lâm sàng trong phần tóm tắt. Cần tham khảo bản đầy đủ của bài báo để xem xét chi tiết các công bố liên quan nhằm đánh giá khả năng tồn tại xung đột lợi ích.
Tài liệu tham khảo
- Koivu A, Lin PY, Simonyan K, Naunheim MR. Real-Time Classification of Functional Laryngeal Behaviors From Vocal Fold Kinematics. The Laryngoscope. 2026 Sep 18. PMID: 42760595.
- Roy N, Merrill RM, Gray SD, Smith EM. Voice Disorders in the General Population: Prevalence, Risk Factors, and Occupational Impact. Laryngoscope. 2005 Apr;115(4):757-64.
- Simonyan K, Zisserman A. Very Deep Convolutional Networks for Large-Scale Image Recognition. arXiv preprint arXiv:1409.1556. 2014.