喉镜检查迈向实时智能评估:基于声带运动学的喉功能行为分类

背景:应对喉功能评估中的挑战

喉部疾病涵盖一系列影响发声、气道保护和吞咽的病症,并会显著降低生活质量。临床评估中常采用视频喉镜检查(videolaryngoscopy)观察声带运动。然而,检查过程中对喉功能的人工分析费时费力,且具有主观性,容易产生差异。若能对喉部行为进行实时自动分类,将有助于提高诊断准确性,简化临床工作流程,并支持可扩展的数据采集,用于研究及治疗监测。

研究设计与方法

Koivu 等人的研究提出了一种前沿的机器学习方法,利用视频喉镜检查所捕获的声带运动学数据。研究人员开发了一种具有状态记忆的残差门控循环单元(Gated Recurrent Unit,GRU)神经网络,可处理来自喉部39个关键点的跟踪数据。这些关键点通过既往发表的、专门用于喉部标志点识别的模型检测获得。该 GRU 模型对包括发声、持续发声、吞咽、静止(休息)、咳嗽、嗅吸和视野外片段在内的功能状态进行分类。

训练数据集由916个已标注状态片段组成,共包含来自72段喉镜视频的222,065帧。独立测试数据集包含来自另外8段视频的123个片段和49,770帧,用于评估模型的泛化能力。性能采用标准分类指标(准确率、F1 值)进行量化,时间一致性则通过平均交并比(mean Intersection over Union,mIoU)衡量。

主要发现与解读

研究表明,基于声带运动学对喉部行为进行实时分类既可行,又具有很高的准确性。该模型在独立测试集上的总体准确率达到92%,mIoU 为0.82,提示预测结果与人工标注之间具有较强的时间对齐一致性。

各类别 F1 值显示模型在不同状态下均具有较好的表现:发声达到83%,嗅吸达到97%,持续发声、吞咽、静止和视野外片段也表现出较理想的分类指标。咳嗽的 F1 值最低,为82%,但置信区间提示其稳定性仍较为可接受。这种差异可能反映了咳嗽行为在时间结构和表现形式上的复杂性及变异性。

较高的准确性与时间精度为将此类模型整合进临床内镜检查流程提供了机会,可在检查过程中向临床医生即时反馈患者的喉部行为,并有可能在检查时触发提示或干预。

专家评论与临床意义

对声带运动的自动化解读有望推动耳鼻咽喉科领域的变革,通过标准化喉功能评估并减少主观性而提升诊疗质量。采用能够捕捉时间依赖关系的状态记忆 GRU,与喉部活动的动态特征高度契合。

但仍存在若干挑战,包括解剖结构及病理表现的差异可能影响跟踪准确性和分类一致性。未来研究应探索更大规模的多中心数据集,纳入病理状态,并评估其在真实临床场景中的整合对结局的影响。

此外,该方法学也为后续的自动病理检测、严重程度分级及纵向监测奠定了基础,而这些对于个体化声带疾病管理至关重要。

结论与未来方向

本研究为利用基于视频喉镜检查所得的声带运动学数据,通过先进机器学习实现喉功能行为的实时自动分类建立了一个具有前景的基础。该方法为提升临床数据质量和工作流程效率提供了可扩展路径。

持续开发并验证此类模型,可将其应用范围从研究扩展至常规临床实践,进而实现客观、快速且可重复的评估,以改善喉部病变的诊断与治疗。

资助与披露

Koivu 等人的原始研究在摘要中未说明资助来源或临床试验注册信息。为评估潜在利益冲突,应进一步查阅全文以获取更详细的披露内容。

参考文献

  • Koivu A, Lin PY, Simonyan K, Naunheim MR. Real-Time Classification of Functional Laryngeal Behaviors From Vocal Fold Kinematics. The Laryngoscope. 2026 Sep 18. PMID: 42760595.
  • Roy N, Merrill RM, Gray SD, Smith EM. Voice Disorders in the General Population: Prevalence, Risk Factors, and Occupational Impact. Laryngoscope. 2005 Apr;115(4):757-64.
  • Simonyan K, Zisserman A. Very Deep Convolutional Networks for Large-Scale Image Recognition. arXiv preprint arXiv:1409.1556. 2014.

Comments

No comments yet. Why don’t you start the discussion?

发表回复