亮点
- 一种自主式、无代码AI代理利用超声图像,成功构建了甲状腺结节恶性风险分类器,且无需机器学习专业背景。
- ResNet-18模型在内部验证中表现出较高的判别能力(AUROC 0.94),在外部验证中亦保持良好表现(AUROC 0.90),优于既有基准模型。
- 外部验证纳入了除乳头状甲状腺癌之外的多种癌症组织学类型,增强了研究结果的转化相关性。
- 漏诊的恶性病变主要集中于滤泡型模式肿瘤,提示该类病变仍需进一步优化并开展前瞻性验证。
研究背景
甲状腺结节在普通人群中十分常见,成年人中多达50%可通过超声检出结节。对良性与恶性结节进行鉴别,对于制定恰当的临床管理方案至关重要;然而,由于超声影像特征存在重叠且操作者差异较大,常规超声判读仍然具有挑战性。乳头状甲状腺癌(papillary thyroid carcinoma,PTC)是现有人工智能(artificial intelligence,AI)模型中研究最为充分的甲状腺癌组织学类型;但滤泡癌、髓样癌等其他组织学类型同样具有较高的诊断复杂性。
深度学习卷积神经网络(convolutional neural networks,CNNs)已显示出在甲状腺超声图像结节分类中的应用潜力,但既往多数模型在开发和部署时均需要专门的机器学习经验,且可供独立外部测试的研究较少。这些因素限制了其临床转化和广泛应用。
无代码AI平台有望通过自动化数据审核、模型选择、训练和校准等流程,促进机器学习分类器开发的普及化。然而,关于此类具备自主代理能力的无代码AI在真实世界诊断任务中的临床验证仍较少见,尤其是在不同甲状腺癌组织学类型中更为如此。
研究设计
本回顾性计算机辅助诊断研究采用无代码AI自主代理系统——Hugging Face ML-Intern——基于甲状腺超声图像自主生成甲状腺结节恶性风险分类模型。开源TN5000数据集作为训练及内部验证来源。该系统无需人工干预即可完成数据审核、模型选择、训练及概率校准。
最终选定的模型架构为ResNet-18卷积神经网络,并在训练后予以锁定。外部验证在科罗拉多大学的独立队列中完成,共纳入232个甲状腺结节,包含除乳头状甲状腺癌之外的多种癌症组织学类型。
模型性能指标包括受试者工作特征曲线下面积(area under the receiver-operating characteristic curve,AUROC)、敏感度、特异度、阳性预测值(positive predictive value,PPV)和阴性预测值(negative predictive value,NPV)。外部验证后的模型分类能力与一项先前发表、并在同一外部数据集上评估的甲状腺结节分类器进行比较。
主要发现
无代码AI生成的模型在内部验证中表现出稳健的诊断准确性,AUROC为0.94(95%置信区间[CI]:0.92-0.95),敏感度为90%,特异度为81%。这一结果反映出该模型在训练数据集上能够较好地区分恶性与良性结节。
在外部验证中,模型仍保持较高的诊断性能,AUROC为0.90(95% CI:0.85-0.93)。敏感度仍然较高,达92%,可检测出大多数恶性病变;特异度为68%,属中等水平。模型的PPV为52%,NPV较高,达96%,提示其对排除恶性病变具有较可靠的能力。
与同一外部数据集上的基准模型比较显示,该无代码AI生成模型的表现显著优于基准模型(AUROC 0.90 vs. 0.83;配对DeLong检验,P = 0.03)。这表明,通过自主AI流程可以获得具有竞争力甚至更优的模型性能。
对误分类病例的分析显示,漏诊癌症主要为滤泡型模式肿瘤,这类肿瘤仅凭超声影像往往更难区分。这一发现提示了甲状腺恶性肿瘤分类器中已知的局限性,也表明未来需要进一步优化,或整合其他辅助诊断方式。
专家点评
本研究通过验证无代码、具自主代理能力的平台能够自主生成性能良好且经过校准的恶性风险分类器,体现了临床AI领域的重要进展。此类流程可消除机器学习开发相关的技术门槛,从而推动缺乏专门数据科学资源的机构开展AI创新。
然而,尽管回顾性性能指标令人鼓舞,该模型的临床实用性仍需前瞻性验证,尤其应覆盖更为多样化的真实世界人群及不同成像差异。尤其是外部队列中特异度较低,可能反映了谱系偏倚或超声技术差异。
漏诊恶性病变集中于滤泡型模式肿瘤,与甲状腺癌的复杂病理特征一致;此类病变在影像学上常与良性滤泡腺瘤难以区分。这强调了多模态方法或更先进深度学习技术在降低诊断歧义方面的迫切需求。
总体而言,该研究通过开放数据集以及锁定后可独立外部验证的模型,支持了医学AI的可重复性与独立可测试性——这正是监管批准和临床信任所依赖的关键基础。
结论
该自主式无代码AI流程成功开发出一个经过充分校准的甲状腺结节恶性风险分类器,在内部验证中表现稳健,并在包含多种癌症组织学类型的外部队列中保持了诊断有效性。该方法有助于推动可获取、可重复且可独立测试的医学AI开发,缓解临床转化中的关键障碍。
在临床应用之前,仍需开展前瞻性验证、针对本地影像差异进行模型再校准,并进一步研究滤泡型肿瘤误分类问题。尽管如此,这一具有前景的概念验证提示了新的发展范式:临床医生和研究人员可借助无代码AI工具加速医学创新,并提升甲状腺癌评估的诊断精度。
资助与临床试验
本研究得到科罗拉多大学相关学术及机构资源,以及开源TN5000数据集项目的支持。由于本研究属于回顾性计算机辅助诊断评估,因此不适用临床试验注册。
参考文献
1. Thomas J, Pozdeyev N. An agentic, no-code artificial intelligence workflow for developing a thyroid nodule ultrasound malignancy classifier. The Journal of Clinical Endocrinology and Metabolism. 2026; PMID: 42808848.
2. Haugen BR, Alexander EK, Bible KC, et al. 2015 American Thyroid Association Management Guidelines for Adult Patients with Thyroid Nodules and Differentiated Thyroid Cancer: The American Thyroid Association Guidelines Task Force on Thyroid Nodules and Differentiated Thyroid Cancer. Thyroid. 2016;26(1):1-133.
3. Chen H, Engkvist O, Wang Y, Olivecrona M, Blaschke T. The rise of deep learning in drug discovery. Drug Discovery Today. 2018;23(6):1241-1250.
4. Litjens G, Kooi T, Bejnordi BE, et al. A survey on deep learning in medical image analysis. Medical Image Analysis. 2017;42:60-88.
5. Kim DW, Jang HY, Kim KW, Shin Y, Park SH. Design Characteristics of Studies Reporting the Performance of Artificial Intelligence Algorithms for Diagnostic Analysis of Medical Images: Results from Recently Published Papers. Korean Journal of Radiology. 2019;20(3):405-410.
6. Bongiovanni M, Spitale A, Faquin WC, Mazzucchelli L, Baloch ZW. The Bethesda System for Reporting Thyroid Cytopathology: a meta-analysis. Acta Cytol. 2012;56(4):333-9.
7. Li W, Kang H, Liu J, et al. Ultrasonographic evaluation of follicular thyroid carcinoma. Journal of Ultrasound in Medicine. 2020;39(7):1303-1310.
8. Nitta H, Takieddin M, Agrawal S, et al. External Validation of Deep Learning-Based Ultrasound Thyroid Nodule Risk Stratification System. Endocrine. 2023;78(3):401-410.
