详细梳理了新版国际标准ISO 80601-2-84:2020 Medical electrical equipment—Part 2-84:Particular requi-rements for basic safety and essential performance of ventilators for the emergency medical services environment,比较了ISO 80601-2-84:2020与ISO 10651-3:1997 Lung ventilators for medical use—Part 3:Particular requirements for emergency and transport ventilators的差异,分析了新版国际标准对工作数据准确性、危险输出的防护、呼吸机系统、使用环境等几方面的要求,可为生产企业和检验技术人员正确理解标准条款的要求和内涵提供参考.
本文对数字疗法的功能、使用方式、设计原理3个方面进行了介绍,从分类界定角度明确满足哪些条件的数字疗法产品属于医疗器械,从同一性测试,强度配置测试和安全性测试3个方面开展质量评价,对于3种质量评价方法分别提出符合性准则,并采用举例的方式详细说明,质量评价方法基本能够保证产品的安全和有效,伴随着技术的发展和研究的深入,方法有待于进一步提升和完善.
With the rise of artificial intelligence medical device (AIMD) industry, it is urgent for stakeholders to establish consensus on the definition and concepts of AIMD quality evaluation, so as to further support the development of standards and guidelines. To break through industry bottleneck, the National Medical Products Administration (NMPA) published YY/T 1833.1-2022 Artificial Intelligence Medical Device- Quality Requirements and Evaluation- Part 1: Terminology in 2022, which provides unified terminology. This standard is divided into five chapters, including a total of 158 terms that cover basic technology, data set, quality characteristics, quality evaluation and application scenario. This article introduces the general overview, the drafting history and explains its significance, with the aim of guiding the development of artificial intelligence medical device industry.
介绍了人工智能医疗器械数据集各质量特性的定义和质控需求,阐述了数据入库质控的流程和数据检验方法,以糖尿病视网膜病变眼底彩照数据集为例编制测试用例对提出的质控方案进行验证,论证了该解决方案的可行性,为数据集制造责任方开展数据清洗、数据平台开发人员设计数据筛选模块提供了参考.
目的 探讨影响人工智能心电分类算法抗扰性的因素.方法 使用公开心电数据库和开源的人工智能心电分类算法模型,在算法训练、测试环节引入实验室测量的噪声,同时改变训练集的样本量,观察算法测试结果的变化趋势.结果 当测试集单独添加噪声时,算法分类的总体准确性下降超过3%;当训练集、测试集分别添加相同类型噪声时,算法分类的总体准确性的降幅不超过0.5%;对于不同类型的心拍,训练集样本量对算法分类准确率的影响趋势各不相同.结论 人工智能心电分类算法在训练阶段可引入必要的噪声,以加强算法本身的抗扰性,但同时应关注各分类之间的差异.训练集的扩增并非必然提升算法的抗扰性.
目的 开展心室辅助装置电气安全和电磁兼容评价中的基本性能研究,为检验检测工作提供技术支撑.方法 通过对通用安全标准、电磁兼容标准和产品本身性能的分析和研究,确定心室辅助装置应涵盖的基本性能,并对评价方法进行解析.结果 通用标准解析表明,心室辅助装置性能(包括转速、流量、功率、流量特性、抗扭摆振动能力、密封性、溶血要求、启动性能等)和控制精度(包括转速、流量、功率等)应作为基本性能评价的指标,报警、辅助设备性能宜作为基本性能评价指标.结论 通过标准的解析和产品的研究,对心室辅助装置的基本性能确定提出了建议和方法,可为此类设备的检验检测工作奠定研究基础,同时对其他设备的基本性能研究也有一定的借鉴意义.
近年来,冠脉CT影像处理软件陆续被批准上市,此类产品的风险点在于人工智能算法的性能评价,本文根据冠脉CT影像处理软件产品的实际情况,提出了测试环境、数据集要求、测试平台、测试指标和通过准则等方面的测试要求,针对分段识别和检出、分类和分割功能提出测试方法和相应的评价指标,指出产品输出不同或测试集参考标准不同,可能导致评价方法不同,从而影响到测试结果.
数字疗法是依靠高质量的软件为患者提供基于循证医学证据的干预措施,融合了设计、临床评估、可用性和数据安全等先进技术,通过高质量、安全、有效的数据驱动型干预措施来应对各种疾病.监管机构根据需要对其进行审查或认证,以支持有关风险、功效和预期用途的产品声明.本研究针对数字疗法产品的共性技术问题展开讨论,从医疗器械定义出发,总结数字疗法产品关键属性,分别从结构组成、预期用途、循证医学和参与者等方面加以界定和限制;围绕数据质量、设计变更和算法构建等方面阐述了产品的设计开发问题,明确了产品使用环节的网络安全、可用性和强度配置等技术风险,并提出随机对照临床试验开展过程中面临的问题,以期为此类产品的监管提供思路和借鉴.
目的 目前国内外对基于微振动检测的呼吸监测装置的灵敏度、准确性评价尚未形成统一、有效的评价方法和平台,阻碍了该类产品的进一步发展.为了便于开展时微振动检测的呼吸监测装置的性能评价,本文提出研制基于凸轮往复运动的模拟振动发生平台.方法 通过控制器将模拟信号经过功率放大后,驱动凸轮结构按照设定的振动幅度和频率给柔性腔体施加振动压力,产生类似于人体体表产生的微位移.由于人体呼吸、咳嗽等动作产生单元不同,需要各个振动单元独立工作,在多个振动头的紧密配合下,最终经柔性腔体调制后产生类似于人体的共振信号.结果 实测数据显示,系统可依据临床测试数据,由专业人员对波形进行编辑后输入系统,输出正常呼吸、低通气、呼吸暂停、哮喘、咳嗽5种波形;幅度、频率可调.结论 本研究研制的测试平台可对基于微振动检测的呼吸监测装置开展相关测试,有利于科学有效地评价微振动检测的呼吸监测装置的性能和抗扰度,有助于形成合理的微振动检测的呼吸监测装置质量评价规范.
超声人工智能(Artiifcial Intelligence,AI)医疗器械近年来有了较大发展,采用何种测试方法来评价其性能指标成为一个亟待解决的问题.当前超声诊断类AI产品大部分还是基于超声图像并在其上进行图像勾勒、测量和检出分类.本文根据此类产品的特性,研究相对应的检验检测方法,探讨其优点与不足,为今后此类产品的检测提供思路,以及为建立统一的测试方法提供参考.
Datasets, as an important resource for artificial intelligence medical device industry, have been placed under medical device supervision. National Medical Products Administration (NMPA) has published a sectoral standard named YY/T 1833.2-2022 Artificial Intelligence Medical Device-Quality Requirements and Evaluation-Part 2: General Requirement for Datasets to guide dataset quality evaluation. This standard describes dataset requirements for documentation and quality measures, proposes evaluation methods, and helps dataset producers enhance quality control from the source. It would benefit clinical agencies in dataset construction and better meet industry need. This article introduces the background and key points of the standard, in order to better guide the applications in artificial intelligence medical device industry.
Objective. To explore a centralized approach to build test sets and assess the performance of an artificial intelligence medical device (AIMD) which is intended for computer-aided diagnosis of diabetic retinopathy (DR). Method. A framework was proposed to conduct data collection, data curation, and annotation. Deidentified colour fundus photographs were collected from 11 partner hospitals with raw labels. Photographs with sensitive information or authenticity issues were excluded during vetting. A team of annotators was recruited through qualification examinations and trained. The annotation process included three steps: initial annotation, review, and arbitration. The annotated data then composed a standardized test set, which was further imported to algorithms under test (AUT) from different developers. The algorithm outputs were compared with the final annotation results (reference standard). Result. The test set consists of 6327 digital colour fundus photographs. The final labels include 5 stages of DR and non-DR, as well as other ocular diseases and photographs with unacceptable quality. The Fleiss Kappa was 0.75 among the annotators. The Cohen’s kappa between raw labels and final labels is 0.5. Using this test set, five AUTs were tested and compared quantitatively. The metrics include accuracy, sensitivity, and specificity. The AUTs showed inhomogeneous capabilities to classify different types of fundus photographs. Conclusions. This article demonstrated a workflow to build standardized test sets and conduct algorithm testing of the AIMD for computer-aided diagnosis of diabetic retinopathy. It may provide a reference to develop technical standards that promote product verification and quality control, improving the comparability of products.
目的 研究超声手术刀刀头在多次清洗、消毒和灭菌后的性能变化,探究高值医用耗材重复使用的可行性.方法 设计清洗、消毒和灭菌方案,测试超声手术刀刀头在多次清洗、消毒和灭菌后的尖端主振幅、尖端横向振幅、静态(空载)电功率、夹紧力、抓持力.结果 分析不同方案的数据结果表明,试验后尖端主振幅、尖端横向振幅、静态(空载)电功率、夹紧力、抓持力5项性能指标均满足技术要求的指标,均未发生显著变化,也未出现超出技术要求规定的情况.结论 超声手术刀刀头在多次清洗、消毒和灭菌后在一定程度上仍能保持性能的准确性,可为此类高值医用耗材重复使用后关键性能指标评价提供一定的参考.
目的:建立可重复使用超声刀手术剪(简称超声刀)的清洗工艺确认方案,并对清洗有效性进行评价,为使用单位进行清洁方法确认和确保安全使用提供依据.方法:选择模拟血液污染物,按照确定的清洗工艺,选择最严苛的清洁方法挑战条件,通过对超声刀的可复用部件刀杆进行污染物负载-清洗数次后,提取残留污染物,并检测残留污染物中总蛋白和血红蛋白残留量.根据美国食品药品监督管理局(FDA)相关指导原则、美国医疗器械促进协会(AAMI)及美国材料和试验协会(ASTM)相关标准,设定可复用超声刀满足清洁要求的残留物限量指标(总蛋白残留量<6.4μg/cm2,血红蛋白残留量<2.2μg/cm2).结果:所建立的确认方案体系中,残留污染物的提取回收率均>79%;彻底提取验证研究中,单次提取回收率达到4次彻底提取回收的90%以上,满足实验要求.负载-清洗1次、4次、6次和8次清洗后,可重复使用超声刀总蛋白残留量均未检出,低于方法检测限(0.43μg/cm2);血红蛋白残留量均<0.34μg/cm2,低于确认方案体系的残留污染物中血红蛋白检测下限(1.10μg/cm2).结论:本研究建立的可复用超声刀手术剪清洁方法确认方案及清洁有效性评价方法;经验证,可重复使用超声刀8次,污染物负载-清洗后仍能满足所规定的清洁要求.
This study aimed at implementing practice to build a standardized protocol to test the performance of computer-aided detection (CAD) algorithms for pulmonary nodules. A test dataset was established according to a standardized procedure, including data collection, curation and annotation. Six types of pulmonary nodules were manually annotated as reference standard. Three specific rules to match algorithm output with reference standard were applied and compared. These rules included: (1) "center hit" [whether the center of algorithm highlighted region of interest (ROI) hit the ROI of reference standard]; (2) "center distance" (whether the distance between algorithm highlighted ROI center and reference standard center was below a certain threshold); (3) "area overlap" (whether the overlap between algorithm highlighted ROI and reference standard was above a certain threshold). Performance metrics were calculated and the results were compared among ten algorithms under test (AUTs). The test set currently consisted of CT sequences from 593 patients. Under "center hit" rule, the average recall rate, average precision, and average F1 score of ten algorithms under test were 54.68, 38.19, and 42.39%, respectively. Correspondingly, the results under "center distance" rule were 55.43, 38.69, and 42.96%, and the results under "area overlap" rule were 40.35, 27.75, and 31.13%. Among the six types of pulmonary nodules, the AUTs showed the highest miss rate for pure ground-glass nodules, with an average of 59.32%, followed by pleural nodules and solid nodules, with an average of 49.80 and 42.21%, respectively. The algorithm testing results changed along with specific matching methods adopted in the testing process. The AUTs showed uneven performance on different types of pulmonary nodules. This centralized testing protocol supports the comparison between algorithms with similar intended use, and helps evaluate algorithm performance.
目的:探索数字生物标记物的评价方式以及其在数字疗法(DTx)质量评价中的作用.方法:通过概述数字生物标记物的现有形式与评价方式,阐述数字生物标记物在DTx中的应用,对数字生物标记物质量评价可能存在的问题进行梳理,提出在数字生物标记物的质量评价中需重点把控的关键要素.结果:在各疾病领域已识别的数字生物标记物还需进一步验证,在数字生物标记物的开发过程以及质量评价中,需对数字生物标记物进行充分验证以及考虑数字生物标记物采集的重复性、稳定性和一致性.结论:在DTx中对数字生物标记物进行充分验证及质量评价,可以作为验证DTx有效性的部分证据,并为未来相关产品的监管以及质量评价提供参考.
目的 分析同一产品在不同样本上的性能差异,比较不同大小病灶的测试结果,对肺结节辅助检测产品算法性能的泛化能力进行测试.方法 将独立测试集导入肺结节辅助检测软件中,然后对产品全体输出结果和全体测试集参考标准进行匹配,以召回率、精确度为主要的检出指标,以Dice系数作为主要的分割指标,按照3种方式(方法1:全体产品输出结果与某大小范围内的参考标准进行匹配,计算检出指标;方法2:某大小范围内的产品输出结果与该大小范围内的参考标准进行匹配,计算检出指标;方法3:使用方法1计算召回率,某大小范围内的产品输出结果与全体参考标准进行匹配,计算精确度)对产品输出、参考标准进行筛选后重新计算指标,并比较不同大小范围病灶的召回率、精确度和Dice系数的测试结果.结果 采用方法2计算的召回率结果最低,采用方法3计算的精确度结果最高,召回率和Dice系数随着结节大小的变化结果存在明显差异.结论 对于肺结节辅助检测产品,当产品的预期用途与结节大小相关时,测试规则对测试结果有显著影响,有必要明确描述.
目的 人工智能医疗器械产品更新频率远高于传统医疗器械,因此需要建立动态稳健的医疗器械质量管理体系新模式,促进人工智能医疗器械产品健康发展.方法 通过讨论人工智能医疗器械的质量管理体系框架,在此基础上,讨论了影响人工智能医疗器械质量的关键因素,设计变更和验证确认环节的控制思路.并对人工智能医疗器械在质量评价过程中需重点关注的内容进行了比较全面的讨论,包括软件可解释性、评价方法和验证及确认方法问题.结果 影响人工智能医疗器械质量的关键因素包括设计变更和验证确认环节.同时,软件可解释性、评价方法和验证及确认也需要进行重点关注.结论 人工智能医疗器械正处于蓬勃发展期,相应的技术和业态也在不断形成中,需要针对人工智能医疗器械企业需要建立动态稳健的质量管理新模式,在缩短产品迭代更新的研发与验证周期的同时,及时前瞻性地发现算法更新带来的质量风险.
目的 结合具体案例,观测环境条件对人工智能(Artificial Intelligence,AI)医疗器械算法运行效率的影响,分析AI医疗器械环境试验需考虑的特殊要求.方法 本文以心电类AI算法为案例,在不同环境条件和模式下运行算法,比较算法效率和准确率的变化.结果 在额定工作湿热试验中,可以观察到AI心电算法的训练迭代周期有明显延长,效率下降;算法准确性受环境条件的影响不明显.当模型固定时,额定工作湿热试验进程中AI心电算法的运行时间、准确性都未观察到明显变化.结论 随着应用领域和使用场合越来越广泛,AI医疗器械需要考虑特殊极端环境的影响,加强试验验证.
目的 本文探讨了人工智能医疗器械质量评价测试集样本量的测算方法,并通过试验进行验证.方法 选取两种辅助诊断人工智能医疗器械,以不同的样本量计算召回率(灵敏度)、特异度、精确度指标,分析样本量与结果偏差的关系.结果 分别通过理论计算和试验分析的方式计算了糖尿病视网膜病变眼底图像及肺部CT影像辅助诊断软件满足检测的样本量要求,分别为700例和500例.结论 本文对于有流行病学统计病种产品的样本量估算方法进行了验证,对于无流行病学统计病种的样本量进行试验分析,得出了两类已上市产品的推荐测试样本量大小.在满足测试要求的前提下,最大限度地降低测试集样本数量,节约社会资源.