검증은 인증이 아닌 사슬입니다
디지털 제품은 기술적으로 안정적이지만 임상적으로 오해를 불러일으킬 수 있고, 임상적으로 정확하지만 사용 불가능할 수 있으며, 임상 시험에서는 효과적이지만 업데이트 후에는 안전하지 않을 수 있습니다. IMDRF은 임상 평가를 유효한 임상 연관성, 분석적 또는 기술적 검증, 그리고 임상 검증으로 구분합니다. 이 질문들은 출력물이 해당 질환과 건전한 관계를 갖는지, 소프트웨어가 입력을 올바르게 처리하는지, 그리고 의도된 인구와 환경에서 목적을 달성하는지를 묻습니다. [1]
근거는 주장과 일치해야 합니다. 증상을 기록하는 일지는 사용성, 신뢰성, 개인 정보 보호 및 접근성 근거가 필요합니다. 응급 평가를 권고하는 모델은 진단 성능, 워크플로우 및 안전성 근거가 필요합니다. 치료적 중재는 증상, 기능 또는 다른 환자 중요 결과에 대한 비교 근거가 필요합니다. 임상적으로 검증되었다와 같은 광범위한 구절은 의도된 사용, 비교 대상 및 최종 결과 지표 없이는 의미가 없습니다.
- 연구 설계 선택 전에 사용 목적 문서를 작성하십시오.
- 대상 인구, 사용자, 환경, 입력 및 동작을 정의합니다.
- 예상되는 부정적인 결과를 목록화하고 그 결과를 설명합니다.
위험 수준에 따라 증거의 최소 기준이 결정됩니다.
NICE 증거 표준 프레임워크는 디지털 기술을 분류하고 비례적인 표준을 설정합니다. 이의 21 표준은 설계 요인, 가치 설명, 성능 입증, 가치 제공 및 배포를 다룹니다. 위험도가 높은 도구는 더 강력한 임상적 유효성 증거를 요구하며, 모든 단계는 관련 안전 및 품질 요구 사항을 다루어야 합니다. [2]
위험은 규제 등급보다 더 광범위합니다. 주기 추적기는 낮은 위험으로 보일 수 있지만, 추정된 가임기를 피임 등급의 확실성으로 제시할 경우 해를 끼칠 수 있습니다. 정신 건강 챗봇은 위기 언어를 인식하지 못할 경우 위험을 초래할 수 있습니다. 원격 혈압 측정 경로는 잘못된 커프, 데이터 누락, 지연된 에스컬레이션 또는 불분명한 책임으로 인해 실패할 수 있습니다. 평가는 완전한 사회기술적 경로를 연구해야 합니다.
- 손상, 되돌릴 수 있는지 여부, 감지 가능성을 평가하십시오.
- 미사용, 중단 및 디지털 소외를 결과로 포함하십시오.
- 현재 표준의 치료법을 비교 기준으로 사용합니다.
전향 연구는 워크플로우 효과를 보여줍니다
회고적 테스트는 초기 모델 개발에 유용하지만 임상의와 환자가 결과에 어떻게 반응하는지를 보여줄 수는 없습니다. DECIDE-AI은 AI 의 초기 단계 실시간 임상 평가를 위해 개발되었으며, 17 AI 특정 보고 항목과 28 하위 항목을 포함하고, 일반 항목도 포함합니다. 이는 대규모 임상 시험에 앞서 실제 임상 수행 능력, 인간 요소 및 안전성을 강조합니다. [4]
제품이 무작위 시험 준비가 되면, CONSORT-AI는 표준 시험 보고에 14 보고 항목을 추가합니다. 연구자는 중재, 필요한 사용자 기술, 환경, 입력 및 출력 처리, 인간-AI 상호작용 및 오류 사례를 기술해야 합니다. [3] 이러한 세부 사항은 재현 가능성을 가능하게 하고, 알고리즘, 추가 인력 또는 재설계된 워크플로에서 비롯된 명백한 이점이 있는지 여부를 밝힙니다.
- 개입의 정확성과 오염 여부를 사전에 정의합니다.
- 경고 응답, 우회, 지연 및 작업량을 측정합니다.
- 기술적 오류 및 누락된 결과를 그룹별로 보고하십시오.
- 임상 시험을 등록하고 프로토콜 및 분석 계획을 게시하십시오.
여성의 건강에는 생애 단계 및 형평성 테스트가 필요합니다.
검증 모집단은 의도된 사용자 및 수행 능력에 영향을 미칠 수 있는 생물학적 또는 사회적 변수를 반영해야 합니다. 사용 사례에 따라 연령, 주기 단계, 임신 또는 산후 시기, 폐경, 약물, 동반 질환, 언어, 광학 센서용 피부색, 장애 및 호환 가능한 장치에 대한 접근성이 포함될 수 있습니다. 하위 그룹 선택은 임상적으로 정당화되고 사전 지정되어야 합니다.
전반적인 정확도는 더 작은 고위험군에서 낮은 민감도를 가릴 수 있습니다. 혼동 행렬, 변별력, 보정 및 신뢰 구간을 보고하고, 권장 조치가 결과를 개선하는지 테스트하십시오. FDA 투명성 원칙은 훈련 및 테스트 데이터, 알려진 편향, 실패 모드, 인구 대표성 격차, 그리고 입력값이 개발 데이터와 다른 상황을 설명할 것을 권고합니다. [5]
- 인종을 생물학적 단축으로 취급하지 않고 구조적 설명을 조사한다.
- 영어로 인터페이스뿐만 아니라 번역 및 문해력 요구 사항을 테스트하십시오.
- 실제 소비자 장치 및 연결 조건에서 성능을 평가한다
출시 후에도 증거 지속
배포는 수용 테스트, 직원 교육, 대체 프로세스 및 명확한 책임 소재를 가지고 시작해야 합니다. 모니터링은 효과성, 안전성, 형평성, 사용성, 개인 정보 보호, 사이버 보안 및 서비스 영향 범위를 다루어야 합니다. WHO은 디지털 건강 개입에 대한 모니터링 및 평가 가이드에서 디지털 전달이 유익하다고 가정하기보다는 개입, 성숙도, 지표 및 평가 설계를 정의하는 것을 강조합니다. [6]
소프트웨어 업데이트는 위험도를 변경할 수 있습니다. 각 변경 사항은 분류, 검증 및 임상적으로 의미가 있는 경우 재검증이 필요합니다. 팀은 드리프트 임계값, 검토 주기, 사고 보고, 롤백 권한 및 환자 및 임상의와의 소통을 정의해야 합니다. 가장 신뢰할 수 있는 제품 설명은 버전별이며, 입증된 내용, 여전히 불확실한 내용, 그리고 모니터링 중인 내용을 명시해야 합니다.
- 버전 관리된 증거 파일과 변경 로그를 유지합니다.
- 하위 그룹의 성과와 부작용을 정기적으로 검토합니다.
- 발생 가능한 사고뿐만 아니라 확인된 피해를 조사합니다.
- 더 이상 증거 기준을 충족하지 않는 기능을 중단합니다.
증거가 아직 답하지 못하는 것
- 보고 지침은 투명성을 개선하지만, 약한 연구를 유효하게 만들지 않습니다.
- 규제 승인 및 건강 기술 평가는 다른 질문에 답함
- 짧은 시험은 드문 부작용, 행동 변화 및 성능 저하를 놓칠 수 있습니다.
- 잘못된 임상 연관성을 가진 제품은 현지 검증으로 구원할 수 없습니다.
관리가 필요한 질문
- 현재 이용 가능한 증거에 의해 지지되는 정확한 주장은 무엇입니까?
- 제품은 의도된 워크플로우에서 예비적으로 평가되었습니까?
- 결과는 환자에게 중요한가, 그리고 현재 치료와 비교됩니까?
- 하위 그룹 보고에는 신뢰 구간 및 누락이 포함됩니까?
- 각 소프트웨어 버전에 적용되는 모니터링 및 롤백 계획은 무엇입니까?
출처 기록
이 검토에 사용된 증거
출처는 임상적 권위, 방법론적 관련성 및 추적성을 위해 선택되었습니다. 링크는 원본 지침, 공중 보건 기록 또는 연구 출판물을 엽니다.
- [1]소프트웨어를 의료 기기로
미국 식품의약국 · 2025
- [2]디지털 헬스 기술에 대한 증거 기준 프레임워크
국립 보건 및 의료 서비스 평가 기관 · 2022
- [3]CONSORT-AI 확장
Nature Medicine · 2020
- [4]DECIDE-AI 보고 지침
Nature Medicine · 2022
- [5]머신 러닝 기반 의료 기기에 대한 투명성: 지침 원칙
US 식품의약품안전처, 보건부 캐나다 및 MHRA · 2024
- [6]디지털 건강 개입 모니터링 및 평가
세계 보건 기구 · 2016
본 근거 종합 자료는 일반적인 정보 제공을 위한 것입니다. 질병을 진단하거나 자격을 갖춘 의료 전문가의 진료를 대체할 수 없습니다. 치료 선택은 개인의 병력, 검진, 지역 지침 및 충분한 정보를 바탕으로 한 선호도에 따라 달라집니다. 응급 상황이거나 급격히 악화되는 증상은 즉시 지역 의료 평가가 필요합니다.



