La validation est une chaîne, pas un certificat
Un produit numérique peut être techniquement stable mais cliniquement trompeur, cliniquement précis mais inutilisable, ou efficace dans un essai mais non sûr après une mise à jour. Le IMDRF sépare l'évaluation clinique en une association clinique valide, validation analytique ou technique, et validation clinique. Ces questions se demandent si un résultat a une relation solide avec la condition, si le logiciel traite correctement les entrées, et si il atteint son but dans la population prévue et le cadre. [1]
Un journal qui conserve les symptômes doit être utilisable, fiable, confidentiel et accessible. Un modèle qui recommande une évaluation urgente doit être évalué en fonction du rendement diagnostique, du déroulement du travail et des preuves de sécurité. Une intervention thérapeutique doit être comparée à des données sur les symptômes, la fonction ou un autre résultat important pour le patient.
- Écrire la déclaration d'utilisation prévue avant de choisir le plan d'étude.
- Définir la population cible, l'utilisateur, le réglage, l'entrée et l'action.
- Énumérer les résultats erronés prévisibles et leurs conséquences.
Le risque détermine le seuil de preuve
Le cadre de normes NICE Evidence Standards Framework classifie les technologies numériques et établit des normes proportionnées. Ses normes 21 couvrent les facteurs de conception, la description de la valeur, la démonstration de la performance, la fourniture de la valeur et le déploiement. [2]
Un traceur de cycle peut sembler à faible risque mais peut causer des dommages s'il présente une fenêtre fertile estimée comme certitude de niveau contraceptif. Un chatbot de santé mentale peut créer des risques s'il ne reconnaît pas le langage de crise. Une voie de pression artérielle à distance peut échouer par une mauvaise manchette, des données manquantes, une escalade retardée ou une responsabilité incertaine. L'évaluation devrait étudier la voie sociotechnique complète.
- Évaluer la gravité, la réversibilité et la détectabilité des dommages.
- Inclure les résultats de non-utilisation, d'abandon scolaire et d'exclusion numérique.
- Utilisez la norme actuelle de soins comme comparateur.
Des études prospectives révèlent des effets sur le déroulement des travaux
Les tests rétrospectifs sont utiles pour le développement de modèles précoces, mais ne peuvent pas montrer comment les cliniciens et les patients réagissent à un résultat. DECIDE-AI a été développé pour l'évaluation clinique en direct des éléments de base de AI et comprend les éléments de rapport spécifiques 17 AI- avec les sous-éléments 28, plus les éléments génériques. [4]
Lorsqu'un produit est prêt pour un essai randomisé, CONSORT-AI ajoute les éléments de rapport 14 à la déclaration d'essai standard. Les chercheurs doivent décrire l'intervention, les compétences requises des utilisateurs, le réglage, la manipulation des entrées et des sorties, l'interaction humaine-AI et les cas d'erreur. [3] Ces détails permettent de reproduire et de montrer si l'algorithme, le personnel supplémentaire ou un workflow remanié ont apporté des avantages apparents.
- Préciser la fidélité et la contamination de l'intervention.
- Mesurer la réponse d'alerte, le dépassement, le retard et la charge de travail.
- Signaler les défaillances techniques et les résultats manquants par groupe.
- Enregistrer les essais et publier le protocole et le plan d'analyse.
La santé des femmes exige des tests de stade de vie et d'équité
Selon le cas d'utilisation, cela peut inclure l'âge, le stade du cycle, la grossesse ou le timing post-partum, la ménopause, les médicaments, la comorbidité, le langage, le tonus cutané des capteurs optiques, le handicap et l'accès à un appareil compatible. La sélection des sous-groupes doit être cliniquement justifiée et pré-présélectionnée.
La précision globale peut masquer une mauvaise sensibilité dans un groupe à risque élevé plus petit. Signaler des matrices de confusion, des intervalles de discrimination, d'étalonnage et de confiance, puis vérifier si l'action recommandée améliore les résultats. FDA Les principes de transparence conseillent de décrire les données de formation et d'essai, les biais connus, les modes d'échec, les lacunes dans la représentation de la population et les circonstances dans lesquelles les intrants diffèrent des données de développement. [5]
- Ne traitez pas la race comme un raccourci biologique sans examiner les explications structurelles.
- Tester les traductions et les exigences de littératie, pas seulement l'interface anglaise.
- Évaluer les performances avec les appareils de consommation réels et les conditions de connectivité.
Les preuves se poursuivent après le lancement
Le suivi devrait porter sur l'efficacité, la sécurité, l'équité, la convivialité, la protection de la vie privée, la cybersécurité et l'impact sur les services. Le guide de suivi et d'évaluation des interventions en santé numérique de WHO met l'accent sur la définition de l'intervention, de la maturité, des indicateurs et de la conception de l'évaluation plutôt que sur la prestation numérique. [6]
Les équipes devraient définir les seuils de dérive, examiner la cadence, les rapports d'incident, les pouvoirs de rétractation et la communication avec les patients et les cliniciens. L'énoncé de produit le plus fiable est propre à la version et indique ce qui a été montré, ce qui demeure incertain et ce qui est surveillé.
- Tenir un dossier de preuves en version et un journal des changements.
- Examiner le rendement du sous-groupe et les effets indésirables selon un calendrier établi.
- Enquêter sur les disparus et les dommages confirmés.
- Les fonctions de retrait ne répondent plus au seuil de preuve.
Ce que la preuve ne peut pas encore répondre
- Les lignes directrices en matière de rapports améliorent la transparence, mais ne rendent pas une étude faible valable.
- Une autorisation réglementaire et une évaluation des technologies de la santé répondent à différentes questions.
- De courts essais peuvent manquer de dommages rares, de changement de comportement et de dérive de performance.
- La validation locale ne peut pas sauver un produit dont l'association clinique est malsaine.
Questions à prendre en considération
- Quelle est la revendication exacte appuyée par les éléments de preuve disponibles?
- Le produit a-t-il été évalué de façon prospective dans le cadre de son flux de travail prévu?
- Les résultats sont-ils importants pour le patient et comparés aux soins actuels?
- Les rapports des sous-groupes comprennent-ils les intervalles de confiance et les absences?
- Quel plan de suivi et de retour s'applique à chaque version du logiciel?
Données de base
Preuves utilisées dans le présent examen
Les sources ont été sélectionnées pour l'autorité clinique, la pertinence méthodologique et la traçabilité.
- [1]Logiciel comme instrument médical
Administration des aliments et des médicaments des États-Unis · 2025
- [2]Cadre des normes relatives aux données probantes pour les technologies numériques de la santé
Institut national pour l'excellence en santé et en soins · 2022
- [3]Extension CONSORT-AI
Médecine de la nature · 2020
- [4]Ligne directrice concernant les rapports DECIDE-AI
Médecine de la nature · 2022
- [5]Transparence pour les instruments médicaux à apprentissage automatique : principes directeurs
US Food and Drug Administration, Santé Canada et MHRA · 2024
- [6]Surveillance et évaluation des interventions en santé numériques
Organisation mondiale de la Santé · 2016
Cette synthèse des données probantes est destinée à des informations générales, ne diagnostique pas une affection ou ne remplace pas les soins d'un professionnel de la santé qualifié. Les choix de traitement dépendent des antécédents individuels, de l'examen, des conseils locaux et de la préférence éclairée.



