L'étude clinique menée par des chercheurs de Google et du Beth Israel Deaconess Medical Center sur le système de chat de santé appelé AMIE a été publiée dans The Lancet. L'annonce de Google du 8 octobre explique que les médecins suivent en temps réel les entretiens pré-examens de 98 patients. Cependant, la recherche examine la faisabilité de la surveillance humaine et reste clairement nécessaire pour des études cliniques plus vastes.
Le résumé de l’étude évaluée par des pairs indique que 114 personnes ont participé entre avril et novembre 2025, dont 98 ont terminé l’entretien et le rendez-vous. Les adultes anglophones ont parlé à l’AMIE jusqu’à cinq jours avant leur rendez-vous prévu aux urgences en soins primaires pour une seule plainte. En outre, l’équipe de recherche a partagé à l’avance les transcriptions et les résumés des entretiens avec les médecins qui procéderaient à l’examen et a placé tous les entretiens sous contrôle de sécurité.
De plus, les superviseurs n’ont ressenti le besoin d’interrompre aucune conversation selon les critères de sécurité qu’ils avaient préalablement déterminés, mais ce constat ne signifie pas qu’il n’y a pas d’erreur. En fait, le résumé de l'étude indique que les superviseurs ont noté un cas de mauvaise production et ont fourni des informations cliniques supplémentaires au système au cours de cinq entretiens distincts.
En revanche, les médecins ont rempli un questionnaire après l'entretien dans 60 des 98 cas au total et ont examiné le relevé de notes de l'AMIE avant l'examen dans 44 d'entre eux. Dans 33 de ces 44 cas, les médecins ont trouvé le système utile pour la préparation et dans 25 cas, ils ont déclaré qu'ils auraient pu modifier leur approche. Par conséquent, le taux d'utilité de 75 pour cent indiqué dans l'annonce ne couvre pas l'ensemble des 98 patients au total, mais 44 cas évalués par les médecins qui ont procédé à l'examen préliminaire.
Le résultat de 90 pour cent montre une correspondance dans sept diagnostics possibles
La description de la méthode de Google Research base la comparaison avec le diagnostic final sur un examen du dossier du patient huit semaines après la visite chez le médecin. Ainsi, dans 90 pour cent des cas, AMIE inclut le diagnostic final parmi les sept diagnostics possibles qu’il génère. Cependant, la correspondance dans les trois premières possibilités correspond à 75 pour cent, et le diagnostic le plus probable correspond à lui seul à 56 pour cent.
De plus, l’enquête explique qu’AMIE n’a pas accédé au dossier de santé électronique, n’a pas procédé à un examen physique et a mené des entretiens uniquement par chat textuel. Les médecins, en revanche, ont reçu de meilleures évaluations du système en termes de faisabilité et de coût des plans de prise en charge des patients, une différence que notent également les chercheurs.
Cependant, l'étude est une étude de faisabilité monocentrique, il ne s'agit donc pas d'un essai d'efficacité comparant un groupe de patients différent de manière contrôlée. Par conséquent, les résultats ne prouvent pas numériquement que le système est plus efficace que le flux actuel de visites ou qu’il réduit les temps d’attente chez les médecins. Cependant, l'étude financée par Alphabet fournit des données pour des recherches plus vastes en évaluant la qualité des rencontres et l'acceptation des patients sous la supervision d'un médecin.
Suite aux résultats publiés, Google affirme également que de grands essais cliniques sont nécessaires pour évaluer à plus grande échelle les systèmes d’intelligence artificielle utilisés directement par les patients. Par conséquent, la mission de l'AMIE dans cette recherche reste une expérience qui examine la collecte d'informations avant une consultation médicale et maintient une surveillance humaine.