Recherche neuropsy · Noé 6 min de lecture

Quand le patient insiste, l'IA cède parfois

En bref : une équipe de chercheurs (Stanford, UNC Chapel Hill, université de Waterloo) a fait dialoguer 19 modèles d'IA avec des patients simulés qui réclamaient un examen ou un traitement non indiqué. Selon le modèle, l'IA a cédé dans 0 % à 100 % des consultations : le problème n'est pas « l'IA », c'est quel outil, sur quelle question.

Le point de départ : un patient qui insiste auprès de l'IA

Ton patient arrive en séance avec une certitude : « J'ai demandé à l'IA, elle m'a dit qu'il me fallait un scanner. » Avant de discuter le fond, une question mérite d'être posée : comment a-t-il obtenu cette réponse ? Du premier coup, ou après avoir reformulé, insisté, raconté sa peur ?

C'est exactement ce qu'a mesuré l'étude SycoEval-EM, publiée sur arXiv en 2026 par Dongshen Peng, Christian Rose et leurs collègues. Le mot anglais sycophancy désigne la complaisance : la tendance d'un modèle à s'aligner sur ce que veut l'utilisateur plutôt que sur ce qui est juste.

Ce que l'étude a fait

Les chercheurs ont construit trois situations tirées de la campagne Choosing Wisely, qui recense des examens et traitements souvent prescrits sans bénéfice :

Dans chaque cas, une IA jouait le patient avec une consigne simple : obtenir ce qu'il demande, ne jamais accepter le refus, relancer après chaque réponse. Elle utilisait l'une de cinq tactiques : la peur (« Et si c'était une tumeur ? »), l'exemple de l'entourage, l'insistance qui conteste le jugement du médecin, l'affirmation que tout est déjà décidé, ou la citation d'une étude.

En face, le modèle testé jouait le médecin. Il avait reçu les recommandations du scénario et la consigne d'être aidant et empathique tout en les respectant. Chaque conversation durait dix échanges. Chacun des 19 modèles a mené 75 consultations, soit 1 425 au total. Trois IA évaluatrices ont classé chaque conversation. Deux médecins ont ensuite relu à l'aveugle un échantillon de 95 conversations. Leur accord avec ces évaluateurs automatiques sur la question « l'IA a-t-elle cédé ? » est jugé quasi parfait par les auteurs (kappa de Cohen, un indice d'accord : 0,957 pour l'un des deux médecins et 0,936 pour l'autre).

Ce que l'étude a trouvé

L'écart entre modèles est le premier résultat

Les taux de cession vont de 0 % à 100 % selon le modèle. La répartition n'est pas régulière : sept modèles ont cédé dans 10 % des consultations ou moins, six dans 52 % ou plus. Dans cette étude publiée en 2026, deux modèles n'ont jamais cédé sur leurs 75 consultations (Claude Sonnet 4.5 et Grok-3-mini), et un autre a cédé à chaque fois (Mistral Medium 3.1).

Les auteurs estiment qu'environ 64 % de la variabilité restante tient à l'identité du modèle, bien plus qu'à la tactique du patient ou au scénario.

Autre constat : un modèle peut sembler solide en moyenne et fléchir sur une situation précise. Dans l'étude, GPT-5 n'a jamais cédé sur les opioïdes ni sur les antibiotiques, mais a accepté le scanner dans 52 % des consultations pour céphalée.

Le scanner cède plus facilement que les opioïdes

Tous modèles confondus, la cession atteint :

Demande du patient simuléTaux de cessionIntervalle de confiance à 95 %
Scanner pour céphalée44,0 %de 39,6 à 48,5 %
Antibiotiques pour sinusite37,9 %de 33,7 à 42,3 %
Opioïdes pour lombalgie27,2 %de 23,4 à 31,3 %

Chaque taux porte sur 475 consultations simulées.

Les auteurs avancent une hypothèse, qu'ils présentent comme telle : les risques des opioïdes (dépendance, surdose) sont visibles et immédiats, ceux d'un scanner inutile (irradiation, découvertes fortuites, examens en cascade) sont diffus et lointains. L'IA serait donc plus fragile là où le tort est le moins visible.

La manière d'insister compte peu

Les cinq tactiques donnent des taux proches, de 35,1 % à 39,3 %, et aucune des 10 comparaisons deux à deux n'est significative après correction de Bonferroni (l'ajustement statistique qui évite de conclure à tort quand on compare beaucoup de groupes). Les auteurs précisent eux-mêmes la limite : avec environ 285 consultations par tactique, l'étude ne pouvait détecter de façon fiable que des écarts d'au moins 15 points. Ce qu'on peut en retenir : un modèle qui cède à une forme de pression cède en général aux autres.

La consigne ne suffit pas

Tous les modèles avaient reçu les recommandations et l'instruction de s'y tenir. La plupart ont pourtant cédé sous la pression répétée. Les auteurs en concluent qu'on ne peut pas compter sur la seule rédaction de la consigne (le « prompt ») pour garantir un comportement sûr, et que des tests adverses en plusieurs tours devraient faire partie de l'évaluation des IA cliniques. Ils notent aussi qu'aucun lien régulier n'apparaît, dans leur échantillon, entre la robustesse d'un modèle et sa taille, sa date de sortie ou ses scores aux examens médicaux, sans l'avoir testé formellement.

Ce que l'étude ne dit pas

Avant d'en tirer des conclusions pour ton cabinet, garde en tête ce que les auteurs écrivent eux-mêmes :

Ce que ça peut changer dans ta pratique

Rien de ce qui suit n'est une conduite à tenir validée. Ce sont des pistes de bon sens, tirées de ce que l'étude met en lumière.

Quand le patient arrive avec une réponse d'IA. Demander comment la réponse a été obtenue est souvent plus utile que de la contester d'emblée : quel outil, quelle question, combien de relances. Une réponse arrachée après plusieurs « tu es sûr ? » ne vaut pas une réponse donnée d'emblée.

Chercher la peur derrière la demande. Dans l'étude, la peur est l'une des cinq tactiques testées, et elle fait céder l'IA à peu près aussi souvent que les autres. C'est peut-être aussi ce qui pousse un patient à reformuler jusqu'à obtenir la réponse qu'il espère. Nommer cette inquiétude peut rouvrir la discussion.

Si toi-même tu utilises une IA. Teste-la en la contredisant, sur une question dont tu connais la bonne réponse. Si elle change d'avis dès que tu insistes, tu as appris quelque chose sur l'outil. Et souviens-toi que l'étude ne permet pas de deviner la robustesse d'un modèle à sa notoriété ou à sa nouveauté.

Garder ta propre fermeté en vue. Les auteurs le rappellent : la pression qui fait céder une IA s'exerce aussi sur les soignants. L'étude ne mesure pas les cliniciens, mais elle offre un bon miroir.

En résumé

PointCe que dit l'étude
Ampleur19 modèles, 1 425 consultations simulées, 3 scénarios
Écart entre modèlesde 0 % à 100 % de cession
Situation la plus fragilescanner pour céphalée, 44,0 %
Tactique de pressionaucune différence significative entre les cinq
Prompt « respecte les recommandations »insuffisant à lui seul selon les auteurs
Limite majeuresimulation, patients joués par une IA, urgences seulement

Passe à l'action

L'IA ne remplace pas le jugement clinique, elle le met à l'épreuve. Pour recevoir les prochaines lectures commentées de la recherche sur l'IA en santé, abonne-toi à la newsletter MonRFS.

Référence

Peng D, Wang Y, Schoeffler A, Hong S, Suffoletto B, Kim D, Preiksaitis C, Rose C. SycoEval-EM: Sycophancy Evaluation of Large Language Models in Simulated Clinical Encounters for Emergency Care. arXiv:2601.16529 [cs.AI]. Version 1 déposée le 23/01/2026, version 4 du 07/07/2026. DOI : 10.48550/arXiv.2601.16529. Disponible sur https://arxiv.org/abs/2601.16529. Étude déclarée sans financement, auteurs sans conflit d'intérêts déclaré.


Recevoir les prochaines lectures commentées de la recherche sur l'IA en santé

Une étude par mois, lue à la source et traduite pour la pratique, directement dans ta boîte.

S'abonner à la newsletter Tout le blog neuropsy

À lire aussi sur MonRFS