Aller au contenu

Chaque position rattachée à son auteur, son ouvrage et son année.

Les Voies éducatives Courants & preuves

Comment se lit une étude en éducation : échantillon, groupe témoin, taille d’effet

Une crise de colère dure une minute chez un chercheur et douze chez un autre. Ce que change un groupe témoin, ce que vaut un d de 0,26, pourquoi certains résultats rétrécissent quand on les refait, et à quel endroit précis un modérateur retourne une conclusion.

  • Publié le 27 septembre 2026
  • 15 min de lecture
  • 9 sections
  • Ce que dit la recherche

Une minute. Douze minutes. Les deux chiffres décrivent la durée d’une crise de colère chez un enfant d’âge préscolaire, les deux sont publiés dans des revues à comité de lecture, et aucun des deux n’est faux.

L’écart ne vient pas des enfants. Il vient de l’appareil qui a servi à mesurer.

Un rapport de un à douze, produit par deux instruments

Michael Potegal, Michael Kosorok et Richard Davidson ont fait raconter des crises par des parents, puis les ont découpées en tranches de trente secondes pour le Journal of Developmental and Behavioral Pediatrics en 2003, sur 335 enfants de 18 à 60 mois. Valeur la plus fréquente : entre trente secondes et une minute. Trois épisodes sur quatre s’arrêtent avant cinq minutes.

Cinq ans plus tard, Andy Belden, Nicholas Thomson et Joan Luby interrogent les responsables de 279 enfants de 3 à 6 ans au moyen d’un entretien diagnostique standardisé, la Preschool-Age Psychiatric Assessment, et publient dans le Journal of Pediatrics. Chez les enfants sans trouble constitué, la durée moyenne rapportée avoisine les douze minutes.

Un codage par tranches reconstitue un déroulement. Une question posée à un adulte, « combien de temps durent-elles, d’habitude ? », recueille une estimation, et une estimation de durée sous tension ne se comporte pas comme un chronomètre. Le même mot recouvre donc deux grandeurs qui ne se superposent pas.

Avant de demander si un chiffre est significatif, il vaut donc mieux savoir avec quoi il a été fabriqué, sur quel âge, et à quel moment. La durée réelle des crises a des conséquences directes sur deux doctrines éducatives qui se disputent l’effet d’une conduite adulte tenue pendant l’épisode.

Le groupe témoin répond à une question qu’on oublie de poser : par rapport à quoi ?

En 2001, le groupe scolaire Concorde de Mons-en-Barœul, en réseau d’éducation prioritaire près de Lille, passe entièrement en pédagogie Freinet. L’institution exige un suivi scientifique. Une équipe pluridisciplinaire dirigée par Yves Reuter observe l’école de la maternelle au CM2 pendant cinq ans, et publie en 2007 Une école Freinet chez L’Harmattan.

C’est une monographie longitudinale, sur un site unique, avec une équipe volontaire, et sans tirage au sort. Les comparaisons se font avec des écoles voisines et des moyennes nationales, pas avec un groupe constitué pour l’occasion.

Ce devis établit ce qui s’est passé dans cette école-là. Il ne permet pas de séparer la pédagogie de l’engagement d’une équipe qui l’a réclamée, ni du fait d’être observée pendant cinq ans par des universitaires, ni du quartier. Les auteurs l’écrivent eux-mêmes : le dispositif fonctionne comme un système, et rien ne garantit sa transposition. Le détail de cette recherche est traité ailleurs sur ce site.

Un groupe témoin sert à cela, et à rien d’autre : fournir ce qui se serait produit sans le dispositif. Sa qualité se juge sur une seule chose, la ressemblance des deux groupes avant que l’un reçoive quelque chose que l’autre ne reçoit pas.

Deux synthèses parues la même année sur Montessori montrent ce que cette exigence coûte. La revue de la Campbell Collaboration, signée Randolph et neuf coauteurs en 2023, réclame un devis expérimental ou quasi expérimental, un groupe témoin et une équivalence démontrée avant l’intervention : 2 012 références examinées, 32 retenues. La méta-analyse de l’université de Lorraine, la même année, accepte les devis quasi expérimentaux sans cette condition et retient 33 études. Les magnitudes rapportées ne se recoupent pas, et le désaccord porte sur les critères d’entrée, pas sur les données.

Personne ne peut assigner un enfant à un parent

L’essai contrôlé randomisé occupe le sommet de toutes les échelles de preuve. La randomisation consiste à décider par tirage au sort qui reçoit l’intervention, ce qui répartit au hasard tout ce que le chercheur ignore, y compris ce qu’il n’a pas pensé à mesurer.

Dans une grande partie de ce champ, elle est impossible, et les auteurs le disent explicitement. Elizabeth Gershoff et Andrew Grogan-Kaylor, dont la méta-analyse de 2016 sur la fessée réunit 111 tailles d’effet sur 160 927 enfants, écrivent qu’on ne peut pas assigner au hasard des enfants à des parents plus ou moins enclins à frapper, ni des parents au fait de le faire. Soixante-douze pour cent des travaux réunis sont corrélationnels ou rétrospectifs. Ce n’est pas une négligence de méthode : c’est la limite de l’objet.

Ailleurs dans le même champ, l’assignation est parfaitement praticable. Paulien Leijten et ses collègues ont agrégé en 2019, pour le Journal of the American Academy of Child & Adolescent Psychiatry, 154 essais contrôlés randomisés et 398 tailles d’effet sur des programmes parentaux. On peut tirer au sort les familles qui entreront dans un programme et celles qui resteront sur liste d’attente. On ne peut pas tirer au sort une manière d’être parent.

La ligne de partage ne sépare pas les chercheurs rigoureux des autres. Elle sépare ce qui s’assigne de ce qui ne s’assigne pas, et cette frontière traverse la rubrique entière.

« Corrélation n’est pas causalité » est exact et sert souvent à ne rien dire. La question utile est celle du sens de lecture. Nancy Eisenberg l’a posée en 1996 au modèle de Gottman, dans le même numéro du Journal of Family Psychology : un enfant très réactif émotionnellement n’appelle pas les mêmes gestes qu’un enfant placide, et la position d’un parent devant les émotions peut donc être en partie l’effet du tempérament de son enfant. Une association solide reste compatible avec les deux sens, et avec un troisième facteur qui produirait les deux.

Une famille qui choisit une école n’a pas été tirée au sort

Le biais de sélection est le nom de ce qui reste quand les groupes se sont formés seuls.

Une famille qui inscrit son enfant dans une école Montessori a cherché l’établissement, arbitré un budget et un trajet, souvent lu sur la pédagogie avant la rentrée. Elle diffère des autres familles avant que l’enfant pose un pied dans la classe. Une comparaison qui ne neutralise pas cet écart additionne le choix des parents et le dispositif, sans pouvoir dire dans quelle proportion.

Le soupçon n’est pas un verdict pour autant, et il se teste. Deux procédés existent : reconstituer après coup des groupes équivalents sur les caractéristiques mesurées, ou trouver une situation où l’entrée dans le groupe a été décidée par autre chose que par les intéressés.

Une poignée de travaux prennent la seconde voie, en exploitant les loteries d’admission des écoles Montessori publiques américaines, où la demande dépasse les places disponibles. Le plus large a paru le 28 octobre 2025 dans les PNAS : 588 enfants entrés dans les loteries de 24 écoles, 242 tirés au sort contre 346 non retenus, suivis de 3 ans à la fin de la maternelle. Le tirage au sort n’est pas organisé par les chercheurs, il préexiste, et c’est cette contrainte administrative qui rend l’expérience possible. Le même obstacle vaut pour Sudbury et pour Waldorf.

Une taille d’effet est un écart exprimé en fractions d’écart-type

Le d de Cohen et le g de Hedges répondent à la même question : de combien les deux distributions se sont-elles décalées, en unités de dispersion. Les repères usuels, hérités de Cohen, situent 0,20 en petit, 0,50 en moyen, 0,80 en grand. Ce sont des conventions par défaut, pas des seuils naturels, et elles se discutent selon ce qui est mesuré.

59e centile

Position moyenne d’un élève Montessori dans la distribution des élèves d’école ordinaire, pour le composite académique de la revue Campbell, g = 0,24. Autrement dit : les deux distributions se chevauchent largement, et la plupart des élèves des deux groupes restent indiscernables les uns des autres.

Le tableau qui suit rassemble des résultats déjà cités sur ce site. Ils sont tous « établis ». Ils ne se comparent pas entre eux.

RésultatIndiceCe qui est comparéDevis
Fessée et issues défavorables, 111 tailles d’effet (Gershoff, 2016)d = 0,33enfants plus ou moins frappés, sans assignationcorrélationnel à 72 %
Montessori, capacité académique générale, 32 études (Randolph, 2023)g = 0,26élèves Montessori et élèves d’école ordinaireéquivalence exigée avant
Attachement précoce et compétence sociale avec les pairs (Groh, 2017)r = 0,19variation continue dans un même groupelongitudinal corrélationnel
Récompense verbale chez l’enfant (Deci, Koestner et Ryan, 1999)d = 0,11condition récompensée et condition témoinexpérimental, en laboratoire
Méthode Gordon, comportement des parents (Cedar et Levant, 1990)d = 0,37parents formés et parents non formés26 études agrégées
Méthode Gordon, comportement des enfants, à la fin du programmed = 0,03les mêmes famillesidem

Le r de la troisième ligne n’est pas un d : c’est un coefficient de corrélation, borné entre −1 et 1, et le convertir demande une opération que la vulgarisation escamote presque toujours. Quant aux deux dernières lignes, elles viennent du même article : la méthode Gordon change les parents tout de suite et les enfants pas encore, l’effet sur l’enfant remontant à 0,53 au suivi. Un article ne produit pas un résultat. Il en produit une série, et celui qui circule a été choisi par quelqu’un.

La revue Campbell ajoute une information que l’habitude de lire les chiffres seuls fait manquer. Son effet le plus fort, l’expérience vécue à l’école, g = 0,41, est assorti d’une certitude jugée basse ; son effet le plus faible en mathématiques, g = 0,22, d’une certitude élevée. Une magnitude et un degré de confiance sont deux grandeurs indépendantes, et elles varient souvent en sens inverse.

Un résultat non significatif n’est pas un résultat nul

Deci, Koestner et Ryan trouvent en 1999, sur 128 études, que la récompense verbale rehausse la motivation intrinsèque : d = 0,33 en libre choix. C’est la nuance que les lecteurs attentifs opposent à la formule « la récompense détruit la motivation », elle-même tirée du même article.

Ce résultat était hétérogène. Deci et ses coauteurs ont donc cherché ce qui le faisait varier d’une étude à l’autre, et ils ont trouvé l’âge.

PopulationRécompense verbaleRécompense tangible
Étudiants (14 études)d = 0,43d = −0,27 (38 études)
Enfants (7 études)d = 0,11, IC −0,11 à 0,34d = −0,39 (57 études)

L’intervalle de confiance de la case décisive va de −0,11 à 0,34. Il contient zéro, ce qui interdit d’affirmer un effet, et il contient aussi 0,30, ce qui interdit d’affirmer son absence. Sept études ne tranchent pas. Écrire « le compliment n’a aucun effet sur les enfants » serait aussi infidèle que d’écrire l’inverse.

Sur le même tableau, les récompenses matérielles sont plus délétères chez les enfants que chez les étudiants. L’article leur consacre une section entière, sous le titre « Age Effects ».

Trois énoncés circulent donc à propos du même article, et les deux premiers sont les plus répandus. La récompense détruit la motivation. Non, mais le retour verbal, lui, est bénéfique. Ni l’un ni l’autre ne vaut pour un public de parents d’enfants. Une variable modératrice fait deux résultats là où le lecteur en attendait un, et les deux moitiés peuvent pointer dans des directions opposées. Ce qu’une méta-analyse établit vraiment revient en détail sur ce dossier et sur celui de la fessée.

Refaire une étude produit deux choses différentes, qu’on appelle du même mot

En 1972, Silvia Bell et Mary Ainsworth publient dans Child Development un résultat contre-intuitif pour l’époque : les nourrissons dont la mère répondait le plus vite aux pleurs pleuraient moins à neuf-douze mois. Le résultat est devenu un pilier de la littérature parentale francophone.

Il n’a pas été laissé tranquille. Jacob Gewirtz et Elizabeth Boyd publient dès 1977, dans la même revue, une critique méthodologique frontale, à laquelle Ainsworth et Bell répondent huit pages plus loin dans le même numéro. Vingt-huit ans après Baltimore, Marinus van IJzendoorn et Frans Hubbard reprennent le protocole à Leyde sur cinquante familles, avec plus de vingt heures d’observation à domicile par famille, et publient dans Attachment & Human Development. Les données descriptives ressemblent à celles de 1972. Le lien central, lui, ne réapparaît pas : les pleurs à domicile ne distinguent plus les attachements sécurisés des insécurisés. Les auteurs parlent d’un échec de réplication. La scène du bébé qu’on pose se lit différemment selon qu’on connaît ou non cet enchaînement.

L’autre cas ne porte pas le même nom, et le vocabulaire courant les confond. En 1995, van IJzendoorn établit la transmission de l’attachement d’une génération à l’autre à r = 0,47, sur dix-neuf échantillons et 854 dyades. Vingt et un ans plus tard, Verhage et ses coauteurs refont le calcul sur 95 échantillons dans Psychological Bulletin : l’association tient, et elle tombe à 0,31.

Le premier cas est un résultat qui ne revient pas. Le second est un résultat qui revient plus petit, ce qui arrive à peu près systématiquement quand les échantillons grossissent et que les travaux qui ne trouvent rien finissent par être publiés. Un chiffre isolé, obtenu une fois, sur un petit effectif, se lit comme une borne haute. Cette histoire de chiffres qui rétrécissent traverse ce que Bowlby et Ainsworth ont établi.

On n’interroge que ceux qui ont répondu

Reste le biais qui échappe aux deux précédents, parce qu’il agit sur la liste des participants et non sur leur répartition.

L’enquête la plus citée sur les adultes issus de l’instruction non scolaire porte sur soixante-quinze personnes, âge médian vingt-quatre ans, 77 % de femmes, recrutées par un appel diffusé sur des blogs dont celui que Peter Gray tient sur Psychology Today. Quatre-vingt-trois pour cent avaient accédé à une forme d’enseignement supérieur.

Ceux qui ont quitté le dispositif ne lisent pas ces blogs. Ceux dont le parcours s’est mal terminé répondent moins volontiers à un questionnaire sur leur parcours. Le recenseur Robert Lyon a listé publiquement quatre défauts sur cette enquête, échantillon non aléatoire, biais de survie, déséquilibre démographique, absence de groupe de comparaison, et les auteurs en reconnaissent une partie. Le chiffre de 83 % est exact. Il décrit les répondants, pas les anciens élèves. Ce que valent les études sur les enfants non scolarisés tient largement à ce point.

Les témoignages qui remplissent les brochures d’école et les rubriques d’avis subissent exactement le même sort. Il n’y a là rien de malhonnête. C’est mécanique : les satisfaits restent, et ce sont eux qu’on trouve.

La grille ne s’applique pas à la plupart des pages qu’un parent lit

Un lecteur qui reprendrait ces questions devant les ouvrages les plus vendus du rayon éducation trouverait, la plupart du temps, qu’il n’y a rien à examiner. Pas d’échantillon, pas de groupe témoin, pas de taille d’effet : pas d’étude. Jane Nelsen, Adele Faber et Elaine Mazlish, Isabelle Filliozat, William Sears, Gordon Neufeld écrivent des doctrines, et une doctrine ne se présente pas comme une mesure.

Non évalué ne veut pas dire réfuté. Une méthode sans essai contrôlé n’est pas fausse, elle est non testée, ce qui est un autre état et se dit autrement. Le tri complet des courants par ce qu’ils ont comme données propres tient une page entière de cette rubrique.

L’ordre des opérations, lui, se renverse rarement. Quand une page annonce que « les études montrent », la question n’est pas de savoir si l’affirmation est vraie : c’est de savoir combien d’enfants, de quel âge, comparés à qui, mesurés avec quoi, et par qui le travail a été payé. Cette dernière question se pose sur tous les courants. Aucune ne demande de savoir compter.

Potegal M., Kosorok M. R. et Davidson R. J., « Temper tantrums in young children : 2. Tantrum duration and temporal organization », Journal of Developmental and Behavioral Pediatrics, 2003, 24(3), p. 148-154.

Belden A. C., Thomson N. R. et Luby J. L., « Temper tantrums in healthy versus depressed and disruptive preschoolers », Journal of Pediatrics, 2008, 152(1), p. 117-122.

Reuter Y. (dir.), Une école Freinet. Fonctionnements et effets d’une pédagogie alternative en milieu populaire, L’Harmattan, 2007.

Gershoff E. T. et Grogan-Kaylor A., « Spanking and Child Outcomes : Old Controversies and New Meta-Analyses », Journal of Family Psychology, 2016, 30(4), p. 453-469, PubMed 27055181.

Leijten P., Gardner F., Melendez-Torres G. J. et al., « Meta-Analyses : Key Parenting Program Components for Disruptive Child Behavior », Journal of the American Academy of Child & Adolescent Psychiatry, 2019, 58(2), p. 180-190.

Randolph J. J., Bryson A., Menon L. et al., « Montessori education’s impact on academic and nonacademic outcomes : A systematic review », Campbell Systematic Reviews, 2023, 19(3), e1330, DOI 10.1002/cl2.1330.

Demangeon A., Claudel-Valentin S., Aubry A. et Tazouti Y., Contemporary Educational Psychology, 2023 (33 études, 268 tailles d’effet).

Deci E. L., Koestner R. et Ryan R. M., « A Meta-Analytic Review of Experiments Examining the Effects of Extrinsic Rewards on Intrinsic Motivation », Psychological Bulletin, novembre 1999, 125(6), p. 627-668.

Cedar B. et Levant R. F., « A meta-analysis of the effects of Parent Effectiveness Training », The American Journal of Family Therapy, 1990, 18, p. 373-384.

Groh A. M. et al., « Attachment in the Early Life Course : Meta-Analytic Evidence for Its Role in Socioemotional Development », Child Development Perspectives, 2017.

Bell S. M. et Ainsworth M. D. S., « Infant crying and maternal responsiveness », Child Development, 1972, 43, p. 1171-1190.

Gewirtz J. L. et Boyd E. F., « Does maternal responding imply reduced infant crying ? A critique of the 1972 Bell and Ainsworth report », Child Development, 1977, 48(4), p. 1200-1207 ; réponse d’Ainsworth et Bell, même numéro, p. 1208-1216.

van IJzendoorn M. H. et Hubbard F. O. A., « Are infant crying and maternal responsiveness during the first year related to infant-mother attachment at 15 months ? », Attachment & Human Development, 2000, 2(3), p. 371-391.

Verhage M. L., Schuengel C., Madigan S. et al., « Narrowing the Transmission Gap : A Synthesis of Three Decades of Research on Intergenerational Transmission of Attachment », Psychological Bulletin, 2016, 142(4), p. 337-366.

Eisenberg N., commentaire à Gottman J. M., Katz L. F. et Hooven C., Journal of Family Psychology, 1996, 10(3).

Lyon R., recension de Gray et Riley 2015, Homeschooling Research Notes / International Center for Home Education Research, 19 mars 2018.

Cohen J., Statistical Power Analysis for the Behavioral Sciences, 2e éd., Lawrence Erlbaum, 1988.

Toute la rubrique « Ce que dit la recherche »

Ce qui est étayé, ce qui ne l'est pas, et comment faire la différence.

Voir la rubrique

4 pages publiées