Assistants de code : des gains immédiats, sans bénéfice établi sur l’apprentissage
IA en éducation

Assistants de code : des gains immédiats, sans bénéfice établi sur l’apprentissage

Monde entier
Votre avis sur cet article

Un preprint dont les résultats précis restent à confirmer

Le preprint intitulé Your Programming Students’ Cognition with ChatGPT: Higher Performance, Lower Retention, and Reduced Ownership annonce, dès son titre, une performance supérieure associée à une rétention plus faible et à un moindre sentiment d’appropriation. Cette hypothèse mérite l’attention des enseignants, mais les informations bibliographiques accessibles ne suffisent pas à en vérifier les résultats détaillés.

La notice indique un manuscrit de 17 pages comportant neuf figures et sept tableaux. En revanche, elle ne permet pas de confirmer la taille de l’échantillon, le profil des étudiants, la comparabilité des groupes, la durée de l’intervention, les instruments de mesure ni les écarts statistiques entre conditions. Les chiffres initialement avancés — 89 % de réussite avec ChatGPT, moins de 40 % de rappel après deux jours, 55 participants analysés — ne peuvent donc pas être retenus en l’état. Il en va de même des détails sur les tâches, la version de ChatGPT ou les mesures physiologiques.

Le titre du preprint ne constitue pas, à lui seul, une démonstration. Il est également impossible de savoir, sans examen du manuscrit complet, si les étudiants utilisaient ChatGPT pour produire du code, obtenir des explications, déboguer ou dialoguer avec un tuteur. Or ces pratiques peuvent solliciter des processus cognitifs très différents. Enfin, ce travail n’a pas encore été évalué par les pairs.

Cette réserve ne rend pas le sujet sans objet. D’autres recherches mieux documentées établissent solidement les gains de productivité à court terme. Elles livrent toutefois un tableau beaucoup plus incertain concernant la compréhension, la rétention et l’autonomie.

Des gains immédiats bien documentés

Une expérience menée auprès d’étudiants de troisième et quatrième année en informatique a comparé, selon un plan intra-sujets, la réalisation de tâches de programmation sur du code existant avec et sans GitHub Copilot. Avec l’assistant, les participants ont accompli les tâches 35 % plus vite et progressé 50 % davantage vers une solution. Ils ont aussi consacré 11 % de temps en moins à la saisie manuelle et 12 % de temps en moins aux recherches sur le Web. Toutes ces différences étaient statistiquement significatives au seuil de 5 %.

Une méta-analyse consacrée aux outils d’IA en programmation va dans le même sens. Elle mesure une réduction significative du temps de réalisation des tâches, avec une différence moyenne standardisée de −0,69, ainsi qu’une amélioration des performances, avec une différence moyenne standardisée de 0,86 et un intervalle de confiance à 95 % compris entre 0,36 et 1,37.

Ces résultats étayent une conclusion limitée mais robuste : les assistants génératifs peuvent accélérer la production de code et aider les étudiants à atteindre plus rapidement une solution. Ils ne démontrent pas, en revanche, que les connaissances mobilisées ont été comprises, consolidées ou transférées vers une nouvelle tâche.

Performance et compréhension ne progressent pas nécessairement ensemble

Un rapport de recherche du centre SCALE de Stanford consacré à GitHub Copilot met précisément en évidence ce découplage. Malgré les gains de performance observés, aucune amélioration globale de la compréhension du code n’est détectée : la différence n’est pas statistiquement significative, avec une valeur de p de 0,59.

L’étude distingue en outre plusieurs formes de compréhension. Les gains de performance sont négativement corrélés avec la capacité de rétro-ingénierie du code, avec un coefficient de corrélation de −0,57 et une valeur de p de 0,026. Une association positive apparaît avec la compréhension de la mise en œuvre, mais elle n’atteint pas le seuil conventionnel de significativité statistique : le coefficient est de 0,50 pour une valeur de p de 0,06.

Ces corrélations ne prouvent pas que Copilot dégrade directement la compréhension. Elles indiquent plutôt que la performance visible et certaines formes de compréhension peuvent évoluer séparément, voire en sens opposé. Le type de tâche et la manière d’utiliser l’outil comptent donc autant que le résultat final.

Les synthèses quantitatives appellent la même prudence. La méta-analyse spécifique à la programmation ne trouve aucun avantage statistiquement significatif pour le succès d’apprentissage ou la facilité de compréhension : la différence moyenne standardisée est de 0,16, avec un intervalle de confiance allant de −0,23 à 0,55. Une autre méta-analyse portant plus largement sur l’IA générative obtient un effet global faible et non significatif sur les résultats d’apprentissage, avec un indice de Hedges de 0,14 et une valeur de p de 0,389.

Il serait donc excessif d’affirmer que l’IA générative réduit systématiquement l’apprentissage. La conclusion étayée est plus circonscrite : les gains de vitesse et de performance sont mieux établis que les bénéfices durables sur la compréhension ou la rétention.

Des résultats positifs existent aussi

Un essai contrôlé conduit dans un cours de deep learning apporte un contrepoint important. Les étudiants utilisant un assistant génératif de codage ont obtenu un score conceptuel moyen de 78,63, contre 72,10 dans le groupe contrôle. L’écart est statistiquement significatif et correspond à un effet important, avec un indice d de Cohen de 0,86.

Ce résultat montre qu’un assistant peut accompagner une meilleure maîtrise immédiate de concepts évalués. Il ne suffit toutefois pas à établir une rétention à long terme, car une évaluation conceptuelle réalisée dans le cadre de l’intervention ne mesure pas nécessairement ce qui subsiste plusieurs jours ou plusieurs semaines plus tard.

D’autres travaux rapportent une charge cognitive perçue plus faible, une meilleure utilisabilité et une amélioration déclarée de la compréhension lorsque ChatGPT est intégré à un dispositif pédagogique structuré. Une revue systématique relève également des effets positifs sur les compétences en programmation, la pensée computationnelle, la résolution de problèmes, l’auto-efficacité, la qualité du code et l’engagement. Mais elle signale aussi, dans certains contextes, une moindre profondeur d’apprentissage et une sur-dépendance.

Il faut ici distinguer les performances objectivement mesurées des perceptions étudiantes. Une expérience jugée plus agréable ou plus fluide n’établit pas, à elle seule, une meilleure rétention. Une enquête sur ChatGPT en programmation fait ainsi ressortir une réception généralement positive sans mesurer quantitativement la mémorisation ni le sentiment d’appropriation.

Le risque de sur-dépendance dépasse la programmation

Une étude randomisée menée auprès d’élèves en dernière année du secondaire éclaire la question de l’autonomie. Les participants devaient résoudre des énigmes mathématiques avec des recommandations de ChatGPT, dont la moitié étaient volontairement incorrectes. Les élèves ont adopté ces mauvaises recommandations dans 52,1 % des cas.

Une courte intervention expliquant le fonctionnement de ChatGPT, ses limites et les principes d’un usage responsable n’a pas significativement réduit cette sur-dépendance. Elle a même conduit les élèves concernés à rejeter plus souvent des recommandations correctes, faisant apparaître un risque inverse de méfiance mal calibrée.

Cette étude porte sur des mathématiques au secondaire, non sur l’apprentissage de la programmation dans le supérieur. Elle ne doit donc pas être transposée mécaniquement. Elle montre néanmoins qu’une sensibilisation textuelle brève ne suffit pas à former un jugement fiable face aux réponses d’un modèle génératif.

Dans l’expérience consacrée à Copilot, les entretiens de sortie vont dans une direction compatible : certains étudiants disent ne pas comprendre comment ni pourquoi les suggestions fonctionnent. Les usages granulaires — vérifier, modifier et adapter les propositions — sont associés à de meilleurs résultats que l’acceptation en bloc. Cette observation reste toutefois liée au contexte étudié et ne permet pas d’en faire une règle causale universelle.

Ce que les équipes pédagogiques peuvent raisonnablement en tirer

Les données disponibles justifient d’abord de séparer l’évaluation du produit et celle de la compréhension. Un programme fonctionnel peut être complété par une explication orale, une modification sans assistant, une analyse d’erreur ou une épreuve différée. Ces modalités ne sont pas encore validées comme remèdes universels, mais elles permettent de mesurer autre chose que la seule capacité à livrer du code.

Il paraît également pertinent d’enseigner des usages vérifiables : décomposer une demande, expliquer une suggestion, tester le code, repérer ses hypothèses et justifier chaque modification. Les résultats sur Copilot suggèrent que cette granularité est préférable à l’acceptation passive, sans établir encore quelle méthode pédagogique produit les meilleurs effets à long terme.

Enfin, une charte ou un module ponctuel de littératie ne doit pas être présenté comme une solution suffisante. La calibration de la confiance exige vraisemblablement des exercices répétés confrontant les étudiants à des réponses correctes, plausibles mais fausses, puis à un retour explicite sur leur jugement.

L’état de la recherche est donc asymétrique. Les assistants de code améliorent clairement la productivité immédiate dans plusieurs études. Leurs effets sur la compréhension profonde, la rétention, le transfert, l’autonomie et le sentiment d’appropriation restent hétérogènes ou insuffisamment documentés. C’est cette incertitude, plutôt qu’un chiffre spectaculaire encore invérifiable, qui doit guider les décisions pédagogiques.

Sources citées

Corpus de veille

Fils consultés pour choisir l'angle. Ils documentent la matière première, pas des citations du texte.

Discussion

Posez vos questions et partagez votre point de vue. Matania, l'assistante de recherche et de vérification des faits, lit les commentaires et y répond dès qu'elle peut apporter des sources fiables ou des précisions. Les liens ne sont pas autorisés : citez vos sources par leur nom.

Chargement de la discussion…