Réussir un exercice avec ChatGPT ne signifie pas nécessairement apprendre à programmer. Un preprint de Christian Bergh et de ses collègues illustre cet écart : les étudiants assistés obtiennent de meilleurs résultats pendant une tâche de codage, mais de moins bons scores à des tests de rappel. Ce résultat mérite l’attention des enseignants. Il ne suffit toutefois pas à établir que l’IA nuit durablement à l’apprentissage de la programmation.
Une meilleure performance, un rappel plus faible
Dans l’expérience décrite par Bergh et ses collègues, des étudiants réalisent des tâches de programmation avec ChatGPT ou sans IA. Le score moyen de codage atteint 89 % dans le groupe ChatGPT, contre 69 % dans l’autre groupe. Le contraste s’inverse pour le rappel : 41 % contre 53 % lors du premier test, puis 39 % contre 52 % après 48 heures.
L’écart de rappel est donc présent dès la première mesure. Les auteurs ne constatent pas de différence statistiquement significative entre les groupes dans la perte de rappel au cours des 48 heures. Cela ne démontre ni que les deux groupes oublient exactement au même rythme, ni que ChatGPT a empêché les étudiants d’encoder l’information pendant l’exercice. Ce sont des interprétations possibles, pas des mécanismes établis par ces chiffres.
Les étudiants assistés déclarent aussi s’attribuer, en moyenne, 45 % du code soumis, contre 81 % dans le groupe sans IA. Cette mesure décrit un sentiment d’appropriation, non une vérification indépendante de la part de code effectivement écrite par chacun. Enfin, l’augmentation de l’effort mental déclaré d’une tâche à l’autre est plus faible avec ChatGPT ; la différence atteint le seuil de significativité indiqué par les auteurs après ajustement statistique (p = 0,047). Il s’agit d’une mesure déclarative de l’effort, pas d’une démonstration que toute charge cognitive serait bénéfique ou que sa réduction serait forcément nuisible.
Ce travail est un preprint non évalué par les pairs. Le dossier disponible ne confirme ni la taille exacte de l’échantillon, ni la procédure de répartition des étudiants entre les groupes. Il ne permet pas non plus d’établir précisément ce que le test de rappel mesurait : mémorisation de procédures, compréhension de concepts ou capacité à programmer sans assistance. Les résultats portent sur une tâche et un délai de 48 heures, non sur l’autonomie acquise au terme d’un enseignement. Les écarts de performance et de rappel sont marquants, mais leurs intervalles de confiance et leurs tailles d’effet ne figurent pas dans les éléments disponibles.
Le contre-exemple utile de Codex
Une autre étude, également diffusée sous forme de preprint, a observé des novices utilisant Codex pour des exercices en Scratch. Pendant la phase d’entraînement, le groupe ayant accès au générateur de code présente un taux de complétion des tâches 1,15 fois supérieur à celui du groupe contrôle. Au test réalisé une semaine plus tard, l’étude ne trouve pas de différence statistiquement significative globale de performance entre les groupes. Elle relève toutefois un bénéfice significatif chez les étudiants qui possédaient déjà un meilleur niveau en Scratch avant l’expérience.
Ce résultat empêche de transformer l’étude sur ChatGPT en règle générale selon laquelle l’assistance dégraderait toujours la rétention. Il appelle aussi une précaution inverse : une différence non significative ne prouve pas, à elle seule, que les deux modalités d’apprentissage sont équivalentes. Les deux études concernent des outils, des tâches et des échéances différents. Le niveau initial des étudiants pourrait également compter : dans l’expérience avec Codex, ceux qui disposaient déjà de davantage de connaissances semblent mieux tirer parti de l’aide.
Gagner du temps n’est pas mesurer l’apprentissage
Un troisième preprint porte sur GitHub Copilot et des étudiants de troisième et quatrième année en informatique. Pour des tâches consistant à modifier du code existant, les auteurs rapportent un temps de réalisation réduit de 35 % et 50 % de progrès supplémentaires vers la solution avec Copilot. Les étudiants passent également 11 % de temps en moins à écrire manuellement du code et 12 % de temps en moins à effectuer des recherches sur le Web.
Ces observations documentent une aide pendant l’activité. Elles ne tranchent pas la question de ce que les étudiants sauront refaire seuls plus tard : l’étude ne rapporte pas de test formel de rétention à moyen terme. Les auteurs proposent deux lectures compatibles. L’outil peut alléger des opérations comme le rappel de syntaxe ou la production de code répétitif. Il peut aussi prendre en charge une partie du travail qui aurait amené l’étudiant à examiner et comprendre le programme. Sans mesure ultérieure de compréhension ou d’autonomie, le gain de vitesse ne permet pas de départager ces possibilités.
L’encadrement pédagogique change la question
Une étude évaluée par les pairs apporte un autre éclairage. Elle compare, dans un environnement d’apprentissage autorégulé, des indices de codage fournis par un assistant intelligent à un tutorat humain. Le groupe bénéficiant de l’assistant obtient de meilleurs scores en codage, tandis que les gains de compréhension conceptuelle sont comparables entre les groupes. Les auteurs rapportent également une réduction de certaines composantes de la charge cognitive, une hausse de la charge liée à la construction de connaissances et une amélioration d’indicateurs d’autorégulation métacognitive.
Ce résultat ne démontre pas que tout indice généré par IA serait préférable à une solution complète : l’étude compare des dispositifs d’accompagnement précis, pas toutes les façons d’utiliser un chatbot. Elle montre néanmoins qu’une assistance intégrée à des objectifs et à des activités d’autorégulation peut aller de pair avec de bonnes performances en code sans perte constatée de compréhension conceptuelle dans cette comparaison.
Une revue systématique évaluée par les pairs souligne la même dépendance au contexte. Les assistants de code peuvent réduire le temps de débogage et certaines difficultés accessoires. Dans des situations où l’étudiant passe directement à la solution sans raisonner ni vérifier, la rétention et la compréhension des concepts fondamentaux peuvent, au contraire, être limitées. La revue ne conclut pas à un effet uniforme de l’IA sur l’apprentissage durable : le type de tâche et la conception pédagogique importent.
Une étude sur la collaboration entre étudiants et assistants de code rapporte, de son côté, des associations entre apprentissage perçu, productivité, confiance et existence d’un cadre de bonnes pratiques. Ces données recueillies auprès d’étudiants ne démontrent pas qu’instaurer un tel cadre causerait, à lui seul, une hausse de l’apprentissage. Elles invitent plutôt à examiner comment les règles d’usage s’articulent avec ce que les étudiants font réellement avec l’outil.
Une sensibilisation courte ne règle pas la confiance
L’encadrement ne se résume pas à prévenir que ChatGPT peut se tromper. Un essai randomisé mené auprès de lycéens estoniens, lui aussi disponible en preprint, étudie l’acceptation ou le rejet de recommandations de ChatGPT lors de tâches scolaires. Les participants adoptent une recommandation incorrecte dans 52,1 % des essais. Une brève intervention textuelle de littératie IA ne réduit pas significativement cette tendance. Elle s’accompagne en revanche d’une augmentation du rejet de recommandations correctes.
Ce résultat porte sur le jugement face aux suggestions de ChatGPT, pas sur la rétention en programmation. Il suggère qu’une sensibilisation ponctuelle ne suffit pas nécessairement à ajuster la confiance : apprendre à refuser une mauvaise réponse sans écarter les bonnes demandes d’aide suppose un travail plus précis que la seule consigne de se méfier.
Que faire en cours de programmation ?
Pour les équipes enseignantes, la première précaution consiste à ne pas confondre le code rendu avec la compétence acquise. Demander à un étudiant d’expliquer son programme, de le modifier sans assistance ou de résoudre plus tard une tâche voisine permettrait d’évaluer des acquis que le seul résultat produit avec IA ne révèle pas. Ce sont des choix d’évaluation proposés à partir des limites des études, non des méthodes dont ces travaux auraient démontré la supériorité.
Il est également raisonnable d’expérimenter des usages qui obligent à examiner les propositions de l’outil : demander une piste plutôt qu’une solution complète, justifier une modification suggérée ou signaler les passages repris de l’IA. L’étude sur les indices de code soutient l’intérêt d’un accompagnement structuré ; elle ne garantit pas qu’une règle unique conviendra à tous les niveaux et à toutes les tâches.
L’état des connaissances impose ainsi deux constats distincts. Oui, l’IA générative peut améliorer nettement la performance pendant un exercice de programmation. Non, cette amélioration ne constitue pas, à elle seule, une preuve d’apprentissage durable. Le rappel plus faible observé dans un preprint est un signal à étudier, tandis que d’autres travaux ne constatent pas de baisse globale de rétention ou montrent des résultats favorables dans des dispositifs encadrés. La question décisive, pour l’enseignement, reste ce que l’étudiant comprend, vérifie et peut refaire lorsque l’assistant n’est plus là.




Discussion
Posez vos questions et partagez votre point de vue. Matania, l'assistante de recherche et de vérification des faits, lit les commentaires et y répond dès qu'elle peut apporter des sources fiables ou des précisions. Les liens ne sont pas autorisés : citez vos sources par leur nom.