TL;DR

Changement de politique : GitHub utilisera les données d’interaction Copilot des utilisateurs Free, Pro et Pro+ pour entraîner les modèles d’IA par défaut à partir du 24 avril. Portée des données : les données collectées incluent des extraits de code, des suggestions acceptées, des modèles de navigation et même des données de session active provenant de référentiels privés. Exemption Entreprise : les comptes de niveau Business et Enterprise sont entièrement exclus du programme de formation. Désinscription disponible : les développeurs peuvent désactiver la collecte de données via la section Confidentialité des paramètres de leur compte Copilot sans perdre l’accès à aucune fonctionnalité.

GitHub, propriété de Microsoft, commencera à utiliser les données d’interaction des utilisateurs de Copilot Free, Pro et Pro+ pour entraîner ses modèles d’IA à partir du 24 avril, le paramètre étant activé par défaut à moins que les développeurs ne se désengagent activement.

En vertu de la nouvelle politique, annoncée dans une mise à jour de la politique de données de Copilot par le directeur des produits Mario Rodriguez, les utilisateurs de Copilot de niveau individuel sont automatiquement inscrits à la collecte de données pour la formation des modèles. Les comptes de niveau Business et Enterprise restent exemptés du programme, créant un modèle de confidentialité à deux niveaux dans lequel les développeurs individuels supportent le fardeau de la contribution des données à moins qu’ils n’agissent.

Copilot est devenu un assistant de codage d’IA largement adopté et utilisé par des millions de développeurs de logiciels à travers l’industrie. Plutôt que d’exiger un consentement explicite, GitHub place les utilisateurs individuels dans un cadre de désinscription, ce qui impose aux développeurs la responsabilité de protéger leurs propres données.

Ce que Copilot collectera

Données d’interaction décrit dans la politique d’utilisation des données d’interaction couvre un large éventail d’activités de développement. Selon le billet de blog, les types de données collectées incluent des extraits de code, les sorties acceptées ou modifiées par les utilisateurs, le contexte du code entourant la position du curseur, les commentaires et la documentation, les noms de fichiers, la structure du référentiel et les modèles de navigation, les interactions avec les fonctionnalités de Copilot telles que le chat et les suggestions en ligne, et les commentaires sur les suggestions telles que les notes positives ou négatives.

La collection s’étend bien au-delà des lignes de code individuelles : les modèles de navigation révèlent comment les développeurs organisent les projets, tandis que les suggestions acceptées et rejetées exposent les préférences de codage et les habitudes de prise de décision. Les données collectées peuvent également être partagées avec des sociétés affiliées, notamment Microsoft, mais ne parviendront pas à des fournisseurs de modèles d’IA tiers ou à des fournisseurs de services indépendants.

Une nuance clé concerne les référentiels privés. Alors que GitHub indique que le code stocké « au repos » dans des référentiels privés ne sera pas utilisé pour la formation, le code des dépôts privés utilisé comme données d’interaction Copilot relève de règles différentes. En termes simples, Copilot traite le code des référentiels privés chaque fois qu’il est activement utilisé, et ces données de session pourraient alimenter le pipeline de formation à moins que l’utilisateur ne se soit désisté.

Rodriguez a abordé la distinction directement dans le billet de blog :

“Nous utilisons délibérément l’expression”au repos”car Copilot traite le code des référentiels privés lorsque vous utilisez activement Copilot. Ces données d’interaction sont nécessaires pour exécuter le service et pourraient être utilisées pour la formation du modèle, sauf si vous le souhaitez.”

Mario Rodriguez, directeur produit chez GitHub (via Le blog GitHub)

Pour les développeurs travaillant sur du code propriétaire utilisant des plans Copilot individuels, la distinction entre les données stockées et les données de session active a des implications matérielles. Le code qui passe par Copilot lors d’une session de codage pourrait se retrouver dans le pipeline de formation, même si le référentiel sous-jacent est privé.

Mélanger du code propriétaire dans des données de formation d’IA pourrait potentiellement créer des conflits de licence ou contaminer des projets open source si les sorties du modèle reproduisent des modèles protégés. Les utilisateurs qui ont précédemment refusé la collecte de données pour l’amélioration du produit verront leur préférence conservée et n’auront pas besoin de prendre de mesures supplémentaires.

Les arguments de GitHub en faveur du changement

GitHub justifie le changement de politique en soulignant les résultats des tests internes. Selon Rodriguez, l’intégration des données d’interaction des employés de Microsoft au cours de l’année écoulée a apporté des améliorations significatives, notamment une augmentation des taux d’acceptation du code dans plusieurs langages de programmation.

En participant au programme, GitHub affirme que les utilisateurs aideront ses modèles à mieux comprendre les flux de travail de développement, à fournir des suggestions de modèles de code plus précises et plus sécurisées et à améliorer leur capacité à détecter les bogues potentiels avant qu’ils n’atteignent la production. Les données d’interaction des employés de GitHub seront également ajoutées au pool de formation à l’avenir, élargissant pour la première fois la collecte de données au-delà du personnel de Microsoft.

Les modèles initiaux de Copilot ont été construits à l’aide d’un mélange de données accessibles au public et d’échantillons de code fabriqués à la main, une approche qui s’est avérée insuffisante à mesure que l’outil s’est étendu au-delà de ses premiers utilisateurs. Rodriguez a fait valoir que les améliorations observées avec les données des employés de Microsoft indiquent que la formation sur les données d’interaction du monde réel peut améliorer les performances du modèle pour un éventail plus diversifié de cas d’utilisation et de flux de travail des développeurs.

Il a décrit l’expansion comme des « pratiques industrielles établies » qui profiteront à un large éventail de développeurs. GitHub affirme que le changement découle de gains mesurables observés lors des tests internes, bien qu’il n’ait pas publié de références spécifiques ni de chiffres de taux d’acceptation pour justifier ces améliorations.

Un modèle de controverses sur les données

La dernière politique de GitHub arrive dans un contexte de différends récurrents sur la relation de Copilot avec les données des développeurs. Lorsque GitHub Copilot a été lancé pour la première fois en 2021, il a suscité des réactions négatives de la part des défenseurs de l’open source concernant son utilisation de données de formation accessibles au public.

En novembre 2022, Copilot a fait face à un procès pour son utilisation de données de formation open source, Microsoft, OpenAI et GitHub demandant plus tard le rejet de l’affaire. En mai 2023, un tribunal a refusé le rejet de deux demandes, maintenant le litige en vie.

Un contraste notable émerge également des récentes mesures de transparence de GitHub. En juillet 2025, GitHub a publié Copilot Chat en open source et en novembre 2025, il a publié le code source des suggestions en ligne de Copilot. Des mois plus tard, il collecte par défaut les données d’interaction des utilisateurs pour la formation des modèles d’IA sans consentement explicite, une tension entre l’ouverture d’un côté et la collecte de données de l’autre.

GitHub n’est pas le seul produit Microsoft à faire face à des critiques concernant les pratiques de désinscription des données. En octobre 2025, Microsoft a défendu son Gaming Copilot après des réactions négatives concernant la capture de données de capture d’écran cachées qui utilisaient également un cadrage de désinscription plutôt que d’adhésion. Google a également été confronté à une réaction virale en novembre 2025 après que des utilisateurs l’ont accusé d’entraîner Gemini sur des données privées Gmail, allégations que Google a fermement démenties.

Les deux épisodes illustrent la sensibilité croissante entourant les politiques de collecte de données par défaut dans les produits d’IA destinés aux consommateurs.

Les mainteneurs open source sont confrontés à un défi particulier dans le cadre de la nouvelle politique. Les contributions au code public alimentent déjà les ensembles de données de formation accessibles au public, et désormais les traces d’utilisation de Copilot pourraient également entrer dans le pipeline, créant une double contribution de données qui aggrave leur exposition. Pour les développeurs indépendants et les petites équipes sous forfait Pro qui gèrent le code client, les implications en matière de confidentialité s’étendent au-delà de leur propre travail et s’étendent au code qu’ils ne possèdent pas entièrement.

Comment se désinscrire

Dans ce contexte, les mécanismes de désinscription sont simples. Les développeurs qui souhaitent exclure leurs données peuvent se désinscrire via les paramètres de données Copilot via une bascule « Autoriser GitHub à utiliser mes données pour la formation du modèle d’IA » dans la section Confidentialité des paramètres de leur compte Copilot.

La désinscription ne restreint pas l’accès aux fonctionnalités de Copilot, et GitHub a déclaré que les non-participants conserveront la pleine utilisation des outils d’IA. Toute personne ayant précédemment refusé la collecte de données pour l’amélioration du produit verra ses préférences existantes automatiquement honorées et n’aura pas besoin de revoir ses paramètres du tout.

Pour les équipes exécutant des projets sensibles sur des plans individuels, la mise à niveau vers les niveaux Business ou Enterprise comporte désormais une incitation supplémentaire : l’exclusion complète du pool de données de formation. Copilot Business, Copilot Enterprise et les référentiels appartenant à l’entreprise sont explicitement exclus du programme, quelle que soit la manière dont les membres de l’équipe configurent leurs comptes personnels. GitHub a également ouvert une FAQ communautaire et un fil de discussion pour les utilisateurs ayant des questions sur le changement de politique.

Rodriguez a défini la vision plus large comme une vision dans laquelle les données réelles des développeurs sont essentielles à l’avancement du développement assisté par l’IA. La date limite du 24 avril répondra en pratique à la question de savoir si les développeurs conviennent que leurs interactions de code doivent servir cet objectif par défaut.

À l’approche de cette date, les développeurs des forfaits Free, Pro et Pro+ ont environ un mois pour revoir leurs paramètres de confidentialité Copilot et décider s’ils doivent contribuer leurs données d’interaction aux efforts de formation en IA de GitHub ou se désinscrire avant que la valeur par défaut ne prenne effet. Pour ceux qui gèrent du code sensible ou appartenant au client sur des plans individuels, il est particulièrement important de vérifier ces paramètres avant la date limite.

Categories: IT Info