Pré-entraînement
Le modèle est d'abord entraîné sur de vastes corpus de textes (web, livres, code). Cette étape précède votre utilisation et ne dépend pas de vos conversations.
Entraînement des modèles
Quand vous discutez avec une IA, vos messages peuvent parfois servir à améliorer les futurs modèles. Mais ce n'est ni automatique, ni identique d'un service à l'autre : tout dépend du type de compte et des réglages. Ce guide indépendant explique comment fonctionne l'entraînement, la différence entre offres grand public et professionnelles, et ce que font — sous réserve de vérification — les grands fournisseurs.
Comment ça marche
Un modèle de langage apprend à partir d'immenses quantités de textes. Comprendre ce parcours aide à savoir quand vos propres échanges peuvent y contribuer — et quand ils ne le peuvent pas.
Le modèle est d'abord entraîné sur de vastes corpus de textes (web, livres, code). Cette étape précède votre utilisation et ne dépend pas de vos conversations.
Le modèle est ensuite ajusté avec des exemples et des retours humains. C'est à ce stade que des conversations réelles peuvent, selon les cas, être réutilisées.
Sur certains comptes grand public, vos messages peuvent être ajoutés aux données d'amélioration, parfois après relecture ou annotation humaine — sauf si vous refusez.
Un réglage de refus, un chat temporaire ou une offre professionnelle limitent ou excluent cet usage. Encore faut-il activer les bonnes options.
Les modalités exactes varient selon les fournisseurs et évoluent souvent. Ce guide est informatif : vérifiez les réglages et la politique de confidentialité de chaque service, ainsi que les repères de la CNIL.
La distinction clé
C'est souvent le facteur le plus déterminant. Le même modèle peut se comporter différemment selon que vous l'utilisez avec un compte personnel ou via une offre professionnelle.
| Type d'offre | Entraînement sur vos données | À retenir |
|---|---|---|
| Compte gratuit / grand public | Souvent possible par défaut, avec option de refus. | Pensez à désactiver l'amélioration des modèles et à utiliser un chat temporaire. |
| Offres Team / Enterprise | En général, pas d'entraînement sur vos contenus. | Garanties contractuelles adaptées aux organisations. Voir IA en entreprise. |
| Accès par API | Habituellement exclu par défaut pour les données envoyées. | Prévu pour intégrer l'IA dans des applications, avec des règles distinctes. |
Ces principes généraux ne remplacent pas la lecture des conditions du service : un fournisseur peut modifier ses réglages, proposer des choix par région, ou distinguer plusieurs niveaux d'offre. Prenez l'habitude de vérifier après chaque mise à jour importante.
Par fournisseur
Voici un aperçu prudent des pratiques connues. Elles évoluent régulièrement : considérez ce tableau comme un point de départ, pas comme une vérité définitive, et confirmez toujours dans les réglages.
| Fournisseur | Grand public | Pro / API & contrôles |
|---|---|---|
| OpenAI (ChatGPT) | Conversations pouvant servir à l'amélioration par défaut ; chat temporaire disponible. | Team, Enterprise et API : en général pas d'entraînement. Refus possible dans les contrôles des données. |
| Anthropic (Claude) | Approche plutôt prudente historiquement ; réglages ayant évolué, avec choix proposés. | Contrôles de données et d'entraînement à vérifier dans vos paramètres actuels. |
| Google (Gemini) | Activité des applications pouvant être relue par des humains ; à mettre en pause. | Contrôles d'activité du compte Google ; éviter les informations confidentielles. |
| Microsoft (Copilot) | Copilot grand public : tableau de bord pour revoir et supprimer l'historique. | Microsoft 365 Copilot : pas d'entraînement sur les données de l'organisation. |
| Perplexity | Recherches pouvant améliorer les modèles ; réglage de conservation désactivable. | Contrôles au niveau du compte ; options à confirmer dans les réglages. |
Pour passer à l'action service par service, consultez notre guide pratique : désactiver l'entraînement. Vous y trouverez, outil par outil, où se cachent les réglages de refus. Voir aussi la mémoire des IA et supprimer vos données.
Pages d'aide officielles : OpenAI, Anthropic, Google Gemini, Microsoft et Perplexity. Les pratiques peuvent changer sans préavis.
Panorama
Aucun outil n'est parfait, mais plusieurs approches limitent la collecte : réduire ce que vous confiez, répartir vos usages entre plusieurs services, ou faire tourner un modèle en local. Voici des exemples fréquemment cités, à évaluer selon vos besoins.
Assistant intégré au navigateur Brave. Brave indique ne pas conserver les échanges de façon identifiante ni s'en servir pour entraîner des modèles. Il s'appuie sur des modèles tiers : vérifiez la documentation pour savoir ce qui est transmis.
AnonymiséAccès anonymisé à plusieurs modèles via DuckDuckGo, qui annonce ne pas associer d'identifiants à vos échanges ni les utiliser pour l'entraînement. Les fonctionnalités sont plus limitées que celles des applications complètes.
Open sourceInterface open source de Hugging Face donnant accès à des modèles ouverts. Le code étant public, il est auditable ; consultez la politique de confidentialité pour la conservation des données.
Sans publicitéProposé par le moteur de recherche payant Kagi, financé par l'abonnement plutôt que la publicité. Kagi met en avant une collecte de données limitée. Service payant, à évaluer selon vos besoins.
Éditeur européenAssistant de l'éditeur français Mistral AI, avec un hébergement en Europe. Propose des contrôles de données ; vérifiez les options de conservation et d'entraînement dans les réglages.
Multi-modèlesEspace réunissant plusieurs modèles (ChatGPT, Claude, Gemini…) au même endroit. Indique ne pas entraîner sur vos échanges ni les partager à cette fin ; vérifiez aussi les réglages des modèles sous-jacents.
En localOutils gratuits pour exécuter des modèles directement sur votre appareil : rien n'est envoyé à un serveur tiers. Demandent un ordinateur assez puissant et un minimum de configuration.
Suisse · chiffréAssistant de Proton (éditeur suisse de services chiffrés), qui met en avant le chiffrement et l'absence d'utilisation de vos échanges pour l'entraînement. Offre récente dont les fonctionnalités évoluent.
Cette liste est indicative, non exhaustive, et ne constitue pas une recommandation. Les positionnements et politiques évoluent : vérifiez la politique de confidentialité officielle de chaque service avant de l'utiliser. Voir aussi notre comparatif IA et vie privée.
FAQ
L'entraînement consiste à ajuster un modèle à partir de très grandes quantités de textes. Sur certains comptes grand public, vos échanges peuvent être ajoutés à ces jeux de données pour améliorer les futurs modèles, parfois après une phase de relecture ou d'annotation par des humains. Ce n'est pas systématique et dépend des réglages ainsi que du type d'offre. Vérifiez toujours les paramètres et la politique de confidentialité du service que vous utilisez.
Oui, c'est souvent la distinction la plus importante. Sur les comptes grand public (gratuits ou individuels), les conversations peuvent, par défaut, contribuer à l'amélioration des modèles, avec une option de refus. Les offres professionnelles (Team, Enterprise) et l'accès par API prévoient en général de ne pas entraîner sur vos données, avec des garanties contractuelles. Ces règles évoluent : confirmez-les auprès du fournisseur avant de vous y fier.
Sur ChatGPT grand public, les conversations peuvent par défaut servir à améliorer les modèles, mais OpenAI propose un réglage pour refuser cet usage dans les contrôles des données, ainsi qu'un chat temporaire non conservé et non utilisé pour l'entraînement. Les offres Team, Enterprise et l'API prévoient de ne pas entraîner sur vos contenus par défaut. Ces réglages ont évolué : vérifiez l'état actuel dans vos paramètres et la page d'aide d'OpenAI.
Anthropic propose des contrôles de données et d'entraînement et a longtemps adopté une approche prudente sur les conversations grand public. Ses réglages ont toutefois évolué dans le temps, avec des choix proposés aux utilisateurs concernant l'usage des échanges pour l'amélioration des modèles. Il est donc important de vérifier vos paramètres de confidentialité actuels dans Claude et de consulter les pages officielles d'Anthropic pour connaître les règles en vigueur.
Pour Gemini, l'activité des applications peut être mise en pause et l'historique supprimé, mais des conversations échantillonnées peuvent être relues par des évaluateurs humains pour améliorer les services. Google recommande de ne pas y saisir d'informations confidentielles. Les contrôles d'activité de votre compte Google déterminent en partie ce qui est conservé. Vérifiez ces réglages et la documentation officielle de Google.
Microsoft 365 Copilot (entreprise) n'utilise pas les données de l'organisation pour entraîner les modèles de base et ajoute une protection des données d'entreprise ; le Copilot grand public offre un tableau de bord pour revoir et supprimer l'historique. Perplexity propose un réglage de conservation des données que vous pouvez désactiver pour que vos recherches ne servent pas à améliorer ses modèles. Confirmez les options actuelles dans les réglages de chaque service.
Cherchez dans les paramètres une section « Données », « Confidentialité » ou « Contrôles des données », où figure généralement une option d'amélioration des modèles. La politique de confidentialité du service précise aussi les finalités et les durées de conservation. Si vous ne trouvez pas d'information claire, considérez que l'usage est possible et évitez d'y saisir des données sensibles. En cas de doute, consultez les pages d'aide officielles du fournisseur.
Pas nécessairement. Désactiver l'usage de vos données pour l'entraînement concerne surtout les échanges futurs ; les données déjà intégrées à un modèle entraîné ne peuvent généralement pas en être retirées. Pour effacer vos conversations passées et votre mémoire, il faut agir séparément via les fonctions de suppression et le droit à l'effacement. Consultez notre guide dédié et la politique du fournisseur pour les durées de conservation.