Entraînement des modèles

Vos données entraînent-elles les IA ?

Quand vous discutez avec une IA, vos messages peuvent parfois servir à améliorer les futurs modèles. Mais ce n'est ni automatique, ni identique d'un service à l'autre : tout dépend du type de compte et des réglages. Ce guide indépendant explique comment fonctionne l'entraînement, la différence entre offres grand public et professionnelles, et ce que font — sous réserve de vérification — les grands fournisseurs.

Comment ça marche

Ce qu'est l'entraînement d'une IA

Un modèle de langage apprend à partir d'immenses quantités de textes. Comprendre ce parcours aide à savoir quand vos propres échanges peuvent y contribuer — et quand ils ne le peuvent pas.

01

Pré-entraînement

Le modèle est d'abord entraîné sur de vastes corpus de textes (web, livres, code). Cette étape précède votre utilisation et ne dépend pas de vos conversations.

02

Affinage

Le modèle est ensuite ajusté avec des exemples et des retours humains. C'est à ce stade que des conversations réelles peuvent, selon les cas, être réutilisées.

03

Vos échanges

Sur certains comptes grand public, vos messages peuvent être ajoutés aux données d'amélioration, parfois après relecture ou annotation humaine — sauf si vous refusez.

04

Vos réglages

Un réglage de refus, un chat temporaire ou une offre professionnelle limitent ou excluent cet usage. Encore faut-il activer les bonnes options.

Les modalités exactes varient selon les fournisseurs et évoluent souvent. Ce guide est informatif : vérifiez les réglages et la politique de confidentialité de chaque service, ainsi que les repères de la CNIL.

La distinction clé

Comptes grand public vs offres pro et API

C'est souvent le facteur le plus déterminant. Le même modèle peut se comporter différemment selon que vous l'utilisez avec un compte personnel ou via une offre professionnelle.

Type d'offreEntraînement sur vos donnéesÀ retenir
Compte gratuit / grand publicSouvent possible par défaut, avec option de refus.Pensez à désactiver l'amélioration des modèles et à utiliser un chat temporaire.
Offres Team / EnterpriseEn général, pas d'entraînement sur vos contenus.Garanties contractuelles adaptées aux organisations. Voir IA en entreprise.
Accès par APIHabituellement exclu par défaut pour les données envoyées.Prévu pour intégrer l'IA dans des applications, avec des règles distinctes.

Ces principes généraux ne remplacent pas la lecture des conditions du service : un fournisseur peut modifier ses réglages, proposer des choix par région, ou distinguer plusieurs niveaux d'offre. Prenez l'habitude de vérifier après chaque mise à jour importante.

Par fournisseur

Ce que font (sous réserve) les grands fournisseurs

Voici un aperçu prudent des pratiques connues. Elles évoluent régulièrement : considérez ce tableau comme un point de départ, pas comme une vérité définitive, et confirmez toujours dans les réglages.

FournisseurGrand publicPro / API & contrôles
OpenAI (ChatGPT)Conversations pouvant servir à l'amélioration par défaut ; chat temporaire disponible.Team, Enterprise et API : en général pas d'entraînement. Refus possible dans les contrôles des données.
Anthropic (Claude)Approche plutôt prudente historiquement ; réglages ayant évolué, avec choix proposés.Contrôles de données et d'entraînement à vérifier dans vos paramètres actuels.
Google (Gemini)Activité des applications pouvant être relue par des humains ; à mettre en pause.Contrôles d'activité du compte Google ; éviter les informations confidentielles.
Microsoft (Copilot)Copilot grand public : tableau de bord pour revoir et supprimer l'historique.Microsoft 365 Copilot : pas d'entraînement sur les données de l'organisation.
PerplexityRecherches pouvant améliorer les modèles ; réglage de conservation désactivable.Contrôles au niveau du compte ; options à confirmer dans les réglages.

Pour passer à l'action service par service, consultez notre guide pratique : désactiver l'entraînement. Vous y trouverez, outil par outil, où se cachent les réglages de refus. Voir aussi la mémoire des IA et supprimer vos données.

Pages d'aide officielles : OpenAI, Anthropic, Google Gemini, Microsoft et Perplexity. Les pratiques peuvent changer sans préavis.

Panorama

Des outils souvent cités pour préserver la vie privée

Aucun outil n'est parfait, mais plusieurs approches limitent la collecte : réduire ce que vous confiez, répartir vos usages entre plusieurs services, ou faire tourner un modèle en local. Voici des exemples fréquemment cités, à évaluer selon vos besoins.

Navigateur

Brave Leo

brave.com/leo

Assistant intégré au navigateur Brave. Brave indique ne pas conserver les échanges de façon identifiante ni s'en servir pour entraîner des modèles. Il s'appuie sur des modèles tiers : vérifiez la documentation pour savoir ce qui est transmis.

Anonymisé

Duck.ai

duck.ai

Accès anonymisé à plusieurs modèles via DuckDuckGo, qui annonce ne pas associer d'identifiants à vos échanges ni les utiliser pour l'entraînement. Les fonctionnalités sont plus limitées que celles des applications complètes.

Open source

HuggingChat

huggingface.co/chat

Interface open source de Hugging Face donnant accès à des modèles ouverts. Le code étant public, il est auditable ; consultez la politique de confidentialité pour la conservation des données.

Sans publicité

Kagi Assistant

kagi.com

Proposé par le moteur de recherche payant Kagi, financé par l'abonnement plutôt que la publicité. Kagi met en avant une collecte de données limitée. Service payant, à évaluer selon vos besoins.

Éditeur européen

Le Chat (Mistral AI)

chat.mistral.ai

Assistant de l'éditeur français Mistral AI, avec un hébergement en Europe. Propose des contrôles de données ; vérifiez les options de conservation et d'entraînement dans les réglages.

Multi-modèles

MultipleChat

multiplechat.ai

Espace réunissant plusieurs modèles (ChatGPT, Claude, Gemini…) au même endroit. Indique ne pas entraîner sur vos échanges ni les partager à cette fin ; vérifiez aussi les réglages des modèles sous-jacents.

En local

Ollama / Jan / LM Studio

ollama.com · jan.ai

Outils gratuits pour exécuter des modèles directement sur votre appareil : rien n'est envoyé à un serveur tiers. Demandent un ordinateur assez puissant et un minimum de configuration.

Suisse · chiffré

Proton Lumo

lumo.proton.me

Assistant de Proton (éditeur suisse de services chiffrés), qui met en avant le chiffrement et l'absence d'utilisation de vos échanges pour l'entraînement. Offre récente dont les fonctionnalités évoluent.

Cette liste est indicative, non exhaustive, et ne constitue pas une recommandation. Les positionnements et politiques évoluent : vérifiez la politique de confidentialité officielle de chaque service avant de l'utiliser. Voir aussi notre comparatif IA et vie privée.

FAQ

Entraînement des IA — questions fréquentes

Comment mes conversations peuvent-elles servir à entraîner une IA ?

L'entraînement consiste à ajuster un modèle à partir de très grandes quantités de textes. Sur certains comptes grand public, vos échanges peuvent être ajoutés à ces jeux de données pour améliorer les futurs modèles, parfois après une phase de relecture ou d'annotation par des humains. Ce n'est pas systématique et dépend des réglages ainsi que du type d'offre. Vérifiez toujours les paramètres et la politique de confidentialité du service que vous utilisez.

Y a-t-il une différence entre compte gratuit et offre professionnelle ?

Oui, c'est souvent la distinction la plus importante. Sur les comptes grand public (gratuits ou individuels), les conversations peuvent, par défaut, contribuer à l'amélioration des modèles, avec une option de refus. Les offres professionnelles (Team, Enterprise) et l'accès par API prévoient en général de ne pas entraîner sur vos données, avec des garanties contractuelles. Ces règles évoluent : confirmez-les auprès du fournisseur avant de vous y fier.

Que fait OpenAI (ChatGPT) de mes données ?

Sur ChatGPT grand public, les conversations peuvent par défaut servir à améliorer les modèles, mais OpenAI propose un réglage pour refuser cet usage dans les contrôles des données, ainsi qu'un chat temporaire non conservé et non utilisé pour l'entraînement. Les offres Team, Enterprise et l'API prévoient de ne pas entraîner sur vos contenus par défaut. Ces réglages ont évolué : vérifiez l'état actuel dans vos paramètres et la page d'aide d'OpenAI.

Que fait Anthropic (Claude) de mes données ?

Anthropic propose des contrôles de données et d'entraînement et a longtemps adopté une approche prudente sur les conversations grand public. Ses réglages ont toutefois évolué dans le temps, avec des choix proposés aux utilisateurs concernant l'usage des échanges pour l'amélioration des modèles. Il est donc important de vérifier vos paramètres de confidentialité actuels dans Claude et de consulter les pages officielles d'Anthropic pour connaître les règles en vigueur.

Que fait Google (Gemini) de mes données ?

Pour Gemini, l'activité des applications peut être mise en pause et l'historique supprimé, mais des conversations échantillonnées peuvent être relues par des évaluateurs humains pour améliorer les services. Google recommande de ne pas y saisir d'informations confidentielles. Les contrôles d'activité de votre compte Google déterminent en partie ce qui est conservé. Vérifiez ces réglages et la documentation officielle de Google.

Que font Microsoft Copilot et Perplexity de mes données ?

Microsoft 365 Copilot (entreprise) n'utilise pas les données de l'organisation pour entraîner les modèles de base et ajoute une protection des données d'entreprise ; le Copilot grand public offre un tableau de bord pour revoir et supprimer l'historique. Perplexity propose un réglage de conservation des données que vous pouvez désactiver pour que vos recherches ne servent pas à améliorer ses modèles. Confirmez les options actuelles dans les réglages de chaque service.

Comment savoir si mes données servent à l'entraînement ?

Cherchez dans les paramètres une section « Données », « Confidentialité » ou « Contrôles des données », où figure généralement une option d'amélioration des modèles. La politique de confidentialité du service précise aussi les finalités et les durées de conservation. Si vous ne trouvez pas d'information claire, considérez que l'usage est possible et évitez d'y saisir des données sensibles. En cas de doute, consultez les pages d'aide officielles du fournisseur.

Refuser l'entraînement supprime-t-il mes anciennes conversations ?

Pas nécessairement. Désactiver l'usage de vos données pour l'entraînement concerne surtout les échanges futurs ; les données déjà intégrées à un modèle entraîné ne peuvent généralement pas en être retirées. Pour effacer vos conversations passées et votre mémoire, il faut agir séparément via les fonctions de suppression et le droit à l'effacement. Consultez notre guide dédié et la politique du fournisseur pour les durées de conservation.