This is the Trace Id: 53bb415295411be61f97cc417ee2d04a
Passer directement au contenu principal Vue d’ensemble Principes et approche Rapport de transparence Outils et pratiques Une IA responsable dans Azure Données pour l’entraînement de l’IA Initiative pour un avenir sûr Rapport de progression IAS Vue d’ensemble des modèles et pratiques Confiance zéro Vue d’ensemble de la confidentialité Vue d’ensemble de la gestion de données Accès aux données Emplacement des données Délimitation des données dans l’Union européenne RGPD Vue d’ensemble de la conformité Offres de conformité Réglementations Conformité DORA Loi européenne sur l'IA Résilience numérique européenne Conformité NIS2 Conformité par région et par pays Accessibilité Produits et services Offres de conformité Niveau de conformité Rapports d’audit Ressources de protection des données Sécurité Microsoft Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Réalité mixte Microsoft HoloLens Microsoft Viva Informatique quantique Éducation Automobile Services financiers Secteur public Santé Industrie Vente au détail Trouver un partenaire Devenir partenaire Réseau de partenaires Microsoft Marketplace Entreprises de logiciels Blog Microsoft Advertising Centre pour les développeurs Documentation Événements Licences Microsoft Learn Microsoft Research Vue plan de site

Données pour le développement de modèles IA

Découvrez notre approche en matière de données pour l’entraînement des modèles d’IA générative.
Deux personnes assises à une table, examinent du contenu sur une tablette, avec une tasse de café à proximité.
La confiance et la transparence sont essentielles à la façon dont nous abordons les données pour l’entraînement des modèles IA ici chez Microsoft.

Cette page a pour objectif de partager notre approche, en présentant les catégories de données que nous utilisons pour l’entraînement et les mesures que nous prenons pour donner aux éditeurs Web et aux créateurs de contenu le contrôle sur la façon dont leur contenu est utilisé pour entraîner ces modèles.

Que signifie entraîner un modèle d’IA ?

Les modèles IA font des prédictions à partir des données. Pendant le processus d’entraînement, un modèle IA identifie des schémas, des corrélations et des concepts dans d’immenses volumes de données, puis utilise ce qu’il a appris pour générer des réponses à des questions ou à des demandes. Le modèle peut être ajusté à l’aide de différentes catégories de données d’entraînement pour optimiser ses capacités de génération pour des catégories d’informations spécifiques, comme le langage naturel, le code logiciel ou les images. Il peut également être ancré sur les propres données d’une entreprise — par exemple, dans un secteur vertical comme l’agriculture, la santé ou le commerce de détail.

Les modèles d’IA générative ne sont pas conçus pour stocker, accéder ou reproduire les données d’entraînement d’origine. Ils sont plutôt destinés à générer de nouvelles œuvres et de nouveaux contenus expressifs.

Deux personnes debout à l’intérieur examinent un tableau de bord sur un grand moniteur affichant des graphiques et des indicateurs.

Découvrez comment Microsoft entraîne des modèles d’IA générative sur des données variées

Des jeux de données vastes et variés sont essentiels à la création des systèmes d’IA actuels. Il est essentiel d’utiliser une grande diversité de données pour développer des modèles plus précis, plus représentatifs des différentes cultures et langues, et capables d’apprendre et d’appliquer toute la palette de l’expérience et de l’ingéniosité humaines.
Comme indiqué dans nos fiches modèles et dans d’autres documents disponibles publiquement, Microsoft s’approvisionne de manière responsable en données pour entraîner ses modèles d’IA générative dans les catégories suivantes :
  • Nous entraînons nos modèles sur certaines données publiques, issues d’un mélange de jeux de données standards du machine learning et d’explorations web. Nous excluons les sources protégées par des paywalls, ainsi que les contenus qui enfreignent nos politiques et qui ont choisi de se retirer de l’entraînement à l’aide des contrôles web que nous avons publiés. Les données explorées sur le Web sont soumises à un filtrage de sécurité et traitées pour supprimer les contenus illicites, y compris les contenus relatifs aux abus sexuels sur mineur (CSAM), conformément aux lois applicables et aux politiques Microsoft en matière d’IA responsable.

    Nous respectons des normes telles que les balises robots.txt que les éditeurs web utilisent pour se retirer de l’exploration du Web. Nous n’utilisons pas de données provenant des domaines répertoriés dans la liste des marchés notoires en matière de contrefaçon et de piratage de l’Office of the United States Trade Representative (USTR).
  • Il s’agit de données d’entraînement auxquelles nous accédons dans le cadre d’accords négociés, notamment avec des éditeurs et des titulaires de droits d’auteur.
  • Ces données sont collectées à partir de certains services Microsoft destinés aux particuliers et protégées conformément à notre Déclaration de confidentialité Microsoft. Notre blog Microsoft Copilot et la Foire aux questions sur Copilot expliquent comment nous utilisons les données grand public de Copilot, Bing et Microsoft Start (MSN) pour aider à entraîner nos modèles dans Copilot. Nous permettons facilement aux utilisateurs de se retirer et mettons en place des garanties, comme la suppression des identifiants susceptibles de vous identifier, pour protéger la confidentialité des utilisateurs. Nous n’utilisons pas les données de nos clients professionnels sans leur autorisation.
  • Nous entraînons parfois nos modèles sur des jeux de données synthétiques. Nous les créons en demandant à des modèles de langage volumineux (LLM) de générer un résultat spécifique qui augmente les données réelles rares ou limitées. Les résultats sont ensuite examinés et filtrés, notamment par des relecteurs humains, pour vérifier qu’ils ont une qualité suffisante pour faire partie du jeu de données d’entraînement.
  • Nous intégrons dans notre processus d’entraînement les retours d’expérience fournis par des formateurs en IA, des membres de l’équipe rouge, des collaborateurs et des partenaires externes chargés de l’annotation. Cela inclut, par exemple, un feedback fourni par des humains qui permettent d’améliorer la qualité des résultats générés en réponse à la requête d’un utilisateur, ce qui améliore l’expérience de l’utilisateur final. Les testeurs en équipe rouge évaluent également le modèle face à des demandes dangereuses ou malveillantes, et leurs retours servent à améliorer les comportements de sécurité du modèle.
En plus de nos propres modèles Microsoft, nous intégrons plusieurs autres modèles, notamment ceux d’OpenAI, dans nos produits et services. En savoir plus sur la façon dont OpenAI entraîne ses modèles.

Pour une IA bénéfique et inclusive, certains éditeurs web et titulaires de contenu souhaitent avoir davantage leur mot à dire sur l’utilisation de leur contenu. Les contrôles des éditeurs web sont utiles, mais ils ne constituent pas la solution complète. Nous travaillons avec d’autres acteurs du secteur, des organismes de normalisation et la communauté du contenu pour identifier une approche commune que nous pouvons tous faire progresser et adopter.
Personne debout à l’intérieur utilisant un ordinateur portable dans un environnement de bureau lumineux.

IA responsable chez Microsoft

Explorez les outils, pratiques et stratégies que nous avons créés pour respecter nos principes d’IA responsable.

Ressources supplémentaires

Trois personnes examinent ensemble du contenu sur un ordinateur portable dans un salon.

Rapport de transparence de l’IA responsable

Découvrez comment nous développons l’IA de manière responsable, soutenons nos clients, évoluons et grandissons.
Deux personnes assises à une table utilisent des ordinateurs portables pendant une discussion.

Transparence et contrôle dans l’utilisation des données des consommateurs

Contrôlez la façon dont Copilot apprend à partir de vos données.
Personne tenant une tablette affichant des histogrammes et des analyses.

Faire progresser les données ouvertes

Tirez parti des avantages de données plus ouvertes et plus accessibles.

Suivez Microsoft

Français (France) Confidentialité de l’intégrité des consommateurs Contacter Microsoft Gérer ou annuler l’abonnement Mentions légales et Informations consommateurs Confidentialité Gérer les cookies Conditions d'utilisation Conditions générales de vente Marques À propos de nos annonces EU Compliance DoCs Accessibilité