This is the Trace Id: 00244945a6a7e3f43f3fb5d4c65cae52
Zu Hauptinhalt springen Übersicht Prinzip und Ansatz Transparenzbericht Tools und Methoden Verantwortungsvolle KI in Azure Daten für das Training von KI Secure Future Initiative SFI-Statusbericht Patterns and Practices-Übersicht Zero Trust Datenschutz – Übersicht Datenverwaltung – Übersicht Datenzugang Datenspeicherort EU Data Boundary DSGVO Compliance – Übersicht Compliance-Angebote Verordnungen DORA-Konformität EU-Gesetz über KI Europäische digitale Resilienz NIS2-Konformität Compliance nach Regionen und Ländern Barrierefreiheit Produkte und Services Compliance-Angebote Compliancebewertung Auditberichte Ressourcen für den Datenschutz Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft KI Azure Space Mixed Reality Microsoft HoloLens Microsoft Viva Quanten-Computing Bildung und Forschung Automobilbranche Finanzdienstleistungen Öffentlicher Sektor Gesundheitswesen Produktion Einzelhandel Partner finden Partner werden Partner-Netzwerk Microsoft Marketplace Softwareunternehmen Blog Microsoft Advertising Developer Center Dokumentation Veranstaltungen Lizenzierung Microsoft Learn Microsoft Research Siteübersicht anzeigen

Daten für die Entwicklung von KI-Modellen

Erfahren Sie mehr über unseren Ansatz für Daten zum Trainieren generativer KI-Modelle.
Zwei Personen sitzen an einem Tisch und sehen sich Inhalte auf einem Tablet an, daneben steht eine Kaffeetasse.
Vertrauen und Transparenz sind zentral für unseren Ansatz bei Daten zum Trainieren von KI-Modellen hier bei Microsoft.

Auf dieser Seite stellen wir unseren Ansatz vor. Wir erläutern die Kategorien von Daten, die wir für das Training verwenden, und wie wir Webverlegern und Content-Erstellern mehr Kontrolle darüber geben, wie ihre Inhalte zum Trainieren dieser Modelle genutzt werden.

Was bedeutet es, ein KI-Modell zu trainieren?

KI-Modelle treffen Vorhersagen auf Basis von Daten. Während des Trainingsprozesses erkennt ein KI-Modell Muster, Zusammenhänge und Konzepte in riesigen Datenmengen und nutzt dann das Gelernte, um Antworten auf Fragen oder Anforderungen zu generieren. Das Modell kann mit unterschiedlichen Kategorien von Trainingsdaten angepasst werden, um die Generierungsfunktionen für bestimmte Informationsarten wie natürliche Sprache, Code oder Bilder zu optimieren. Es kann auch mit den eigenen Daten eines Unternehmens verankert werden, zum Beispiel in einer Branchenvertikale wie Landwirtschaft, Gesundheit oder Einzelhandel.

Generative KI-Modelle sind nicht dafür ausgelegt, die ursprünglichen Trainingsdaten zu speichern, darauf zuzugreifen oder sie wiederzugeben. Stattdessen sollen diese Modelle neue ausdrucksstarke Werke und Inhalte generieren.

Zwei Personen stehen in einem Innenraum und sehen sich auf einem großen Monitor ein Dashboard mit Diagrammen und Kennzahlen an.

Erfahren Sie, wie Microsoft generative KI-Modelle mit vielfältigen Daten trainiert

Große und vielfältige Datensätze sind ein wesentlicher Bestandteil heutiger KI-Systeme. Es ist entscheidend, dass eine breite Vielfalt an Daten genutzt wird, um Modelle zu entwickeln, die genauer sind, verschiedene Kulturen und Sprachen besser abbilden und das gesamte Spektrum menschlicher Erfahrungen und Erfindungskraft lernen und anwenden.
Wie in unseren Model Cards und anderer öffentlich verfügbarer Dokumentation beschrieben, bezieht Microsoft die folgenden Datenkategorien für das verantwortungsvolle Training unserer generativen KI-Modelle ein:
  • Wir trainieren mit ausgewählten öffentlich verfügbaren Daten aus einer Mischung von branchenüblichen Machine Learning-Datensätzen und Web-Crawls. Wir schließen Quellen mit Paywalls und Inhalte aus, die gegen unsere Richtlinien verstoßen, sowie Quellen, die sich vom Training mit Web-Steuerelementen, die wir veröffentlicht haben, abgemeldet haben. Web-Crawl-Daten werden sicherheitsgefiltert und verarbeitet, um illegale Inhalte zu entfernen, einschließlich Material mit sexuellem Missbrauch von Kindern (CSAM), in Übereinstimmung mit geltenden Gesetzen und den Microsoft-Richtlinien für verantwortungsvolle KI.

    Wir respektieren Standards wie robots.txt-Kennzeichnungen, mit denen Webverleger das Crawlen durch Web-Crawler ablehnen können. Wir verwenden keine Daten von Domänen, die in der Liste der Notorious Markets for Counterfeiting and Piracy des Office of the United States Trade Representative (USTR) aufgeführt sind.
  • Dabei handelt es sich um Trainingsdaten, auf die wir über ausgehandelte Vereinbarungen zugreifen, zum Beispiel mit Verlegern und Urheberrechtsinhabern.
  • Diese Daten werden aus ausgewählten Microsoft-Verbraucherdiensten erhoben und gemäß unseren Microsoft-Datenschutzbestimmungen geschützt. Unser Microsoft Copilot-Blog und die Copilot-FAQ erläutern, wie wir Verbraucherdaten aus Copilot, Bing und Microsoft Start (MSN) verwenden, um unsere Modelle in Copilot zu trainieren. Wir machen es Benutzern leicht, sich abzumelden, und setzen Schutzmaßnahmen wie das Entfernen von Kennungen ein, die Sie identifizieren könnten, um die Privatsphäre der Benutzer zu schützen. Wir verwenden die Daten unserer Unternehmenskunden nicht ohne deren Zustimmung.
  • Manchmal trainieren wir mit synthetischen Datensätzen. Diese erstellen wir, indem wir große Sprachmodelle (LLMs) auffordern, speziell angeforderte Ausgaben zu generieren, die knappe oder begrenzte reale Daten ergänzen. Die Ergebnisse werden dann überprüft und gefiltert, auch durch menschliche Prüfer, um sicherzustellen, dass sie von ausreichender Qualität sind, um Teil des Trainingsdatensatzes zu sein.
  • Wir beziehen im Trainingsprozess menschliches Feedback von und KI-Trainern, Red-Teamern, Mitarbeitern und externen Annotationspartnern ein. Dazu gehört zum Beispiel menschliches Feedback, das qualitativ hochwertige Ausgaben für den Prompt einen Benutzers verstärkt und so die Endbenutzererfahrung verbessert. Red-Teamer testen das Modell auch gegen schädliche oder unsichere Anforderungen, und ihr Feedback wird genutzt, um das Sicherheitsverhalten des Modells zu verbessern.
Zusätzlich zu unseren eigenen Microsoft-Modellen integrieren wir verschiedene andere Modelle, u. a. von OpenAI, in unsere Produkte und Dienste. Weitere Informationen dazu, wie OpenAI Modelle trainiert.

Für eine nützliche und inklusive KI möchten einige Webverleger und Content-Inhaber mehr mitbestimmen, wie ihre Inhalte verwendet werden. Steuerelemente für Webverleger sind hilfreich, aber nicht die komplette Lösung. Wir arbeiten mit anderen aus der Industrie, dem Verlagswesen, Standardisierungsgremien und der Content-Community zusammen, um einen gemeinsamen Ansatz zu finden, den wir alle weiterentwickeln und übernehmen können.
Eine Person steht in einem hellen Büroinnenraum und arbeitet mit einem Laptop.

Verantwortungsvolle KI bei Microsoft

Entdecken Sie die Tools, Praktiken und Richtlinien, die wir entwickelt haben, um unsere Prinzipien für verantwortungsvolle KI einzuhalten.

Weitere Ressourcen

Drei Personen sehen sich gemeinsam Inhalte auf einem Laptop in einem Wohnzimmer an.

Transparenzbericht für verantwortungsvolle KI

Erfahren Sie, wie wir KI verantwortungsvoll entwickeln, unsere Kunden unterstützen, uns weiterentwickeln und wachsen.
Zwei Personen sitzen an einem Tisch und nutzen während einer Besprechung Laptops.

Transparenz und Kontrolle bei der Nutzung von Verbraucherdaten

Steuern, wie Copilot aus den Daten lernt.
Eine Person hält ein Tablet mit Balkendiagrammen und Analysen.

Offene Daten voranbringen

Nutzen Sie die Vorteile offenerer und leichter zugänglicher Daten.

Microsoft folgen

Deutsch (Deutschland) Verbraucherdatenschutz für Gesundheitsdaten An Microsoft wenden Abo kündigen Impressum Datenschutz Cookies verwalten Nutzungsbedingungen Markenzeichen Informationen zu unserer Werbung EU Compliance DoCs