This is the Trace Id: dc4127715ed02e26d7ae92655ddad365
Gå til hovedindholdet Oversigt Principper og tilgang Gennemsigtighedsrapport Værktøjer og praksisser Ansvarlig AI i Azure Data til AI-træning Secure Future Initiative SFI-statusrapport Oversigt over mønstre og praksisser Zero Trust Overblik over beskyttelse af personlige oplysninger Oversigt over dataadministration Dataadgang Dataplacering Datagrænser i EU GDPR Overblik over overholdelse af regler og standarder Løsninger til overholdelse af regler og standarder Regler DORA-overholdelse EU's AI Act Europæisk digital modstandsdygtighed NIS2-overholdelse Overholdelse af angivne standarder i forbindelse med regioner og lande Tilgængelighed Produkter og tjenester Løsninger til overholdelse af regler og standarder Resultat af overholdelse af angivne standarder Overvågningsrapporter Databeskyttelsesressourcer Microsoft Sikkerhed Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Kunstig intelligens Azure Space Mixed reality Microsoft HoloLens Microsoft Viva Kvantecomputere Uddannelse Biler Finansielle tjenester Myndigheder Sundhedspleje Produktion Detail Find en partner Bliv partner Partner Network Microsoft Marketplace Softwarefirmaer Blog Microsoft Advertising Udviklercenter Dokumentation Arrangementer Licenser Microsoft Learn Microsoft Research Vis oversigt over websted

Data til udvikling af AI-modeller

Udforsk vores tilgang til data til træning af generative AI-modeller.
To personer sidder ved et bord og gennemgår indhold på en tablet, med en kaffekop i nærheden.
Tillid og gennemsigtighed er centrale for vores tilgang til data til træning af AI-modeller her hos Microsoft.

Formålet med denne side er at dele vores tilgang, hvor vi beskriver de datakategorier, vi bruger til træning, og hvad vi gør for at give webudgivere og indholdsskabere kontrol over, hvordan deres indhold bruges til at træne disse modeller.

Hvad vil det sige at træne en AI-model?

AI-modeller laver forudsigelser baseret på data. Under træningsprocessen identificerer en AI-model mønstre, sammenhænge og koncepter på tværs af enorme datamængder og bruger derefter det, den har lært, til at generere svar på spørgsmål eller anmodninger. Modellen kan finjusteres ved hjælp af forskellige kategorier af træningsdata for at optimere dens genereringsfunktioner til særlige kategorier af oplysninger, såsom naturligt sprog, softwarekode eller billeder. Den kan også grundlægges med en organisations egne data – for eksempel i en branchevertikal som landbrug, sundhed eller detailhandel.

Generative AI-modeller er ikke udviklet til at gemme, få adgang til eller reproducere de oprindelige træningsdata. I stedet er disse modeller beregnet til at generere nye udtryksfulde værker og nyt indhold.

To personer står indendørs og gennemgår et dashboard på en stor skærm med diagrammer og målepunkter.

Få mere at vide om, hvordan Microsoft træner generative AI-modeller på varierede data

Store og varierede datasæt er afgørende for at skabe nutidens AI-systemer. Det er afgørende, at der bruges en bred variation af data til at udvikle modeller, der er mere nøjagtige, mere repræsentative for forskellige kulturer og sprog, og som lærer og anvender hele spektret af menneskelig erfaring og opfindsomhed.
Som angivet i vores modelkort og anden offentligt tilgængelig dokumentation bruger Microsoft følgende datakategorier til ansvarligt at træne vores generative AI-modeller:
  • Vi oplærer udvalgte offentligt tilgængelige data fra en blanding af branchestandarddatasæt til maskinel indlæring og webgennemsøgninger. Vi udelukker kilder med betalingsmure og indhold, der overtræder vores politikker, og som har fravalgt træning ved hjælp af webkontroller, som vi har publiceret. Data fra webgennemsøgninger er sikkerhedsfiltreret og behandlet for at fjerne ulovligt indhold, herunder materiale om seksuelt misbrug af børn (CSAM), i overensstemmelse med gældende lovgivning og Microsofts politikker for ansvarlig AI.

    Vi respekterer standarder, såsom robots.txt-tags, som webudgivere bruger til at fravælge webgennemsøgning. Vi bruger ikke data fra domæner, der er angivet i Det Amerikanske Handelsrepræsentatkontor (USTR) listen over berygtede markeder for kopivarer og piratkopiering.
  • Dette er træningsdata, som vi får adgang til gennem forhandlede aftaler, for eksempel med udgivere og rettighedshavere.
  • Disse data indsamles fra udvalgte Microsoft-forbrugertjenester og beskyttes i overensstemmelse med vores Microsofts erklæring om beskyttelse af personlige oplysninger. Vores Microsoft Copilot-blog og Ofte stillede spørgsmål om Copilot forklarer, hvordan vi bruger forbrugerdata fra Copilot, Bing og Microsoft Start (MSN) til at hjælpe med at træne vores modeller i Copilot. Vi gør det nemt for brugere at fravælge og indføre beskyttelsesforanstaltninger. såsom at fjerne identifikatorer, der kan identificere dig, for at beskytte brugernes personlige oplysninger. Vi bruger ikke vores erhvervskunders data uden deres tilladelse.
  • Vi træner nogle gange på syntetiske datasæt. Vi opretter disse ved at bede store sprogmodeller (LLM'er) om at generere specifikt anmodet output, der øger sparsomme eller begrænsede data fra den virkelige verden. Resultaterne gennemgås og filtreres derefter, også af personer, der foretager gennemgang, for at sikre, at de har tilstrækkelig kvalitet til at indgå i træningsdatasættet.
  • Vi inddrager menneskelig feedback fra AI-trænere, red teamers, medarbejdere og eksterne annoteringspartnere i vores træningsproces. Dette omfatter for eksempel menneskelig feedback, der understøtter output af høj kvalitet som svar på en brugers prompt og forbedrer slutbrugeroplevelsen. Red teamers tester også modellen mod skadelige eller usikre anmodninger, og deres feedback bruges til at forbedre modellens sikkerhedsadfærd.
Sammen med vores egne Microsoft-modeller integrerer vi forskellige andre modeller, herunder fra OpenAI, i vores produkter og tjenester. Få mere at vide om, hvordan OpenAI træner modeller.

For en gavnlig og inkluderende AI ønsker nogle webudgivere og indholdsindehavere mere indflydelse på, hvordan deres indhold bruges. Kontroller for webudgivere er nyttige, men er ikke den komplette løsning. Vi arbejder sammen med andre i branchen, forlagsbranchen, standardiseringsorganer og indholdscommunityet for at identificere en fælles tilgang, som vi alle kan videreudvikle og tage i brug.
Person står indendørs og bruger en bærbar computer i et lyst kontormiljø.

Ansvarlig AI med Microsoft

Udforsk de værktøjer, praksisser og politikker, vi har oprettet for at opretholde vores principper for ansvarlig AI.

Flere ressourcer

Tre personer gennemgår indhold sammen på en bærbar computer i en dagligstue.

Rapport om gennemsigtighed for ansvarlig AI

Få mere at vide om, hvordan vi bygger AI ansvarligt, støtter vores kunder, udvikler os og vokser.
To personer sidder ved et bord og bruger bærbare computere under en diskussion.

Gennemsigtighed og kontrol i brugen af forbrugerdata

Styr, hvordan Copilot lærer af dine data.
Person holder en tablet med søjlediagrammer og analyser.

At fremme åbne data

Udnyt fordelene ved mere åbne og tilgængelige data.

Følg Microsoft

Dansk (Danmark) Beskyttelse af personlige oplysninger om forbrugernes sundhed Kontakt Microsoft Beskyttelse af personlige oplysninger Administrer cookies Copyright & rettigheder Varemærker Om vores annoncer EU Compliance DoCs