This is the Trace Id: 422d120d63c488d84ad3604a6c860825
Pāriet uz galveno saturu Pārskats Principi & Pieeja Caurspīdīguma ziņojumi Rīki un prakse Atbildīga mākslīgā intelekta izmantošana Azure platformā Dati AI apmācībai Drošas nākotnes iniciatīva SFI izpildes pārskats Patterns and Practices pārskats Nulles uzticamība Konfidencialitātes pārskats Datu pārvaldības pārskats Piekļuve datiem Datu atrašanās vieta ES datu robeža Vispārīgā datu aizsardzības regula Atbilstības pārskats Atbilstības piedāvājumi Regulas DORA atbilstība ES Likums par mākslīgo intelektu Eiropas digitālās darbības noturība NIS2 atbilstība Atbilstība reģionālajiem un valsts likumiem Pieejamība Produkti un pakalpojumi Atbilstības piedāvājumi Atbilstības vērtējums Audita atskaites Datu aizsardzības resursi Microsoft drošība Azure Dynamics 365 Azure Microsoft Teams Windows 365 Microsoft AI Azure Space Jauktā realitāte Microsoft HoloLens Microsoft Viva Kvantu skaitļošana Izglītība Automobiļi Finanšu pakalpojumi Valsts Veselības aprūpe Ražošana Mazumtirdzniecība Atrast partneri Kā kļūt par partneri Partneru tīkls Microsoft Marketplace Programmatūras uzņēmumi Emuārs Microsoft Advertising Izstrādātāju centrs Dokumentācija Pasākumi Licencēšana Microsoft Learn Microsoft Research Skatīt vietnes karti

Dati AI modeļa izstrādei

Izpētiet mūsu pieeju datiem ģeneratīvo AI modeļu apmācībai.
Divi cilvēki sēž pie galda un pārskata saturu planšetdatorā, netālu atrodas kafijas krūze.
Uzticēšanās un pārredzamība ir pamatā mūsu pieejai datiem AI modeļu apmācībai šeit, Microsoft.

Šīs lapas mērķis ir dalīties ar mūsu pieeju, izklāstot datu kategorijas, ko izmantojam apmācībai, un to, ko darām, lai tīmekļa izdevējiem un satura veidotājiem dotu kontroli pār to, kā viņu saturs tiek izmantots šo modeļu apmācībai.

Ko nozīmē apmācīt AI modeli?

AI modeļi veic prognozes, pamatojoties uz datiem. Apmācības procesā AI modelis identificē modeļus, korelācijas un jēdzienus lielos datu apjomos un pēc tam izmanto apgūto, lai ģenerētu atbildes uz jautājumiem vai pieprasījumiem. Modeli var pielāgot, izmantojot dažādas apmācības datu kategorijas, lai optimizētu ģenerēšanas iespējas konkrētām informācijas klasēm, piemēram, dabiskajai valodai, programmatūras kodam vai attēliem. To var arī balstīt organizācijas datos — piemēram, nozarēs, piemēram, lauksaimniecībā, veselības aprūpē vai mazumtirdzniecībā.

Ģeneratīvā AI modeļi nav paredzēti sākotnējo apmācības datu glabāšanai, piekļuvei tiem vai to reproducēšanai. Tā vietā šie modeļi ir paredzēti jaunu izteiksmes darbu un satura ģenerēšanai.

Divi cilvēki stāv telpās un pārskata informācijas paneli lielā monitorā, kurā redzamas diagrammas un metrikas.

Uzziniet, kā Microsoft apmāca ģeneratīvā AI modeļus, izmantojot daudzveidīgus datus

Lieli un daudzveidīgi datu kopumi ir neatņemama mūsdienu AI sistēmu izveides sastāvdaļa. Ir ļoti svarīgi izmantot plašu datu daudzveidību, lai izstrādātu modeļus, kas ir precīzāki, reprezentē dažādas kultūras un valodas un apgūst un pielieto visu cilvēku pieredzes un radošuma spektru.
Kā norādīts mūsu modeļu kartītēs un citā publiski pieejamā dokumentācijā, Microsoft atbildīgi izmanto šādas datu kategorijas, lai apmācītu mūsu ģeneratīvā AI modeļus:
  • Mēs apmācām, izmantojot atlasītus publiski pieejamus datus, kas iegūti no nozares standarta mašīnmācīšanās datu kopu un tīmekļa pārlūkošanas datu apvienojuma. Mēs izslēdzam avotus ar maksas sienām un saturu, kas pārkāpj mūsu politikas, kā arī tos, kas ir atteikušies no apmācības, izmantojot tīmekļa vadīklas, ko esam publicējuši. Tīmeklī pārlūkotos datus filtrē drošībai un apstrādā, lai noņemtu nelikumīgu saturu, tostarp bērnu seksuālās vardarbības materiālus (CSAM), saskaņā ar piemērojamiem tiesību aktiem un Microsoft Responsible AI politikām.

    Mēs ievērojam tādus standartus kā robots.txt tagi, ko tīmekļa izdevēji izmanto, lai atteiktos no tīmekļa pārlūkošanas. Mēs neizmantojam datus no domēniem, kas ir iekļauti Amerikas Savienoto Valstu Tirdzniecības pārstāvja biroja (USTR) bēdīgi slavenu viltošanas un pirātisma tirgu sarakstā.
  • Tie ir apmācības dati, ko iegūstam, noslēdzot vienošanās, piemēram, ar izdevējiem un autortiesību īpašniekiem.
  • Šie dati tiek vākti no atsevišķiem Microsoft patērētāju pakalpojumiem un aizsargāti saskaņā ar mūsu Microsoft paziņojumu par konfidencialitāti. Mūsu Microsoft Copilot emuārs un Copilot BUJ skaidro, kā mēs izmantojam patērētāju datus no Copilot, Bing un Microsoft Start (MSN), lai palīdzētu apmācīt mūsu modeļus programmā Copilot. Mēs atvieglojam lietotājiem atteikšanos un ieviešam aizsardzības pasākumus, piemēram, identifikatoru noņemšanu, kas varētu jūs identificēt, lai aizsargātu lietotāju konfidencialitāti. Mēs neizmantojam mūsu uzņēmuma klientu datus bez viņu atļaujas.
  • Dažreiz mēs apmācām, izmantojot sintētiskās datu kopas. Mēs tos izveidojam, aicinot lielos valodas modeļus (LLM) ģenerēt konkrēti pieprasītu izvadi, kas papildina trūcīgus vai ierobežotus reālās pasaules datus. Pēc tam rezultātus pārskata un filtrē, tostarp cilvēku recenzenti, lai nodrošinātu, ka tie ir pietiekami kvalitatīvi, lai kļūtu par daļu no apmācības datu kopas.
  • Mūsu apmācības procesā iekļaujam cilvēku atsauksmes no AI treneriem, sarkanās komandas dalībniekiem, darbiniekiem un ārējiem anotēšanas partneriem. Tas ietver, piemēram, cilvēku atsauksmes, kas pastiprina kvalitatīvu izvadi lietotāja uzvednei, uzlabojot gala lietotāja pieredzi. Sarkanās komandas dalībnieki arī testē modeli pret kaitīgiem vai nedrošiem pieprasījumiem, un viņu atsauksmes tiek izmantotas, lai uzlabotu modeļa drošības uzvedību.
Līdztekus mūsu pašu Microsoft modeļiem mēs savos produktos un pakalpojumos integrējam arī dažādus citus modeļus, tostarp no OpenAI. Papildinformācija par to, kā OpenAI apmāca modeļus.

Lai AI būtu noderīgs un iekļaujošs, daži tīmekļa izdevēji un satura īpašnieki vēlas lielāku ietekmi uz to, kā viņu saturs tiek izmantots. Tīmekļa izdevēju vadīklas ir noderīgas, taču tās nav pilnīgs risinājums. Mēs sadarbojamies ar citiem nozares pārstāvjiem, izdevējiem, standartu organizācijām un satura kopienu, lai noteiktu kopīgu pieeju, ko mēs visi varam attīstīt un pieņemt.
Persona stāv telpās un izmanto klēpjdatoru gaišā biroja vidē.

Atbildīga mākslīgā intelekta izmantošana korporācijā Microsoft

Izpētiet rīkus, praksi un politikas, ko esam izveidojuši, lai ievērotu mūsu atbildīgā AI principus.

Papildu resursi

Trīs cilvēki kopā pārskata saturu klēpjdatorā dzīvojamās istabas vidē.

Atbildīga mākslīgā intelekta izmantošanas caurspīdīguma atskaite

Uzziniet, kā mēs veidojam AI atbildīgi, atbalstām savus klientus, attīstāmies un augam.
Divi cilvēki sēž pie galda un diskusijas laikā izmanto klēpjdatorus.

Pārskatāmība un kontrole patērētāju datu izmantošanā

Pārvaldiet, kā Copilot mācās no jūsu datiem.
Cilvēks tur planšetdatoru ar stabiņu diagrammām un analīzes datiem.

Atbalsts atvērtiem datiem

Izbaudiet atvērtāku un pieejamāku datu sniegtās priekšrocības.

Sekot korporācijai Microsoft

Latviešu (Latvija) Patērētāju veselības konfidencialitāte Sazināties ar Microsoft Konfidencialitāte Pārvaldīt sīkfailus Izmantošanas noteikumi Prečzīmes Par mūsu reklāmām EU Compliance DoCs