This is the Trace Id: 34c236ce0a3604a38a2cc628d6cb01b6
Põhisisu juurde Ülevaade Põhimõtted ja lähenemine Läbipaistvuse aruanded Tööriistad ja tavad Vastutustundlik tehisintellekt Azure’is Andmed tehisintellekti treenimiseks Turvalise tuleviku algatus SFI edenemise aruanne Arendusnäidiste ja -nõuannete ülevaade Täisusaldamatus Privaatsuse ülevaade Andmehalduse ülevaade Juurdepääs andmetele Andmeasukoht EL-i andmepiir Isikuandmete kaitse üldmäärus Nõuetele vastavuse ülevaade Nõuetele vastavuse pakkumised Määrused Vastavus DORA-le EL-i tehisintellekti käsitlev määrus Euroopa digitaalne vastupanuvõime Vastavus NIS2-le Vastavus regionaalsetele ja riiklikele nõuetele Hõlbustusfunktsioonid Tooted ja teenused Nõuetele vastavuse pakkumised Vastavusskoor Auditi aruanded Andmekaitseressursid Microsofti turve Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Hübriidreaalsus Microsoft HoloLens Microsoft Viva Kvantarvuti Haridus Autotööstus Finantsteenused Riigiasutused Tervishoid Tootmine Jaemüük Partneri otsimine Saage partneriks Partnervõrgustik Microsoft Marketplace Tarkvaraettevõtted Ajaveeb Microsoft Advertising Arenduskeskus Dokumentatsioon Sündmused Litsentseerimine Microsoft Learn Microsoft Research Kuva saidikaart

Tehisintellekti mudeli arendamise andmed

Tutvuge meie genereeriva tehisintellekti mudelite treenimiseks kasutatavate andmete lahendusega.
Kaks inimest istuvad laua taga ja vaatavad tahvelarvutis sisu ning nende lähedal on kohvitass.
Microsofti tehisintellekti mudelite treenimiseks kasutatavatele andmete lahenduse keskmes on usaldus ja läbipaistvus.

Selle lehe eesmärk on jagada meie lahendust, kirjeldades eri kategooria andmeid, mida treenimiseks kasutame, ning seda, mida me teeme, et anda veebiväljaandjatele ja sisuloojatele kontroll selle üle, kuidas nende sisu mudelite treenimiseks kasutatakse.

Mida tähendab tehisintellekti mudeli treenimine?

Tehisintellekti mudelid teevad ennustusi andmete põhjal. Treenimise ajal tuvastab tehisintellekti mudel mustreid, seoseid ja kontseptsioone suurel hulgal andmetest ning kasutab seejärel õpitut küsimustele või päringutele vastuste genereerimiseks. Mudelit saab häälestada eri kategooria treeningandmete abil, et optimeerida genereerimisvõimalusi kindlate teabeklasside jaoks, nagu loomulik keel, tarkvarakood või pildid. Seda saab siduda ka organisatsiooni enda andmetega – näiteks kindlas valdkonnas, nagu põllumajandus, tervishoid või jaemüük.

Genereeriva tehisintellekti mudelid pole mõeldud algsete treeningandmete talletamiseks, kasutamiseks või taastootmiseks. Selle asemel on nende mudelite eesmärk genereerida uusi väljendusrikkaid teoseid ja sisu.

Kaks inimest seisavad siseruumis ja vaatavad suurt monitori, mille ekraanil on kuvatud diagrammid ja näitajad.

Uurige, kuidas Microsoft treenib genereeriva tehisintellekti mudeleid mitmekesiste andmete põhjal

Suured ja mitmekesised andmekogumid on tänapäevaste tehisintellektisüsteemide loomisel hädavajalikud. On ülioluline, et mudelite arendamiseks kasutataks laia valikut andmeid, et need oleksid täpsemad, esindaksid paremini erinevaid kultuure ja keeli ning õpiksid tundma ja rakendama kogu inimeseks olemise kogemust ja leidlikkust.
Nagu on märgitud meie mudelikaartidel ja muudes avalikult kättesaadavates dokumentides, hangib Microsoft genereeriva tehisintellekti mudelite vastutustundlikuks treenimiseks järgmise kategooria andmeid.
  • Treenime valitud avalikult kättesaadavate andmete põhjal, mis pärinevad valdkonnastandarditele vastavatest masinõppe andmekomplektidest ja veebianalüüsidest. Jätame välja allikad, millel on maksumüür ja sisu, mis rikub meie poliitikaid, ning need, kus on meie avaldatud veebipõhiste juhtelementide abil treenimisest loobutud. Veebist kogutud andmeid filtreeritakse ohutuse tagamiseks ja töödeldakse, et eemaldada ebaseaduslik sisu, sealhulgas laste seksuaalset kuritarvitamist kujutav materjal (CSAM) kohaldatavate õigusaktide ja Microsofti vastutustundliku tehisintellekti poliitikate järgi.

    Järgime standardeid, nagu robots.txt sildid, mida veebiväljaandjad kasutavad veebianalüüsist loobumiseks. Me ei kasuta andmeid, mis on pärit domeenidelt, mis on loetletud Ameerika Ühendriikide kaubandusesindaja ameti (USTR) võltsimise ja piraatluse suhtes kurikuulsate turgude nimekirjas.
  • Need on treeningandmed, millele meil on juurdepääs läbiräägitud kokkulepete alusel näiteks väljaandjate ja autoriõiguste omanikega.
  • Neid andmeid kogutakse valitud Microsofti tarbijateenustest ja kaitstakse meie Microsofti privaatsusavalduse alusel. Meie Microsoft Copiloti ajaveebis ja Copiloti KKK-s on selgitatud, kuidas me kasutame Copiloti, Bingi ja Microsoft Starti (MSN) tarbijaandmeid, et aidata treenida meie mudeleid Copilotis. Teeme kasutajatele loobumise lihtsaks ja võtame kaitsemeetmeid, näiteks eemaldame tunnused, mille alusel võidakse teid tuvastada, et kaitsta kasutaja privaatsust. Me ei kasuta oma suurettevõteklientide andmeid ilma nende loata.
  • Mõnikord treenime tehisandmekomplektide põhjal. Neid loome nii, et anname suurtele keelemudelitele (LLM-idele) käsu genereerida konkreetselt soovitud väljundi, mis täiendab nappi või piiratud pärismaailmaandmeid. Seejärel vaadatakse tulemused läbi ja filtreeritakse, sealhulgas inimhindajate poolt, et tagada nende piisav kvaliteet treeningandmestiku osaks saamiseks.
  • Me kaasame oma treeningusse tehisintellekti treenijate, simuleeritud vastaste, töötajate ja väliste märgete tegijate inimtagasisidet. See hõlmab näiteks inimtagasisidet, mis tugevdab kasutaja päringule vastavat kvaliteetset väljundit ja parandab lõppkasutuskogemust. Simuleeritud vastased testivad mudelit ka kahjulike või ebaturvaliste päringute suhtes ning nende tagasisidet kasutatakse mudeli ohutu käitumise parandamiseks.
Lisaks meie enda Microsofti mudelitele integreerime oma toodetesse ja teenustesse ka mitmesuguseid muid mudeleid, sealhulgas OpenAI omi. Lisateave selle kohta, kuidas OpenAI mudeleid treenib.

Mõned veebiväljaandjad ja sisuomanikud soovivad kasuliku ja kaasava tehisintellekti toetamiseks suuremat sõnaõigust selle üle, kuidas nende sisu kasutatakse. Veebiväljaandjate juhtelemendid on kasulikud, aga need pole täislahendus. Teeme koostööd teiste valdkonnategijatega, kirjastajatega, standardiorganitega ja sisukogukonnaga, et teha kindlaks ühine lähenemine, mida saame kõik toetada ja kasutada.
Inimene seisab siseruumis ja kasutab heledas kontoris sülearvutit.

Vastutustundlik TI Microsoftis

Uurige tööriistu, tavasid ja poliitikaid, mille oleme loonud, et järgida oma vastutustundliku tehisintellekti põhimõtteid.

Veel ressursse

Kolm inimest vaatavad elutoas koos sülearvutis sisu.

Vastutustundliku tehisintellekti läbipaistvuse aruanne

Saate teada, kuidas me kujundame vastutustundlikku tehisintellekti, toetame oma kliente, areneme ja kasvame.
Kaks inimest istuvad laua taga, arutavad midagi ja kasutavad sülearvuteid.

Läbipaistvus ja järelvalve tarbijaandmete kasutamisel

Teil on järelvalve selle üle, kuidas Copilot teie andmetest õpib.
Inimene hoiab käes tahvelarvutit, mille ekraanil on kuvatud tulpdiagrammid ja analüüsiteave.

Avatud andmete edendamine

Saage kasu paremini avatud ja kergemini kättesaadavast andmetest.

Jälgige Microsofti

Eesti (Eesti) Tarbijaseisundi privaatsus Võtke Microsoftiga ühendust Privaatsus Halda küpsiseid Kasutustingimused Kaubamärgid Reklaamide kohta EU Compliance DoCs