This is the Trace Id: a23c86bb88583b65451a7e97a8883458
Przejdź do głównej zawartości Omówienie Reguły i podejście Raporty dotyczące transparentności Narzędzia i rozwiązania Odpowiedzialna sztuczna inteligencja na platformie Azure Dane na potrzeby trenowania AI Inicjatywa na rzecz Bezpiecznej Przyszłości Raport z postępów Inicjatywy na rzecz Bezpiecznej Przyszłości (SFI) Omówienie inicjatywy Patterns and Practices Zero Trust Ochrona prywatności — omówienie Zarządzanie danymi — omówienie Dostęp do danych Lokalizacja danych EU Data Boundary (Granica danych w UE) RODO Zgodność — omówienie Oferta rozwiązań do zapewniania zgodności Przepisy Zgodność z wymogami DORA Ustawa UE o AI Europejskie Rozporządzenie o Operacyjnej Odporności Cyfrowej Zgodność z dyrektywą NIS2 Zgodność na poziomie regionalnym i krajowym Ułatwienia dostępu Produkty i usługi Oferta rozwiązań do zapewniania zgodności Wskaźnik zgodności Raporty z inspekcji Zasoby ochrony danych Rozwiązania zabezpieczające firmy Microsoft Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Rzeczywistość mieszana Microsoft HoloLens Microsoft Viva Obliczenia kwantowe Edukacja Motoryzacja Usługi finansowe Administracja publiczna Opieka zdrowotna Produkcja Handel detaliczny Znajdź partnera Zostań partnerem Sieć partnerów Microsoft Marketplace Firmy oprogramowania Blog Microsoft Advertising Centrum deweloperów Dokumentacja Wydarzenia Licencje Microsoft Learn Microsoft Research Wyświetl mapę witryny

Dane na potrzeby opracowywania modelu sztucznej inteligencji

Zapoznaj się z naszym podejściem do danych wykorzystywanych do trenowania modeli generatywnej AI.
Dwie osoby siedzące przy stole i przeglądające treści na tablecie, a obok nich stoi filiżanka kawy.
Zaufanie i przejrzystość stanowią podstawę naszego podejścia do danych wykorzystywanych do trenowania modeli sztucznej inteligencji w firmie Microsoft.

Celem tej strony jest przedstawienie naszego podejścia, z uwzględnieniem kategorii danych wykorzystywanych przez nas do szkolenia modeli oraz działań, jakie podejmujemy, aby zapewnić wydawcom internetowym i twórcom treści kontrolę nad sposobem wykorzystywania ich treści do szkolenia tych modeli.

Co oznacza trenowanie modelu sztucznej inteligencji?

Modele sztucznej inteligencji formułują prognozy na podstawie danych. W trakcie procesu trenowania modelu sztucznej inteligencji model ten rozpoznaje wzorce, zależności i pojęcia w ogromnych zbiorach danych, a następnie wykorzystuje zdobytą wiedzę do generowania odpowiedzi na pytania lub żądania. Model można dostosować przy użyciu różnych kategorii danych szkoleniowych w celu optymalizacji możliwości generowania określonych rodzajów informacji, takich jak język naturalny, kod oprogramowania lub obrazy. Można to również oprzeć na danych pochodzących z danej organizacji — na przykład w konkretnej branży, takiej jak rolnictwo, opieka zdrowotna czy handel detaliczny.

Modele generatywnej AI nie są zaprojektowane do przechowywania, uzyskiwania dostępu ani odtwarzania oryginalnych danych szkoleniowych. Zamiast tego te modele są przeznaczone do generowania nowych wyrazistych dzieł i treści.

Dwie osoby stojące w pomieszczeniu, przeglądające pulpit na dużym monitorze, na którym wyświetlane są wykresy i metryki.

Dowiedz się, w jaki sposób firma Microsoft trenuje modele generatywnej AI na zróżnicowanych danych

Duże i zróżnicowane zbiory danych stanowią nieodłączny element tworzenia współczesnych systemów sztucznej inteligencji. Niezwykle ważne jest, aby do tworzenia modeli wykorzystywać szeroki wachlarz danych, dzięki czemu modele te będą dokładniejsze, lepiej odzwierciedlały różnorodność kultur i języków oraz będą w stanie przyswajać i wykorzystywać pełne spektrum ludzkich doświadczeń i pomysłowości.
Jak wskazano w naszych kartach modelowych oraz innych publicznie dostępnych materiałach, firma Microsoft pozyskuje w sposób odpowiedzialny następujące kategorie danych do szkolenia naszych modeli generatywnej AI:
  • Trenujemy modele na wybranych, publicznie dostępnych danych, pochodzących zarówno ze standardowych w branży zbiorów danych do uczenia maszynowego, jak i z wyników indeksowania witryn internetowych. Wykluczamy źródła z płatnym dostępem oraz treści naruszające nasze zasady, a także te, które zrezygnowały z udziału w procesie szkolenia za pomocą opublikowanych przez nas narzędzi do kontroli witryn internetowych. Dane zebrane w ramach indeksowania witryn internetowych są poddawane filtrowaniu pod kątem bezpieczeństwa oraz przetwarzane w celu usunięcia treści niezgodnych z prawem, w tym materiałów przedstawiających przemoc seksualną wobec dzieci (CSAM), zgodnie z obowiązującymi przepisami prawa oraz zasadami firmy Microsoft dotyczącymi odpowiedzialnej sztucznej inteligencji.

    Przestrzegamy standardów, takich jak pliki robots.txt, których wydawcy witryn internetowych używają, aby zablokować indeksowanie swoich stron. Nie korzystamy z danych pochodzących z domen wymienionych na liście „Notorious Markets for Counterfeiting and Piracy” (Rynki znane z podrabiania i piractwa) sporządzonej przez Biuro Przedstawiciela Handlowego Stanów Zjednoczonych (USTR).
  • To dane treningowe, do których uzyskujemy dostęp na podstawie uzgodnionych warunków, np. z wydawcami i właścicielami praw autorskich.
  • Te dane są zbierane z wybranych usług konsumenckich firmy Microsoft i chronione zgodnie z zasadami Oświadczenia o ochronie prywatności firmy Microsoft. Na naszym blogu poświęconym usłudze Microsoft Copilot oraz w sekcji Często zadawane pytania dotyczące usługi Copilot wyjaśniamy, w jaki sposób wykorzystujemy dane użytkowników pochodzące z usług Copilot, Bing i Microsoft Start (MSN) do szkolenia naszych modeli w ramach usługi Copilot. Ułatwiamy użytkownikom rezygnację z usług oraz wprowadzamy środki zabezpieczające, takie jak usuwanie identyfikatorów, które mogłyby umożliwić identyfikację użytkownika, w celu ochrony prywatności użytkowników. Nie używamy danych naszych klientów korporacyjnych bez ich zgody.
  • Czasami trenujemy na syntetycznych zestawach danych. Tworzymy je, zlecając dużym modelom językowym (LLM) generowanie konkretnie zleconych wyników, które uzupełniają rzadkie lub ograniczone dane ze świata rzeczywistego. Wyniki są następnie weryfikowane i filtrowane, w tym przez recenzentów, aby zapewnić, że są one wystarczającej jakości, by mogły zostać włączone do zbioru danych trenowania.
  • W naszym procesie treningowym uwzględniamy opinie ludzi – trenerów AI, członków zespołów „red team”, pracowników oraz zewnętrznych partnerów zajmujących się adnotacją. Obejmuje to na przykład informacje zwrotne od ludzi, które przyczyniają się do poprawy jakości wyników generowanych w odpowiedzi na polecenie użytkownika, co z kolei poprawia komfort użytkowania. Członkowie zespołu „red team” testują również model pod kątem szkodliwych lub niebezpiecznych żądań, a ich uwagi są wykorzystywane do ulepszania zachowań modelu związanych z bezpieczeństwem.
Oprócz naszych własnych modeli firmy Microsoft wykorzystujemy w naszych produktach i usługach również różne inne modele, w tym modele opracowane przez firmę OpenAI. Dowiedz się więcej o tym, jak firma OpenAI trenuje modele.

Aby sztuczna inteligencja przynosiła korzyści i była otwarta dla wszystkich, niektórzy wydawcy witryn internetowych i właściciele treści domagają się większego wpływu na sposób wykorzystywania ich treści. Kontrolki wydawcy witryn internetowych są pomocne, ale nie są kompletnym rozwiązaniem. Współpracujemy z innymi podmiotami z branży, wydawnictwami, organizacjami normalizacyjnymi oraz społecznością twórców treści, aby wypracować wspólne podejście, które wszyscy będziemy mogli rozwijać i wdrażać.
Osoba stojąca w pomieszczeniu i korzystająca z laptopa w jasnym biurze.

Odpowiedzialna sztuczna inteligencja w firmie Microsoft

Zapoznaj się z narzędziami, praktykami i zasadami, które opracowaliśmy w celu przestrzegania naszych zasad odpowiedzialnego wykorzystania sztucznej inteligencji.

Więcej zasobów

Trzy osoby przeglądające razem treści na laptopie w salonie.

Raport dotyczący jawności odpowiedzialnej sztucznej inteligencji

Dowiedz się, jak w odpowiedzialny sposób tworzymy rozwiązania oparte na sztucznej inteligencji, wspieramy naszych klientów, rozwijamy się i osiągamy wzrost.
Dwie osoby siedzące przy stole i korzystające z laptopów podczas dyskusji.

Przezroczystość i kontrola w korzystaniu z danych konsumenta

Kontroluj sposób, w jaki funkcja Copilot uczy się na podstawie Twoich danych.
Osoba trzymająca tablet wyświetlający wykresy słupkowe i analizy.

Rozwój otwartej bazy danych

Wykorzystaj zalety bardziej otwartych i dostępnych danych.

Obserwuj firmę Microsoft

Polski (Polska) Zasady prywatności dotyczące zdrowia użytkowników Skontaktuj się z Microsoft Ochrona prywatności Zarządzaj plikami cookie Zasady użytkowania Znaki towarowe Informacje o naszych reklamach EU Compliance DoCs