This is the Trace Id: 8d7d8f108ebb259c5e83e0c825194c69
דלג לתוכן הראשי מבט כולל עקרונות וגישה דוחות שקיפות כלים ונהלים ‏AI אחראי ב- Azure נתונים לאימון AI יוזמת עתיד מאובטח דוח התקדמות SFI סקירה כללית על Patterns and Practices אפס אמון מבט כולל על פרטיות מבט כולל על ניהול נתונים גישה לנתונים מיקום נתונים גבול הנתונים של האיחוד האירופי GDPR מבט כולל על תאימות הצעות תאימות תקנות תאימות DORA חוק ה- AI של ה-EU חוסן דיגיטלי אירופאי תאימות NIS2 תאימות אזורית ומדינתית נגישות מוצרים ושירותים הצעות תאימות ניקוד תאימות דוחות ביקורת משאבי הגנה על נתונים האבטחה של Microsoft Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 בינה מלאכותית ב-Microsoft Azure Space מציאות משולבת Microsoft HoloLens Microsoft Viva מחשוב קוונטי חינוך כלי רכב שירותים פיננסיים ממשל שירותי בריאות ייצור קמעונאות חיפוש שותף להיות שותף רשת השותפים Microsoft Marketplace חברות תוכנה בלוג Microsoft Advertising מרכז מפתחים תיעוד אירועים רישוי Microsoft Learn המחקר של Microsoft הצג את מפת האתר

נתונים לפיתוח מודל AI

סיור בגישה שלנו לנתונים לצורך אימון מודלי AI גנרטיביים.
שני אנשים יושבים ליד שולחן, מעיינים בתוכן בטאבלט, כשלצידם כוס קפה.
אמון ושקיפות הם בלב האופן שבו אנחנו, כאן ב- Microsoft, ניגשים לנתונים לאימון מודלי AI.

המטרה של דף זה היא לשתף את הגישה שלנו, ולהציג את קטגוריות הנתונים שבהן אנחנו משתמשים לצורך אימון, ואת מה שאנחנו עושים כדי לתת למפרסמי אתרים וליוצרי תוכן שליטה על האופן שבו התוכן שלהם משמש לאימון המודלים האלה.

מה המשמעות של אימון מודל AI?

מודלי AI מבצעים תחזיות על סמך נתונים. במהלך תהליך האימון, מודל AI מזהה דפוסים, קשרים ומושגים מתוך כמויות עצומות של נתונים, ולאחר מכן משתמש במה שלמד כדי ליצור תשובות לשאלות או לבקשות. אפשר לכוונן את המודל באמצעות קטגוריות שונות של נתוני אימון כדי למטב את יכולות היצירה עבור סוגים מסוימים של מידע, כמו שפה טבעית, קוד תוכנה או תמונות. אפשר גם לבסס אותו על הנתונים של ארגון מסוים - לדוגמה, בתחום תעשייה כמו חקלאות, בריאות או קמעונאות.

מודלי AI גנרטיביים לא נועדו לאחסן, לגשת או לשחזר את נתוני האימון המקוריים. במקום זאת, המודלים האלה נועדו ליצור יצירות ותוכן חדשים ובעלי ביטוי.

שני אנשים עומדים בתוך מבנה, ובוחנים לוח מחוונים במסך גדול עם תרשימים ומדדים מוצגים.

כיצד Microsoft מאמנת מודלי AI גנרטיביים על נתונים מגוונים

מערכי נתונים גדולים ומגוונים הם חלק בלתי נפרד מהיצירה של מערכות ה- AI של היום. חשוב להשתמש במגוון רחב של נתונים כדי לפתח מודלים מדויקים יותר, שמייצגים יותר תרבויות ושפות שונות, ושיודעים ללמוד ולהחיל את כל קשת הניסיון והיצירתיות האנושיים.
כפי שמצוין בכרטיסי המודל שלנו ובתיעוד אחר הזמינים באופן ציבורי, Microsoft משתמשת בקטגוריות הבאות של נתונים לאימון מודלי ה- AI הגנרטיביים שלנו באופן אחראי:
  • אנחנו מאמנים על נתונים זמינים באופן ציבורי שנבחרו בקפידה, מתוך שילוב של מערכי נתונים ל- Machine Learning בסטנדרט תעשייתי וסריקות רשת. אנחנו לא כוללים מקורות עם חומות תשלום ותוכן שמפר את המדיניות שלנו, וכאלו שבחרו לא להשתתף באימון באמצעות פקדי אינטרנט שפרסמנו. נתונים שנסרקו באינטרנט מסוננים לפי כללי בטיחות ומעובדים כדי להסיר תוכן בלתי חוקי, כולל חומר של התעללות מינית בילדים (CSAM), בהתאם לחוקים החלים ולפריטי מדיניות אחראי AI של Microsoft.

    אנחנו מכבדים תקנים כגון תגי robots.txt שמפרסמי אתרים משתמשים בהם כדי לבחור שלא להשתתף בסריקת רשת. אנחנו לא משתמשים בנתונים מתחומים שמופיעים ברשימת השווקים הידועים לשמצה בדיגום ובפיראטיות (Notorious Markets for Counterfeiting and Piracy) של נציבות הסחר של ארצות הברית (Office of the United States Trade Representative (USTR)).
  • אלה נתוני אימון שאנחנו מקבלים באמצעות הסכמים מוסכמים, למשל עם מפרסמים ובעלי זכויות יוצרים.
  • הנתונים האלה נאספים משירותי צרכנים נבחרים של Microsoft ומוגנים בהתאם להצהרת הפרטיות של Microsoft שלנו. הבלוג של Microsoft Copilot ושאלות ותשובות בנושא Copilot מסבירים כיצד אנחנו משתמשים בנתוני צרכנים מ- Copilot,‏ Bing ו- Microsoft Start (MSN) כדי לעזור לאמן את המודלים שלנו ב- Copilot. אנחנו מקלים על משתמשים לבטל את ההצטרפות, ומיישמים אמצעי הגנה כמו הסרת מזהים שעשויים לזהות אותך כדי להגן על פרטיות המשתמשים. אנחנו לא משתמשים בנתונים של הלקוחות הארגוניים שלנו בלי הרשאה שלהם.
  • לעתים אנחנו מאמנים על ערכות נתונים סינתטיות. את אלה אנחנו יוצרים על-ידי הנחיה של מודלי שפה גדולים (LLMs) לייצר פלט מבוקש במיוחד שמרחיב נתונים מהעולם האמיתי שהם נדירים או מוגבלים. לאחר מכן התוצאות נבדקות ומסוננות, כולל על-ידי בודקים אנושיים, כדי לוודא שהן באיכות מספקת כדי להיות חלק ממערך נתוני האימון.
  • אנחנו משלבים במשימת האימון שלנו משוב אנושי ממאמני AI, מחברי צוות אדום, מעובדים ומשותפי ביאור חיצוניים. זה כולל, למשל, משוב אנושי שמחזק פלט איכותי בתגובה לבקשת משתמש, ומשפר את חוויית משתמש הקצה. גם חברי צוות אדום בודקים את המודל מול בקשות מזיקות או לא בטוחות, והמשוב שלהם משמש לשיפור התנהגויות הבטיחות של המודל.
לצד המודלים שלנו של Microsoft, אנחנו משלבים במוצרים ובשירותים שלנו מודלים שונים נוספים, כולל מ- OpenAI. מידע נוסף על האופן שבו OpenAI מאמנת מודלים.

כדי לקדם AI מועיל וכוללני, חלק ממפרסמי האתרים ובעלי התוכן רוצים יותר השפעה על האופן שבו התוכן שלהם משמש. פקדים של מפרסמי אתרים עוזרים, אבל הם לא הפתרון המלא. אנחנו עובדים לצד אחרים בתעשייה, בגופים מפרסמים, בגופי תקינה ובקהילת התוכן כדי לזהות גישה משותפת שכולנו יכולים לקדם ולאמץ.
אדם עומד בתוך מבנה ומשתמש במחשב נישא בסביבה מוארת של משרד.

אחראי AI ב- Microsoft

גלה את הכלים, שיטת העבודה והמדיניות שיצרנו כדי לקיים את עקרונות הבינה המלאכותית האחראית שלנו.

משאבים נוספים

שלושה אנשים בודקים יחד תוכן במחשב נישא בסביבה של סלון.

דוח שקיפות בנושא AI אחראי

איך אנחנו בונים AI באחריות, תומכים בלקוחות שלנו, מתפתחים וגדלים.
שני אנשים יושבים ליד שולחן ומשתמשים במחשבים נישאים במהלך דיון.

שקיפות ושליטה בשימוש בנתוני צרכנים

כיצד Copilot לומד מהנתונים שלך.
אדם מחזיק טאבלט שמציג תרשימי עמודות וניתוח נתונים.

קידום נתונים פתוחים

מימוש היתרונות של נתונים פתוחים ונגישים יותר.

עקוב אחר Microsoft

עברית (ישראל) פרטיות בריאות הצרכן צור קשר עם Microsoft פרטיות ניהול קבצי Cookie תנאי השימוש סימנים מסחריים אודות הפרסומות שלנו נגישות