This is the Trace Id: 3e9f6c2326982796491514ad76a7e872

AI 模型開發的資料

探索我們對生成式 AI 模型訓練資料的處理方式。
兩個人坐在桌旁查看平板電腦上的內容,旁邊放著一杯咖啡。
信任與透明度是 Microsoft 在處理 AI 模型訓練資料時所秉持的核心原則。

此頁面的目的在分享我們的做法,說明我們用於訓練的資料類別,以及我們如何讓網站發佈者與內容創作者掌控其內容如何用於訓練這些模型。

訓練 AI 模型是什麼意思?

AI 模型會根據資料進行預測。在訓練過程中,AI 模型會辨識大量資料中的模式、關聯性和概念,接著運用所學,為問題或要求產生答案。模型可以使用不同類別的訓練資料來進行調整,以最佳化特定類型資訊的生成能力,例如自然語言、軟體程式碼或影像。它也可以使用組織自己的資料進行基礎設置,例如在農業、醫療或零售等產業領域。

生成式 AI 模型並非設計來儲存、存取或重現原始訓練資料。相反地,這些模型的用途是產生全新的表達性作品與內容。

兩個人站在室內,一起查看大型螢幕上的儀表板,畫面顯示圖表與各項指標。

了解 Microsoft 如何以多樣化資料訓練生成式 AI 模型

大型且多樣化的資料集,是建立現今 AI 系統不可或缺的一環。使用廣泛且多元的資料,對於開發更準確、更能代表不同文化與語言的模型至關重要,也能讓模型學習並應用人類經驗與創意的完整範疇。
如我們的模型卡及其他公開文件所述,Microsoft 會負責任地取得以下類別的資料,用於訓練我們的生成式 AI 模型:
  • 我們會使用部分公開可取得的資料進行訓練,資料來源包括業界標準的機器學習資料集以及網路耙梳取得的資料。我們會排除設有付費牆的來源、違反我們原則的內容,以及透過我們發佈的網頁控制項選擇退出訓練的內容。透過網路耙梳的資料會經過安全性篩選及處理,以移除包括兒童性虐待材料 (CSAM) 在內的非法內容,並遵循適用法律及 Microsoft 的負責任 AI 原則。

    我們會遵循網站發佈者用於選擇退出網路耙梳的 robots.txt 標籤等標準。我們不會使用列於美國貿易代表署 (USTR)「仿冒及盜版惡名市場名單」中的網域資料。
  • 這是我們透過與出版商及著作權所有者等協商所達成的合作安排而取得的訓練資料。
  • 這些資料取自 Microsoft 精選的消費者服務,並依照 Microsoft 隱私權聲明受到保護。我們的 Microsoft Copilot 部落格Copilot 常見問題集說明了我們如何使用 Copilot、Bing 和 Microsoft Start (MSN)的消費者資料,協助訓練 Copilot 中的模型。我們讓使用者可以輕鬆選擇退出,並採取例如移除可能識別您身分的識別資訊等防護措施,以保護使用者隱私。 我們不會在未經企業客戶許可的情況下使用其資料。
  • 我們有時也會使用合成資料集進行訓練。這些資料集是透過提示大型語言模型 (LLM) 讓其產生特定要求的輸出,以補足稀缺或有限的現實世界資料。接著會對這些結果進行審查與篩選,包括由人工審查人員進行檢視,以確保其品質足以納入訓練資料集。
  • 我們會在訓練過程中納入來自 AI 訓練人員、紅隊成員、員工及外部標註合作夥伴的人類意見反應。例如,這包括強化針對使用者提示所產生之高品質輸出的人類意見反應,以改善使用者體驗。紅隊成員也會針對有害或不安全的要求測試模型,並利用他們的意見反應來改善模型的安全性行為。
除了我們自有的 Microsoft 模型之外,我們也會在產品與服務中整合包括 OpenAI 模型在內的各種其他模型。深入了解 OpenAI 如何訓練模型

為了打造有益且具包容性的 AI,部分網站發佈者和內容擁有者希望能更有自主權,決定其內容的使用方式。網站發佈者控制項雖然有幫助,但並不是完整的解決方案。我們正與業界、出版界、標準制定機構及內容社群中的其他夥伴合作,共同制定一套大家都能推動並採用的通用方法。
一個人站在明亮的辦公室環境中使用膝上型電腦。

Microsoft 的負責任 AI

探索我們為落實負責任 AI 原則所建立的工具、做法與原則。

更多資源

三個人在客廳環境中一起查看膝上型電腦上的內容。

負責任 AI 透明度報告

了解我們如何負責任地建置 AI、支援客戶、持續演進並成長。
兩個人坐在桌邊,在討論過程中使用膝上型電腦。

消費者資料使用的透明度與控制措施

控制 Copilot 如何從您的資料中學習。
一名手持平板電腦的人士,平板上顯示長條圖與分析資料。

推動開放資料

體驗更開放且更易於存取資料所帶來的優勢。

關注 Microsoft