本页旨在介绍我们的做法,概述我们用于训练的数据类别,以及我们为让 Web 发布者和内容创作者控制其内容如何用于训练这些模型所做的工作。
训练 AI 模型意味着什么?
AI 模型基于数据进行预测。在训练过程中,AI 模型在海量数据中识别模式、相关性和概念,然后使用所学知识生成问题或请求的答案。可使用不同类别的训练数据对模型进行调整,优化针对特定信息类别(例如自然语言、软件代码或图像)的生成能力。它也可基于组织自己的数据,例如在农业、健康或零售等垂直行业中。
生成式 AI 模型并非为存储、访问或复制原始训练数据而设计。相反,这些模型旨在生成新的表达性作品和内容。
了解 Microsoft 如何使用多样化数据训练生成式 AI 模型
大型且多样化的数据集是创建当今 AI 系统不可或缺的一部分。使用广泛多样化的数据至关重要,这样才能开发出更准确、更能代表不同文化和语言的模型,并让模型学习和应用人类经验和智慧的方方面面。
正如我们的模型卡和其他公开文档中所述,Microsoft 负责任地获取以下类别的数据用于训练我们的生成式 AI 模型:
我们使用选定的公开可用数据进行训练,数据源涵盖行业标准机器学习数据集和 Web 爬取内容。我们会排除以下来源:付费墙内容、违反我们政策的内容,以及使用我们发布的 Web 控制选择退出训练的内容。我们会对 Web 爬取数据进行安全筛选和处理,根据适用法律和 Microsoft 的负责任 AI 政策,移除包括儿童性虐待内容 (CSAM) 在内的非法内容。
我们尊重 Web 发布者用于选择退出 Web 爬取的 robots.txt 标签等标准。我们不使用美国贸易代表办公室 (USTR) 假冒和盗版恶名市场名单中所列域名的数据。
这是我们通过协商安排(例如与发布者和版权所有者)获取的训练数据。
这些数据从选定的 Microsoft 消费者服务中收集,并根据我们的 Microsoft 隐私声明进行保护。我们的 Microsoft Copilot 博客和 Copilot 常见问题解答说明了我们如何使用来自 Copilot、必应和 Microsoft Start (MSN) 的消费者数据来帮助训练 Copilot 中的模型。我们让用户能够轻松选择退出,并实施保护措施,例如移除可能识别你身份的标识符来保护用户隐私。 未经企业客户许可,我们不会使用其数据。