This is the Trace Id: 9287dae76f0db01c78119f57f8e3cb3f
Перейти к основному контенту Обзор Принципы и подход Отчет о прозрачности Инструменты и методики Ответственное применение ИИ в Azure Данные для обучения ИИ Инициатива «Безопасное будущее» Отчет о ходе работы инициативы "Безопасное будущее" Обзор инициативы "Patterns and Practices" Модель "Никому не доверяй" Обзор конфиденциальности Обзор управления данными Доступ к данным Расположение данных Обработка данных в границах ЕС GDPR Обзор соответствия требованиям Предложения для соответствия требованиям Нормативы Соответствие требованиям DORA Закон ЕС об ИИ Европейская цифровая устойчивость Соответствие требованиям NIS2 Соответствие региональным требованиям Специальные возможности Продукты и услуги Предложения для соответствия требованиям Рейтинг соответствия требованиям Отчеты по аудиту Ресурсы о защите данных Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 ИИ от Майкрософт Azure Space Смешанная реальность Microsoft HoloLens Microsoft Viva Квантовые вычисления Образование: Автомобили Финансовые услуги Государственный сектор Здравоохранение Производство Розничная торговля Найти партнера Стать партнером Партнерская сеть Microsoft Marketplace Компании-разработчики программного обеспечения Блог Microsoft Advertising Центр разработчиков Документация Мероприятия Лицензирование Microsoft Learn Microsoft Research Посмотреть карту сайта

Данные для разработки моделей ИИ

Изучите наш подход к данным для обучения моделей генеративного ИИ.
Два человека сидят за столом и просматривают контент на планшете. Рядом стоит чашка кофе.
Доверие и прозрачность — основа подхода корпорации Майкрософт к данным для обучения моделей ИИ.

Цель этой страницы — рассказать о нашем подходе. Здесь описаны категории данных, которые мы используем для обучения, и меры, которые мы принимаем, чтобы предоставить веб-издателям и создателям контента возможности управления тем, как их контент используется для обучения этих моделей.

Что означает обучение модели ИИ?

Модели ИИ делают прогнозы на основе данных. В процессе обучения модель ИИ выявляет закономерности, взаимосвязи и концепции в огромных объемах данных, а затем использует полученные знания, чтобы генерировать ответы на вопросы или запросы. Модель можно настраивать с помощью разных категорий обучающих данных, чтобы оптимизировать возможности генерации для конкретных классов информации, например для естественного языка, программного кода или изображений. Работа модели также может быть основана на данных самой организации, например в такой отрасли, как сельское хозяйство, Здраво­охранение или розничная торговля.

Модели генеративного ИИ не предназначены для хранения, доступа или воспроизведения исходных обучающих данных. Вместо этого такие модели предназначены для создания новых выразительных произведений и контента.

Два человека стоят в помещении и просматривают панель мониторинга на большом экране, на котором отображаются диаграммы и метрики.

Узнайте, как корпорация Майкрософт обучает модели генеративного ИИ на основе разнообразных данных

Большие и разнообразные наборы данных — неотъемлемая часть создания современных систем ИИ. Крайне важно использовать широкий набор разнообразных данных, чтобы разрабатывать более точные модели, которые лучше отражают разные культуры и языки, учатся на всем спектре человеческого опыта и изобретательности, а также применяют его.
Как указано в наших карточках моделей и другой общедоступной документации, корпорация Майкрософт ответственно использует для обучения своих моделей генеративного ИИ следующие категории данных:
  • Мы обучаем модели на выбранных общедоступных данных, используя сочетание отраслевых наборов данных для машинного обучения и обхода веб-контента. Мы исключаем источники с платным доступом и контентом, который нарушает наши политики, а также источники, которые отказались от обучения с помощью элементов веб-управления, которые мы опубликовали. Данные, полученные при обходе веб-контента, проходят фильтрацию для обеспечения безопасности и обработку с целью удаления незаконного контента, включая материалы, связанные с сексуальным насилием над детьми (CSAM), в соответствии с применимым законодательством и политиками Майкрософт в области ответственного применения ИИ.

    Мы соблюдаем такие стандарты, как теги robots.txt, которые веб-издатели используют, чтобы отказаться от обхода веб-контента. Мы не используем данные из доменов, указанных в списке рынков пиратства и подделок офиса торгового представительства США (USTR).
  • Это обучающие данные, к которым мы получаем доступ по согласованным договоренностям, например с издателями и правообладателями.
  • Эти данные собираются из отдельных потребительских служб Майкрософт и защищаются в соответствии с Заявлением о конфиденциальности Microsoft. Наш блог Microsoft Copilot и раздел вопросов и ответов о Copilot объясняют, как мы используем данные потребителей из Copilot, Bing и Microsoft Start (MSN), чтобы помогать обучать наши модели в Copilot. Мы упрощаем для пользователей отказ от использования данных и внедряем меры защиты, например удаление идентификаторов, которые могут установить вашу личность, чтобы защитить конфиденциальность пользователей. Мы не используем данные наших корпоративных клиентов без их разрешения.
  • Иногда мы обучаем на основе синтетических наборов данных. Мы создаем их, предлагая крупным языковым моделям (LLM) сгенерировать специально запрошенный результат, который дополняет дефицитные или ограниченные данные из реального мира. Затем результаты проверяются и фильтруются, в том числе людьми, чтобы убедиться, что их качество достаточно высокое для включения в набор обучающих данных.
  • В нашем процессе обучения мы используем отзывы людей — ИИ-тренеров, участников красной команды, сотрудников и внешних партнеров по аннотациям. Например, сюда входят отзывы людей, которые обеспечивают качественный результат для запроса пользователя и улучшают взаимодействие с конечными пользователями. Участники красной команды также тестируют модель на вредоносные или небезопасные запросы, а их отзывы используются, чтобы улучшать механизмы безопасности модели.
Наряду с нашими собственными моделями Майкрософт мы используем в наших продуктах и службах различные другие модели, включая модели OpenAI. Подробнее о том, как OpenAI обучает модели.

Для создания полезного и инклюзивного ИИ некоторые веб-издатели и обладатели контента хотят больше влиять на то, как используется их содержимое. Элементы управления для веб-издателей помогают, но не решают задачу полностью. Мы работаем вместе с представителями отрасли, издательского дела, органов по стандартизации и сообщества авторов контента, чтобы определить общий подход, который мы все сможем развивать и применять.
Человек стоит в помещении и использует ноутбук в светлом офисе.

Ответственное применение ИИ в корпорации Майкрософт

Ознакомьтесь с инструментами, методами и политиками, которые мы создали для соблюдения наших принципов ответственного применения ИИ.

Дополнительные ресурсы

Три человека вместе просматривают контент на ноутбуке в гостиной.

Отчет о прозрачности ответственного применения ИИ

Узнайте, как мы ответственно создаем ИИ, поддерживаем наших клиентов, развиваемся и растем.
Два человека сидят за столом и используют ноутбуки во время обсуждения.

Прозрачность и управление при использовании данных потребителей

Управляйте тем, как Copilot учится на основе ваших данных.
Человек держит планшет, на котором отображаются линейчатые диаграммы и аналитика.

Продвижение открытых данных

Реализуйте преимущества более открытых и доступных данных.
Русский (Россия) Конфиденциальность медицинских сведений потребителей Связаться с Майкрософт Конфиденциальность Управление файлами cookie Условия использования Товарные знаки Сведения о рекламе