This is the Trace Id: 47ddb024b8d6edb74a3a743744c269fa
Avançar para o conteúdo principal Descrição geral Princípios e Abordagem Relatório de Transparência Ferramentas e Práticas IA Responsável no Azure Dados para a preparação da IA Iniciativa Futuro Seguro Relatório de progresso da SFI Descrição geral de práticas e padrões Confiança Zero Descrição Geral da Privacidade Descrição geral da gestão de dados Acesso a dados Localização de dados Limite de Dados da UE RGPD Descrição Geral da Conformidade Ofertas de Conformidade Regulamentos Cumprimento da DORA Lei da IA da UE Resiliência Digital Europeia Cumprimento da NIS2 Conformidade nacional e regional Acessibilidade Produtos e serviços Ofertas de Conformidade Classificação de Conformidade Relatórios de auditorias Recursos de proteção de dados Microsoft Security Azure Dynamics 365 Microsoft 365 Microsoft Teams Windows 365 Microsoft AI Azure Space Realidade mista Microsoft HoloLens Microsoft Viva Computação quântica Ensino Automóvel Serviços financeiros Administração Pública Cuidados de Saúde Indústria Comércio Localizar um parceiro Torne-se um parceiro Rede de Parceiros Microsoft Marketplace Empresas de software Blogue Microsoft Advertising Centro de Programadores Documentação Eventos Licenciamento Microsoft Learn Microsoft Research Ver mapa do site

Dados para o desenvolvimento de modelos de IA

Explore a nossa abordagem aos dados para a preparação de modelos de IA generativa.
Duas pessoas sentadas a uma mesa a rever conteúdo num tablet, com uma chávena de café por perto.
A confiança e a transparência são fundamentais para a forma como abordamos os dados para a preparação de modelos de IA aqui na Microsoft.

O objetivo desta página é partilhar a nossa abordagem, delineando as categorias de dados que utilizamos para a preparação e o que estamos a fazer para dar aos editores da Web e aos criadores de conteúdo controlo sobre a forma como o seu conteúdo é utilizado para preparar estes modelos.

O que significa preparar um modelo de IA?

Os modelos de IA fazem previsões com base em dados. Durante o processo de preparação, um modelo de IA identifica padrões, correlações e conceitos em grandes quantidades de dados e, em seguida, utiliza o que aprendeu para gerar respostas a perguntas ou pedidos. O modelo pode ser otimizado utilizando diferentes categorias de dados de preparação para otimizar as capacidades de geração para classes específicas de informação, como linguagem natural, código de software ou imagens. Também pode ser fundamentado com os próprios dados de uma organização, por exemplo, num setor vertical como a agricultura, a saúde ou o retalho.

Os modelos de IA generativa não foram concebidos para armazenar, aceder ou reproduzir os dados de preparação originais. Em vez disso, estes modelos destinam-se a gerar novas obras e conteúdos expressivos.

Duas pessoas em pé no interior, a rever um painel num monitor grande com gráficos e métricas apresentadas.

Descubra como a Microsoft prepara modelos de IA generativa com dados variados

Conjuntos de dados grandes e variados são fundamentais para a criação dos sistemas de IA atuais. É fundamental que seja utilizada uma grande diversidade de dados para desenvolver modelos que sejam mais precisos, mais representativos de diferentes culturas e idiomas e que aprendam e apliquem todo o espetro da experiência e engenho humanos.
Conforme identificado nas nossas fichas de modelo e noutra documentação publicamente disponível, a Microsoft obtém as seguintes categorias de dados para preparar os nossos modelos de IA generativa de forma responsável:
  • Preparamos com dados selecionados publicamente disponíveis, a partir de uma combinação de conjuntos de dados de aprendizagem automática padrão da indústria e rastreios da Web. Excluímos fontes com paywalls e conteúdo que viole as nossas políticas, e que tenham optado por não participar na preparação através dos controlos da Web que publicámos. Os dados rastreados da Web são filtrados por segurança e processados para remover conteúdo ilegal, incluindo material de abuso sexual de crianças (CSAM), de acordo com as leis aplicáveis e as políticas de IA Responsável da Microsoft.

    Respeitamos os padrões como as etiquetas robots.txt que os editores da Web utilizam para optar por não serem rastreados na Web. Não utilizamos dados de domínios listados na lista de Mercados Notórios de Contrafação e Pirataria do Gabinete do Representante Comercial dos Estados Unidos (USTR).
  • Estes são dados de preparação aos quais acedemos através de acordos negociados, como com editores e proprietários de direitos de autor.
  • Estes dados são recolhidos a partir de serviços selecionados para consumidores da Microsoft e protegidos de acordo com a nossa Declaração de Privacidade da Microsoft. O nosso blogue do Microsoft Copilot e as FAQ do Copilot explicam como utilizamos os dados dos consumidores do Copilot, Bing e Microsoft Start (MSN) para ajudar a preparar os nossos modelos no Copilot. Facilitamos a exclusão dos utilizadores e implementamos salvaguardas, como a remoção de identificadores que o possam identificar, para proteger a privacidade dos utilizadores. Não utilizamos os dados dos nossos clientes empresariais sem a sua autorização.
  • Por vezes, preparamos com conjuntos de dados sintéticos. Criamo-los ao enviar pedidos a grandes modelos de linguagem (LLM) para gerar resultados especificamente solicitados que aumentem os dados escassos ou limitados do mundo real. Os resultados são depois revistos e filtrados, incluindo por revisores humanos, para garantir que têm qualidade suficiente para fazerem parte do conjunto de dados de preparação.
  • Incluímos feedback humano de formadores de IA, red teamers, colaboradores e parceiros de anotação externos no nosso processo de preparação. Isto inclui, por exemplo, feedback humano que reforça a qualidade do resultado de um pedido de um utilizador, melhorando a experiência do utilizador final. Os red teamers também testam o modelo face a pedidos prejudiciais ou inseguros, e o seu feedback é utilizado para melhorar os comportamentos de segurança do modelo.
Juntamente com os nossos próprios modelos da Microsoft, incorporamos vários outros modelos, incluindo da OpenAI, nos nossos produtos e serviços. Saiba mais sobre como a OpenAI prepara modelos.

Para uma IA benéfica e inclusiva, alguns editores da Web e proprietários de conteúdo querem ter mais voz na forma como o seu conteúdo é utilizado. Os controlos dos editores da Web são úteis, mas não são a solução completa. Estamos a trabalhar em conjunto com outros parceiros da indústria, publicação, organismos de normalização e a comunidade de conteúdo para identificar uma abordagem comum que todos possamos promover e adotar.
Pessoa em pé no interior a utilizar um portátil num ambiente de escritório luminoso.

IA responsável na Microsoft

Explore as ferramentas, práticas e políticas que criámos para defender os nossos princípios de IA responsável.

Mais recursos

Três pessoas a rever conteúdo em conjunto num portátil num ambiente de sala de estar.

Relatório de Transparência de IA Responsável

Saiba como construímos IA de forma responsável, apoiamos os nossos clientes, evoluímos e crescemos.
Duas pessoas sentadas a uma mesa a utilizar portáteis durante uma discussão.

Transparência e Controlo na Utilização de Dados dos Consumidores

Controle a forma como o Copilot aprende com os seus dados.
Pessoa a segurar um tablet que apresenta gráficos de barras e análises.

Promoção de dados abertos

Concretize os benefícios de dados mais abertos e acessíveis.

Seguir a Microsoft

Português (Portugal) Privacidade da Saúde do Consumidor Contactar a Microsoft Privacidade Gerir cookies Termos de utilização Marcas Registadas Acerca dos nossos anúncios EU Compliance DoCs