NOTÍCIA

Microsoft libera banco de dados com 100 mil perguntas para alavancar assistentes virtuais

O MS MARCO, da Microsoft, está disponível para empresas e pesquisadores.

Microsoft libera banco de dados com 100 mil perguntas para alavancar assistentes virtuais
Imagem: Redação iMasters

Atualmente, se você perguntar à Cortana ou à Siri algo como “Quanto é 2 + 2?”, provavelmente obterá a resposta “4”. Mas, se você fizer uma pergunta mais difícil, como “O que os gregos antigos comiam?”, as chances são de que, em vez de obter uma resposta direta, você seja direcionado para um site com a resposta. Para mudar isso, a Microsoft criou o MARCO — Microsoft Machine Reading Comprehension. Trata-se, na prática, de um banco de dadosBanco de dados134 conteúdosSQL ou NoSQL: eis a questão!!Data · mar 2020Banco de dados: como organizar e dar segurança para milhões de dados de loteriasData · mai 20215 serviços gratuitos na cloud para bancos de dados PostgresData · fev 2025Ver tudo em Data com 100 mil perguntas e respostas, feitas e respondidas por humanos.

Na semana passada, a empresa abriu o código do MARCO para pesquisadores e espera, com isso, fazer avanços na pesquisa de inteligência artificialInteligência artificial440 conteúdosUX e IA: Transformando Experiências Digitais com Inteligência ArtificialProduto & UX · jan 2025MCP: O que é e por que você vai ouvir falar disso em breve?AI · jul 2025IA generativa e a urgência de reconstruir nossa relação com a verdadeAI · jun 2025Ver tudo em AI e começar a ajudar a IA a ler e a entender a linguagem como os humanos.

Dessa forma, em vez de ter que ler um site para encontrar a resposta à sua pergunta, você pode fazer perguntas a um motor de busca ou assistente virtual, e eles vão buscar em documentos e sites como os seres humanos fazem, para, em seguida, fornecerem uma resposta complexa.

As 100 mil perguntas e respostas foram feitas com base em perguntas realizadas por pessoas reais para o Bing ou para a assistente virtual Cortana. As respostas fornecidas pelo MS MARCO foram extraídas de mais de 200 mil documentos ou websites e resumidas por um humano, segundo o site Venture Beat.

[awprm urls=https://imasters.com.br/noticia/microsoft-lanca-versao-1-8-do-visual-studio-code/,https://imasters.com.br/noticia/microsoft-levara-cortana-para-internet-das-coisas-com-o-creators-update-do-windows-10/]

Hoje, muitos conjuntos de dados utilizados para treinar o processamento de linguagem natural têm falhas notáveis, a equipe de oito pessoas que compilou o MS MARCO argumentou em um artigo publicado no mês passado.

A maioria dos conjuntos de dados usados para treinar o processamento de linguagem natural (NLP) atualmente não usa perguntas colocadas por pessoas reais, e eles tendem a recorrer a recursos como a Wikipedia, em vez de a perguntas menos polidas mas mais realistas de pessoas reais.

O MS MARCO está disponível para empresas e pesquisadores, mas os conjuntos de dados disponíveis para download gratuito são para uso não comercial.

Matérias especiais e reportagens conduzidas internamente pela Redação iMasters. Acompanhe no Twitter @imasters e no Instagram/Threads @portalimasters

Ver perfil