
A segurança pública tem enfrentado uma série de desafios com o aumento da criminalidade nos últimos anos. Com isso, a Secretaria de Segurança Pública do estado de São Paulo, Brasil, disponibiliza dados relativos aos boletins de ocorrências, que podem ser utilizados para análise por parte de gestores e pesquisadores. Entretanto, esses dados apresentam diversos problemas relacionados à padronização, consistência e heterogeneidade, dificultando o seu uso e integração com outras bases. Visando auxiliar gestores e pesquisadores na área de segurança pública, este artigo introduz SPSafe, um dataset padronizado de boletins de ocorrência registrados entre o ano de 2003 e 2022 no estado de São Paulo. SPSafe agrega aspectos de qualidade aos dados, como a eliminação de inconsistências e a disponibilização em formatos abertos.
O Ministério do Trabalho e Emprego (MTE) conta com um registro permanente de dados referentes a admissões e dispensas de empregados sob o regime da Consolidação das Leis do Trabalho (CLT), denominado CAGED (Cadastro Geral de Empregados e Desempregados). Suas informações são utilizadas no Programa de Seguro-Desemprego e em outros programas sociais, e são divulgados para reutilização pela sociedade. Neste trabalho, os microdados do CAGED de janeiro de 2020 a maio de 2023 são enriquecidos e consolidados em um conjunto de dados, utilizando a técnica de modelagem dimensional, e disponibilizados em arquivos de dados em formato binário, aberto e orientado a colunas, com objetivo de permitir o armazenamento e recuperação de dados de maneira simples e eficiente. Esta abordagem foi adotada por tratar-se de um volume de dados massivo, com mais de 123 milhões de registros, o que representa um obstáculo técnico para manipulação utilizando formatos tradicionais de texto tabular (CSV).
O Airbnb é uma plataforma online com mais de 6,6 milhões de anúncios e 1,4 bilhões de hóspedes originados de diferentes localidades. Diante de um número tão acentuado de usuários, essa plataforma gera um grande volume de dados que podem ser utilizados em diferentes aplicações. Por isso, este trabalho apresenta AirBSet, um conjunto de dados com imóveis brasileiros e respectivas avaliações. Aqui, esse conjunto de dados é descrito e caracterizado com o intuito de facilitar seu uso em outros estudos.
Obter bases de dados de deslocamentos para pesquisas na área de predição de destinos e de trajetórias é uma tarefa desafiadora. Neste sentido, o estudo propõe-se a descrever e minerar o Vehicle Energy Dataset (VED), adequada para a avaliação de técnicas de agrupamento, com 384 veículos e seus deslocamentos, concentrados na cidade de Ann Harbor, em Michigan (EUA). Este trabalho combina a aplicação dos algoritmos ST-DBSCAN, como técnica de agrupamento espaço-temporal, com a do map-matching, mediante um Sistema de Referência de Coordenadas adequado, além de realizar contagem da repetição das células de origem-destino das trajetórias e, ao final, obtiveram-se 231 veículos com, no mínimo, 1 trajetória com uma repetição origem-destino de, no mínimo, 2 vezes.
No Brasil, segundo dados da ANTP, em cidades com mais de 60 mil habitantes, 85% das viagens realizadas por transporte público ocorrem utilizando ônibus. Considerando o problema da Mobilidade Urbana, dados geospaciais produzidos por diferentes dispositivos (e.g. ônibus, carros pessoais, semáforos, radares) oferecem um grande potencial analítico, sendo relevante para a tomada de decisões que impactam a qualidade de vida em cidades inteligentes. Neste trabalho, descrevemos o processo de coleta, padronização e enriquecimento do BRBus -- um dataset com informações do monitoramento geoespacial do tráfego de ônibus de quatro cidades brasileiras. BRBus está disponível em formato aberto e abrange dados coletados entre 12/06/2023 e 20/06/2023.
Brazil is the fifth largest country in the world and is one of the most populous. These characteristics make it very important to summarize up-to-date data from all the Brazilian regions for decision-makers, in the public or private sectors. In this work, we obtain a unified dataset with statistical data for all cities in the country, integrating data related to population, economy, employment, education, and health. We show the process of extraction of the data from different public sources, the processing, and the generation of the dataset. We discuss the possible uses of the dataset, analyze the limitations of the proposed methodology, and discuss its possible evolutions.
Com o surgimento das mídias sociais e dos aplicativos de mensagens instantâneas, a disseminação de informação textual por meio de imagens se popularizou bastante. Comitantemente, este tipo de mídia tem sido bastante explorado para a disseminação de desinformação. Imagens com conteúdo textual possuem diversas características peculiares que trazem inúmeros desafios para ferramentas focadas na identificação, contenção e moderação deste tipo de conteúdo. Diante deste cenário, neste trabalho, apresentamos o ImageFactCk.BR, um repositório de dados que contém 12.209 imagens sintéticas, geradas a partir características comumente encontradas em plataformas digitais, e que contém desinformação escrita no idioma Português verificada por agências de checagem de fatos brasileiras. Esperamos que ele possa ser útil para estudos em diferentes contextos em torno do fenômeno da desinformação em plataformas digitais.
Sport is one of the most popular and revenue-generating forms of entertainment. Therefore, analyzing data related to this domain introduces several opportunities for Question Answering (QA) systems, such as supporting tactical decision-making. But, to develop and evaluate QA systems, researchers and developers need datasets that contain questions and their corresponding answers. In this paper, we focus on this issue. We propose QASports, the first large sports question answering dataset for extractive answer questions. QASports contains more than 1.5 million triples of questions, answers, and context about three popular sports: soccer, American football, and basketball. We describe the QASports processes of data collection and questions and answers generation. We also describe the characteristics of the QASports data. Furthermore, we analyze the sources used to obtain raw data and investigate the usability of QASports by issuing "wh-queries". Moreover, we describe scenarios for using QASports, highlighting its importance for training and evaluating QA systems.
Streaming platforms like Spotify have revolutionized music consumption, generating big volumes of data on hit songs. Such data serve as input to analyzing the music community and to the field of Music Information Retrieval. In this context, we present MGD+: an enhanced Music Genre Dataset with Success-based Networks. By combining Spotify chart data with acoustic metadata, we capture the evolution of musical careers. We further enhance the dataset with a genre-based collaboration network, represented as a graph, connecting artists through collaborations. MGD+ enables building success-based time series across several music markets, offers a friendly interface, and allows reproducibility; being a valuable tool for music-related tasks.
Atividades diversas utilizam registros escritos à mão, tais como receituários e prontuários médicos e serviços de segurança. Embora recursos tecnológicos, como tablets e celulares, permitam a escrita à mão usando meios digitais, muitos ainda utilizam papel para registrar sua escrita. Em todos os casos, automatizar a transcrição de tais registros para um formato digital implica no reconhecimento de seus conteúdos textuais. Embora métodos baseados em redes neurais profundas auxiliem este processo, eles carecem de conjuntos de dados anotados de idiomas específicos. Porém, majoritariamente, os dados disponibilizados estão na língua inglesa, que não faz uso de símbolos de acentuação. Também, a escrita pode conter estilos culturais que podem não ser parte de falantes de outros idiomas. Para abordar este problema, este artigo contribui com o LHTR.br (Labeled Handwritten Text Recognition in Brazilian Portuguese), um conjunto de dados com demarcações de textos em imagens e transcrição do texto em Português. Espera-se que esse conjunto de dados possa ser utilizado para o treinamento de modelos baseados em redes neurais.
Este artigo apresenta um conjunto de dados desenvolvido a partir das informações disponibilizadas nas revistas de registro de patentes do Instituto Nacional de Propriedade Industrial (INPI). Devido à fragmentação das informações em múltiplas revistas, torna-se inviável realizar buscas ou fazer análises sobre o cenário de registro de patentes no Brasil. O conjunto de dados apresentado neste artigo, agrega as informações fragmentadas dos processos em um repositório no GitHub e apresenta um fluxo automatizado para obtenção de novas revistas, utilizando GitHub Actions com o objetivo de manter os dados atualizados e relevantes.
Aplicações agrícolas e ambientais dependem de dados georreferenciados. A obtenção desse tipo de dado exige recursos elevados relacionados a hardware e recursos humanos especializados. A extração de dados da Web pode ser uma alternativa viável para criação de datasets para essa demanda. É possível encontrar repositórios públicos em ambiente Web para criar ou complementar datasets no domínio agrícola e ambiental, seja para delimitação de áreas agrícolas ou identificação e monitoramento de áreas ambientais. O presente artigo apresenta uma proposta para extração de dados da Web com o objetivo de criar um dataset para uso agrícola e ambiental por meio da extração de geo-coordenadas em repositórios públicos.
Advances in Natural Language Processing have generated new models that push forward the state of the art. This reached new heights in complex tasks in handling unstructured texts. Most of the new architectures and models focus on the English language. There is a lack of available datasets that can be used during the training of new models. This investigation presents four new textual datasets for language modeling in Brazilian Portuguese. Our datasets were generated from several specific methodologies that aimed to obtain data of different natures. Two of our sets were originally built from data in online web forums. We also distribute a translated version of MultiWOZ, and a clean version of BrWaC. The original datasets are made available in a structured way to facilitate their use during the training of NLP models, with questions, answers and conversations already identified.
Neste estudo busca-se solucionar a falta de dados de estimativas populacionais segmentadas por município e idade, no período de 2014 a 2020 para todos os municípios do Brasil, através da criação de um Dataset que fornece estes dados de forma estruturada e enriquecida com características para facilitar seu reuso, partindo de dados oficiais como do IBGE e do Ministério da Saúde e processados por uma metodologia já aprovada por um órgão de Estado. Além da implantação da metodologia para geração do Dataset, também são discutidas oportunidades de melhoria no método de processamento, direcionando assim futuros estudos de desagregação populacional considerando as particularidades dos conjuntos de dados dos órgãos de Estado no Brasil.
O judiciário brasileiro possui uma grande carga de trabalho, o que acaba acarretando um longo tempo para conclusão dos processos judiciais. Diversas iniciativas de digitalização têm surgido, abrindo a possibilidade do uso de recursos computacionais no auxílio das tarefas cotidianas do domínio jurídico. O domínio jurídico lida, em sua maioria, com dados textuais e a Inteligência Artificial tem técnicas que podem ajudar a apoiar as tarefas cotidianas, dando maior celeridade ao processo. No entanto, conjuntos de dados do domínio jurídico necessários para algumas técnicas atuais de Inteligência Artificial são escassos e de difícil obtenção, uma vez que requerem anotações por parte de especialistas. Este artigo apresenta quatro conjuntos de dados do domínio jurídico, dois com corpus de documentos e alguns metadados mas sem rótulo, e outros dois anotados com uma heurística visando seu uso na tarefa de similaridade semântica textual.
Este artigo descreve a construção de um banco de dados com dados financeiros e operacionais dos municípios do Brasil. Foram coletados dados públicos referentes a despesas por função (educação, saúde, segurança, entre outros), indicadores e outros dados que refletem a realidade municipal nas áreas de educação, saúde, segurança pública, desenvolvimento, saneamento e situação fiscal. Foram integrados e transformados dados de várias fontes que permitiram estudos sobre a correlação entre a performance dos municípios nos indicadores socioeconômicos e as despesas públicas correspondentes, de forma a acompanhar e avaliar os efeitos das políticas públicas.
Neste trabalho, é apresentado o LiPSet, um conjunto de dados com documentos rotulados de licitações públicas de Minas Gerais. Após uma visão geral do processo de coleta e rotulação manual, uma breve análise exploratória de dados é apresentada para resumir as principais características e contribuições do conjunto de dados proposto. Além disso, são discutidas potenciais aplicações e principais desafios que envolvem o uso do LiPSet.
O Instituto Nacional de Estudos e Pesquisas Educacionais Anísio Teixeira (INEP) disponibiliza o Censo da Educação Básica, o maior levantamento anual de dados sobre a educação brasileira. Os dados são disponibilizados anualmente e com cerca de 370 colunas e pouco mais de 230 mil registros por ano. Este trabalho apresenta o processo que foi utilizado para criar um conjunto de dados que unificasse os anos de 2010-2021 e o disponibilizasse de forma a garantir boas práticas de disponibilização de dados na web. Foi gerado um conjunto de dados abrangendo todos os anos mencionados, posteriormente dividido em subconjuntos dada a natureza dos dados apresentados.
A produção científica depende em grande parte de termos técnicos específicos para cada área do conhecimento. Esses termos usualmente não seguem um vocabulário convencional ou tradução livre principalmente no compartilhamento de dados e informações entre idiomas. No domínio agrícola a Organização das Nações Unidas para Alimentação e Agricultura (FAO) contribui com uma importante ferramenta para auxiliar o intercâmbio de informações em diferentes idiomas: o dicionário Agrovoc. O Agrovoc funciona como um vocabulário de termos composto também por uma ontologia colaborativa contando com termos em até 40 idiomas. A disponibilização desse vocabulário juntamente com a estrutura de uma ontologia pode dificultar a integração com sistemas de terceiros, como por exemplo Enterprise Resource Planning ou ERP. A contribuição desse trabalho está na apresentação de uma alternativa para criação de um dataset tabular a partir do dicionário Agrovoc para uso dos termos em bases de dados relacionais permitindo facilmente a integração com aplicações destinadas à agricultura.
Este artigo descreve a criação e disponibilização da base de dados de evolução de artigos da Wikipédia. A base é caracterizada por atributos de qualidades e a classe de qualidade dos artigos em determinada data, sendo cada instância entendida como revisão. Esta base pode ser utilizada para estudos relacionados com classificação automática de qualidade que considerem o histórico de revisão do artigo e entendimento de como o conteúdo e qualidade dos artigos evoluem ao longo do tempo nessa plataforma colaborativa.