
Este trabalho apresenta um estudo exploratório sobre a aplicação do modelo ARIMA diretamente no banco de dados Vertica para previsão da velocidade do vento. Utilizou-se um conjunto de dados do projeto EOSOLAR, com medições de perfis verticais de vento na região costeira do Maranhão. A avaliação considerou as métricas RMSE (Root Mean Squared Error) e MAE (Mean Absolute Error) sobre 105 modelos treinados. O estudo investigou se a abordagem in-database do ARIMA no Vertica poderia oferecer modelagem eficiente para a previsão da velocidade do vento. Os resultados mostraram que modelos com baixa complexidade alcançaram bom desempenho preditivo.
Este artigo propõe uma abordagem inovadora para otimização de portfólios de ativos de alta volatilidade, integrando previsão de retorno com CNN+BiLSTM ao Modelo do Índice de Sharpe (MIS). O objetivo é adaptar o MIS às particularidades do mercado de ativos de alta volatilidade, marcado por alta volatilidade, distribuições não normais e forte correlação entre ativos. A metodologia utiliza um modelo que estima o retorno médio e a variância futura dos ativos, fornecendo entradas mais precisas ao MIS e originando o Modelo do Índice de Sharpe com Previsão (MIScP). Os resultados mostram que o MIScP supera o MIS, com ganho acumulado médio de 68,88%, contra -19,76% com o MIS em 75 dias.
O sistema educacional brasileiro enfrenta desafios estruturais e socioeconômicos, refletidos no acesso desigual à educação e nos baixos índices de desempenho acadêmico, especialmente em regiões vulneráveis. A análise de indicadores educacionais auxilia na identificação de mudanças estruturais no ensino, avaliação da efetividade de políticas implementadas e monitoramento da evolução da qualidade educacional. Este trabalho visa identificar fatores relacionados às desigualdades educacionais no Brasil e compreender a evolução das desigualdades ao longo dos anos, oferecendo informações úteis para a formulação de políticas públicas mais eficazes e a alocação estratégica de recursos. Utilizou-se clusterização de indicadores educacionais e de desempenho escolar, a partir de dados de diversos indicadores educacionais dos anos de 2015, 2019 e 2021 fornecidos pelo INEP. Foi possível identificar grupos de municípios com perfis mais semelhantes e indicadores que melhor discriminam tais grupos. Além disso, uma análise de evolução de clusters permitiu uma avaliação temporal da qualidade do ensino.
Este artigo apresenta uma solução baseada em computação em nuvem para a transcrição, armazenamento estruturado e análise de áudios provenientes da operação de sistemas elétricos. A ferramenta desenvolvida utiliza o Elasticsearch para armazenamento e indexação eficiente dos dados transcritos, e integra-se a pipelines de ciência de dados para rotulagem semiautomática, avaliação de operadores e visualização via Business Intelligence (BI). A arquitetura proposta é agnóstica ao provedor de nuvem e foi validada em ambientes AWS, GCP e Azure. Experimentos demonstram uma redução média de 83,3% no tempo de busca por eventos operacionais, evidenciando o potencial da solução para auditoria, eficiência informacional e confiabilidade do setor elétrico.
This paper examines GPT-2 based data augmentation to improve sentiment classification of Portuguese mobile app reviews, employing the BERTimbau model. A pipeline is proposed, integrating synthetic data generation with semantic analysis, UMAP for dimensionality reduction, and HDBSCAN for clustering and validation. Results show validated and balanced synthetic augmentation boosts model performance in sparse or imbalanced data scenarios.
This paper introduces eTRUMiner, a novel algorithm for mining multivariate temporal association rules from heterogeneous time series datasets with missing observations. Our approach enables user-defined discretization, discovers frequent patterns, and outputs rules in short or detailed formats, thus enhancing interpretability. The results show that: (i) the choice of discretization method significantly influences rule relevance; (ii) eTRUMiner preserves the rules with high confidence in a dataset with up to 15% missing data; and (iii) the extracted rules can capture plausible causal dynamics. These findings demonstrate eTRUMiner’s robustness to incomplete data and its usefulness for exploratory analysis and forecasting in complex temporal domains.
Este artigo apresenta o desenvolvimento de uma ferramenta de Business Intelligence (BI) voltada ao monitoramento da saúde de projetos de infraestrutura científica, no contexto da construção das Linhas de Luz do Acelerador de Partículas Sirius. A solução baseia-se na implementação de indicadores de desempenho (KPIs), que encontram-se em fase de validação, com o objetivo de refletir de forma contínua fatores como alterações no escopo, ritmo de execução das atividades e engajamento das equipes na atualização de cronogramas. A proposta busca contribuir com abordagens quantitativas para avaliação dinâmica de projetos com alto grau de incerteza e escopo variável, características comuns de projetos na área de pesquisa e desenvolvimento (P&D).
OndePublicar.com is a collaborative Web system that integrates dynamic information about academic events and journals, along with their Call for Papers (CFP). The system combines multiple bibliometric indicators (Qualis CAPES, SJR, SNIP), offers advanced search capabilities, and maintains a calendar of upcoming CFPs. It allows any user to suggest publication venues and CFPs, while accredited curators validate the entries. Approved entries are enriched with bibliometric data and indexed via Apache Solr, achieving a median latency of 0.47s under 10,000 concurrent queries. OndePublicar.com distinctive features include: (i) a unified repository combining a CFP calendar with national and global quality metrics of journals and events classified by field; (ii) an open, scalable architecture for venue and CFP discovery; and (iii) a collaborative curation model.
Remote health monitoring using wearable devices has transformed healthcare by enabling continuous observation and early intervention. However, these systems frequently suffer from missing data, which can introduce bias and impair clinical decision-making. The uncertainty surrounding the cause of missing values further complicates data analysis. This paper investigates the impact of different missing data mechanisms (i.e., MCAR, MAR, and MNAR) in the healthcare wearable data anomaly detection task. Using heart rate and step count data from patients with respiratory illnesses, we assess the performance of an anomaly detection method under varying missingness conditions. Our findings demonstrate that more complex mechanisms (MAR and MNAR) significantly degrade detection performance, even at low missing rates, highlighting the importance of developing robust imputation strategies tailored to the nature of missingness.
This work presents a sub-50ms, training-free retrieval pipeline that leverages a Neo4j knowledge graph and a ChromaDB vector index. Questions and passages are embedded with Sentence-BERT, and the retrieved entities seed a one-hop Cypher expansion in the knowledge graph. A transparent fusion based on Dice-Sørensen overlap ranks both passages and triples. On the WebQSP and CQA-12k benchmarks, this hybrid method achieves superior Recall@10, MRR, and nDCG@10 compared to BM25, graph-only, and vectoronly baselines. Requiring no learned parameters and running on commodity hardware, it offers a practical alternative to heavyweight neural re-rankers and a robust evidence layer for retrieval-augmented generation (RAG).
Recommendation systems are tools to suggest items that might interest users. These systems rely on the user’s preference history to generate a list of suggestions most similar to items in the user’s history, aiming for better accuracy and minimal error. Pursuing higher accuracy can lead to side effects such as overspecialization, reduced diversity, and imbalances in categories, genres, or niches. Thus, this work explores algorithms for selecting the items that form a calibrated recommendation list. The hypothesis is that calibration can positively contribute to fairer recommendations based on user preferences. We introduce a variation of an existing algorithm, which performs better than the baselines in a commonly used dataset in two different divergence measurements.
The rapid growth of data has made accessing, integrating, and analyzing information increasingly challenging. While large-scale systems support processing and querying, interactive visualizations are essential for exploring complex datasets. Understanding how users gain insights from these visualizations requires capturing their interactions. Provenance data offers a natural solution, but current methods often fail to capture interaction-level provenance effectively. This paper presents an approach to capture and record user interaction provenance and integrate it with both prospective and retrospective provenance. We implement this approach in the Curio framework, which builds urban data visualization pipelines. Results demonstrate its effectiveness in capturing user behavior during visual exploration.
Organizations striving for data-driven operations often encounter limitations with monolithic data architectures and centralized data teams, typically in terms of scalability and data governance. The Data Mesh paradigm has emerged as a promising, decentralized alternative, yet practical guidance for implementing its key components, particularly federated metadata management, remains limited. This paper systematically reviews academic contributions on metadata solutions in Data Mesh environments, analyzing architectural patterns, standards, and technologies. We investigate existing approaches, provide a detailed comparison, and pinpoint critical open challenges to enable scalable and interoperable metadata governance across domains.
Frequent itemset mining with Apriori-based methods is widely used to uncover patterns in large datasets. However, under the private setting of Local Differential Privacy (LDP), this task poses key challenges, such as domain scalability and user set-valued data. Prior works address these problems through fixed-size transaction reporting protocols but often rely on hard-coded parameters, overlooking complexities from differing dataset profiles. To address this limitation, we propose a data-dependent framework for identifying the top-k most frequent itemsets under LDP. Through initial metadata queries and the integration of an optimization problem, we significantly improve over prior work on both synthetic and real-world datasets.
Understanding customers’ feedback is essential for businesses to improve products and adapt to different markets. This study analyzes 100,000 app reviews from Uber, Instagram, and WhatsApp across six countries (Brazil, U.S., Australia, India, U.K., and South Africa) to assess whether user concerns are global or culturally influenced. Using BERTopic for topic modeling, zero-shot classification for topic assignment, and Aspect-Based Sentiment Analysis, we identify twelve key topics in reviews. While some topics are shared globally, others are country-specific. For example, Uber’s reliability was a major concern in South Africa and Australia, while Brazilian users discussed WhatsApp voice messages more frequently. These findings help businesses detect market-specific trends, benchmark competitors, and address regional needs strategically.
Este estudo utilizou mineração de dados para classificar indivíduos saudáveis e hipertensos com doenças cardiovasculares (HA + DCV) no Brasil, a partir da PNS 2019. Foram testados algoritmos como Árvore de Decisão, Floresta Aleatória e Naive-Bayes. Os modelos tiveram desempenho semelhante, com a Floresta Aleatória atingindo 97% de precisão e sensibilidade para identificar saudáveis. No entanto, a classificação de HA + DCV foi desafiadora, com menor sensibilidade, possivelmente devido à ausência de diagnósticos formais e fatores como estilo de vida. Os resultados evidenciam a importância de dados mais detalhados e longitudinais para melhorar a identificação de doenças crônicas.
Séries temporais de dados matriciais normalmente demandam um grande volume de dados, tornando o particionamento crucial para consultas eficientes. As abordagens atuais particionam os dados de forma estática, no espaço ou no tempo. Este trabalho propõe um sistema de particionamento dinâmico que realiza a divisão dos dados no espaço e agrupamento no tempo conforme o contexto das consultas sobre regiões de interesse, gerenciando o particionamento espaço-temporal em blocos de mesmo tamanho para reduzir os acessos a blocos em memória secundária. Experimentos em conjuntos de dados geoespaciais indicam redução de até 75% no tempo de consulta, evidenciando o potencial da proposta.
Com a expansão das redes sociais nas últimas décadas, o discurso de ódio online emergiu como um problema social e tecnológico relevante. A identificação automática desse tipo de conteúdo é desafiadora devido à subjetividade inerente às mensagens e às variações culturais e individuais. Modelos de linguagem de grande escala (LLMs) surgem como alternativas promissoras para essa tarefa, mas seu desempenho é sensível à formulação dos prompts. Este artigo investiga o impacto da contextualização de eventos nos prompts na tarefa de detecção de discurso de ódio. Foram desenvolvidas três versões progressivas de prompts e avaliadas nos modelos Command-A, GPT-4o e DeepSeek-V3. Utilizando comentários reais coletados sobre o filme Emilia Pérez, os resultados mostram que a inclusão de contexto sobre o evento no prompt impacta positivamente o desempenho dos modelos, com ganhos registrados de até 16% na métrica F1.
Este trabalho investiga o impacto de distribuições de dados não-Independente e Identicamente Distribuída (não-IID) no desempenho de Sistemas de Recomendação (SR) de filmes utilizando Aprendizagem Federada, em inglês Federated Learning (FL). Através da colaboração entre partes, o FL permite a distribuição do custo computacional e amplia a diversidade de dados disponíveis para o processo de treinamento, favorecendo a construção de SRs com boa capacidade de generalização. Neste contexto, e com o objetivo de analisar a eficácia da estratégia de compartilhamento parcial de dados, conduziram-se experimentos em quatro cenários utilizando o dataset MovieLens1M: (C1) dados IID; (C2) dados não-IID sem compartilhamento; (C3) dados não-IID com 1% de compartilhamento; e (C4) dados não-IID com 5% de compartilhamento. Dois paradigmas federados foram utilizados: Cross-Silo e Cross-Device. Resultados experimentais indicam que o compartilhamento parcial de dados é uma abordagem promissora para mitigar os efeitos adversos de distribuições não-IID em Aprendizagem Federada, incorrendo em aumentos de aproximadamente 9,5% para NDCG e quedas de 0,046 no MAE, por exemplo. Assim sendo, equilibra-se desempenho preditivo, privacidade e custo computacional.
National foreign trade data (a country’s exports/imports) is widely available, but demand for the subnational level (states, municipalities) is growing. This brings volume and variety challenges, due to granularity and differing data handling across countries. This work analyzes the conditions of Latin American subnational foreign trade data to propose technical pathways for integration and standardization aimed at analytical uses. A layered minimal Lakehouse architecture, centered on Data Exploration and Understanding is employed, and case studies (Mexico and Uruguay) are presented. Findings reveal heterogeneity in data collection, compilation and dissemination, highlighting the need for harmonization to enable comparative analysis.