
Este estudo analisa a aplicação da Enhanced Rhetorical Structure Theory (eRST) em textos de User-Generated Content (UGC), especificamente tweets relacionados ao mercado financeiro. Com o auxílio da ferramenta rstWeb, a anotação foi realizada a partir do corpus Dante-Stocks. Os resultados evidenciam a recorrência de determinadas relações eRST, a depender da estruturação semântico-sintática dos tweets, além de apontarem possíveis adaptações das diretrizes de anotação originalmente formuladas para a língua inglesa.
Textos jurídicos representam um desafio para o campo do Processamento de Linguagem Natural, dada a complexidade e o estilo característicos desse tipo de texto. Neste artigo, contribuímos com o desenvolvimento dessa área para o português do Brasil em duas frentes. Primeiramente, apresentamos o PortJur, um novo corpus jurídico anotado sintaticamente de acordo com o modelo Universal Dependencies, resultando, para além do estudo linguístico relevante, em um recurso inédito para o português. Em seguida, exploramos o corpus anotado para criar recursos lexicais especializados, como listas de palavras de conteúdo, formas verbais, abreviaturas e estrangeirismos, e um almanaque de entidades nomeadas.
A desinformação e propagação de fake news (notícias falsas) causam grandes impactos negativos em diversas áreas, entre elas a democracia, porque pode ser usada para manipular a opinião pública no processo eleitoral. A literatura científica possui estudos que investigam alternativas para detectar fake news, mas ainda existem diversas lacunas para o idioma português (do Brasil). Nesse sentido, este estudo analisa a hipótese de que a quantidade de parâmetros nos modelos de LLM (do inglês, Large Language Models) impacta na identificação de fake news. Os resultados sugerem que a hipótese é válida. Adicionalmente, outros fatores podem impactar, e que existe um limite de desempenho inerente às características analisadas.
A carência de ferramentas para auxílio à escrita científica em português dificulta a produção de textos coesos. Este artigo descreve o processo de fine-tuning do modelo de linguagem BERTimbau para a identificação automática de movimentos retóricos fundamentados no modelo de Swales. A metodologia utiliza o CorpusDT, um corpus de resumos da área de Computação, para a tarefa de classificação de sentenças. Os resultados do classificador demonstram alta eficácia, com um F1-Score de 0,94 no conjunto de validação, indicando o potencial da abordagem para aprimorar a qualidade das publicações científicas em língua portuguesa.
Este é um estudo em andamento sobre Processamento de Língua Natural de um corpus de Narrativas Clínicas em português brasileiro com duas versões anotadas: uma pela máquina e outra por humanos. A frequência dos rótulos das classes de palavras e das relações de dependência dos tokens em cada versão é calculada e uma análise guiada pelo corpus é realizada, destacando as correções feitas pelos humanos nas anotações da máquina. A comparação dessas anotações permite a criação de treebanks que podem ser usados para treinar novos modelos usando técnicas de aprendizado de máquina e para aprimorar diversas aplicações de Processamento de Língua Natural com corpus da área biomédica. Além disso, essa comparação permite a análise da consistência teórica de anotação, a fim de identificar o sistema gramatical desse tipo de corpus e criar guias de anotação para Narrativas Clínicas em português brasileiro de acordo com as Dependências Universais.
Grandes Modelos de Linguagem (LLMs) desempenham um papel central no cenário moderno de PLN, devido aos seus consistentes bons resultados em muitas tarefas na literatura. No entanto, o treinamento desses modelos envolve altos custos associados. Devido à escassez de dados necessários para tarefas em idiomas com poucos recursos, a literatura tem proposto o uso de tecnologia multiĺıngue combinada com técnicas de transferência de conhecimento entre ĺınguas. Esta pesquisa explora o fine-tuning de modelos para transferência de conhecimento entre ĺınguas para o português, em diversas tarefas, avaliando os trade-offs entre quantidade de dados, recursos computacionais, tempo de treinamento e desempenho do modelo.
The creation of high-quality Question-Answer (QA) datasets is critical for developing reliable legal AI systems, yet a significant gap exists between intrinsic textual metrics and real-world model performance. This paper introduces an end-to-end framework to bridge this gap. We first present a refined methodology for generating a legal QA dataset (V2) based on the Brazilian Consumer Protection Code (Código de Defesa do Consumidor CDC), demonstrating its superiority over a baseline corpus using metrics such as MTLD and Shannon Entropy. We then assess its practical impact by fine-tuning a Qwen3-8B model with LoRA. The model’s performance is evaluated on a novel, expert validated 76 question multiple choice benchmark. Results show that the fine-tuned model achieves perfect accuracy on the benchmark and surpasses the base model across text generation metrics including BLEU, METEOR and BERTScore. Our work offers a reproducible methodology for legal dataset construction and validation, providing empirical evidence that improvements in data quality yield tangible gains in downstream legal reasoning tasks.
This article aims to develop a model for summarizing police reports in the context of public security, with a focus on execution on limited hardware. The approach combined hybrid distillation (logits and intermediate representations) and supervised fine-tuning with LoRA, using a corpus of 19,286 police reports. The evaluation was conducted using automatic metrics (BERTScoreF1) and qualitative analysis by specialists. The results demonstrate that the distilled model generates clear, coherent, and semantically appropriate summaries, comparable to those of the larger model, with superior computational performance, including in hardware-constrained environments.
Metáforas são elementos fundamentais na comunicação humana, permitindo uma expressão nuançada e uma compreensão conceitual mais profunda. No entanto, a maioria das pesquisas em detecção de metáforas concentra-se em corpora e modelos para o inglês. A capacidade dos Grandes Modelos de Língua (LLMs) em processar linguagem metafórica em outros idiomas permanece pouco explorada. Este estudo investiga se metáforas podem ser preservadas e anotadas por meio da tradução. Com foco no português brasileiro, adotamos um pipeline baseado em retrotradução e comparação, utilizando múltiplos LLMs. Com base em métricas automáticas e avaliação humana, resultados sugerem a viabilidade de traduzir metáforas conceituais e linguísticas. Os achados apontam que recursos de metáforas podem ser construídos a partir de fluxos de tradução. No entanto, permanecem desafios, especialmente a necessidade de validação manual extensiva e os riscos de viés cultural e mudança semântica.
Descrevem-se dois tipos de reestruturação de completiva-sujeito de adjetivo em português do Brasil: elevação de sujeito (Que João faça isso é bacana / João é bacana em fazer isso) e elevação de objeto (Fazer isso é incomum / Isso é incomum de se fazer). A formação e a extensão desse fenômeno são descritas a partir de uma lista dos lemas de adjetivos mais frequentes em um corpus. Observou-se que os adjetivos que aceitam elevação de sujeito formam um subconjunto, composto principalmente por adjetivos de comportamento e avaliativos, dos que aceitam elevação de objeto.
Este artigo apresenta a ferramenta RST Visualizer, que surgiu da necessidade de visualizar diferentes camadas de anotações sobre a análise discursiva de textos, tais como sua representação no formato de árvore RST e sinalizadores discursivos de cada relação retórica no nível intra-sentencial. Trata-se de uma ferramenta inédita para apoiar pesquisas que precisam realizar análises qualitativas por meio da comparação visual de diferentes anotações.
O artigo apresenta um modelo de classificação automática de frases faladas para o português utilizando redes neurais convolucionais (CNNs). A metodologia envolve a análise de espectrogramas MFCCs como entrada para a CNN. Os resultados do modelo foram analisados em termos de precisão, recall, f-score e acurácia para diferentes categorias. O estudo conclui que, embora o modelo se mostre com desempenho promissor em algumas classificações, ele ainda apresenta desafios significativos na identificação de frases canônicas e anti topicalizadas, necessitando de mais dados de áudios e ajustes futuros.
Este trabalho propõe um modelo para restaurar automaticamente a pontuação em textos coloquiais em português do Brasil, originados de transcrições de áudio, com foco na melhoria da legibilidade e usabilidade em tarefas de PLN. A metodologia envolve duas etapas principais: treinamento e inferência. Utiliza-se o corpus IWSLT (2014–2016), que contém transcrições de palestras TED traduzidas, e um modelo híbrido com Bi-LSTM, self-attention e CRF. O pré-processamento inclui mapeamento de sinais, construção de vocabulário, embeddings GloVe e rede highway. Quatro cenários de avaliação foram aplicados, revelando que a combinação dos dados dos três anos gera os melhores resultados, com melhorias progressivas nas métricas de precisão, recall e F1-score.
This work assessed the performance of seventeen large language models, including open-source and proprietary models, on the Text-to-SQL task in both Brazilian Portuguese and English. Two schema representation strategies were considered: textual descriptions and representations using data definition language. Experimental results on the Spider dataset demonstrated the superior performance of proprietary models, particularly the Gemini-2.5-Flash-preview, as measured by the Execution Accuracy and Exact Match metrics. Among the open-source models, Qwen-2.5-Coder-14B achieved the highest performance. An error analysis of the best-performing model revealed strong proficiency in handling clauses such as SELECT and AND/OR, while considerable challenges persisted in generating more complex constructs, including GROUP BY with HAVING and set operators like UNION and INTERSECT.
Named Entity Recognition (NER) is a task of Natural Language Processing (NLP) that deals with finding and categorizing relevant entities (i.e., word n-grams) in a text, assigning them to predefined semantic categories. The availability of annotated datasets is crucial for developing NER models and assessing their quality. This becomes an issue considering underrepresented languages and specific domains. Furthermore, the word-level annotation required by NER datasets is laborious and prone to inconsistencies. Aiming to contribute to more resources for Portuguese, this paper compiled PetroGeoNER, a NER dataset in the Oil & Gas domain. The process of creating our dataset involved unifying, revising, and solving inconsistencies in two existing datasets. PetroGeoNER was used to train accurate NER models. Both the models and the dataset were made publicly available.
This work explores the use of Large Language Models (LLMs) for post-OCR spelling correction in full sentences across Portuguese, French, and English. Using outputs from a state-of-the-art recognition model on the BRESSAY, RIMES, and IAM datasets, we evaluated two different zero-shot prompts. Closed LLMs, such as Gemini and GPT series, consistently outperform open-source models in reducing Character Error Rate (CER) and Word Error Rate (WER), while also offering faster inference. Despite the good accuracy of open models, their high computational demands hinder their practical use. Code is available at https://github.com/savi8sant8s/zero-shot-spelling-corrector.
A Extração de Informação Aberta (OpenIE) enfrenta desafios na avaliação de seus modelos. Com a utilização de métricas tradicionais de outras áreas e a ausência de um corpus de ouro, surge a dificuldade de avaliar todas as possíveis extrações geradas pelos modelos. Neste trabalho, propomos um método de avaliação comparativa entre diferentes modelos de OpenIE voltados para a ĺıngua portuguesa utilizando grafos de conhecimento. Os resultados obtidos demonstram que modelos capazes de gerar um maior número de triplas com precisão tendem a oferecer melhor desempenho, evidenciando a importância de equilibrar quantidade e qualidade na tarefa de OpenIE.
The advances in Natural Language Processing (NLP) have led to the development of Transformer architectures, such as BERT. One of the most prominent features of this architecture is the attention mechanism. However, the application of attention mechanisms to languages other than English, like Brazilian Portuguese, remains underexplored. This work analyzes the attention heads in a Transformer architecture, considering the syntactic relations in a sentence. We analyze how attention patterns align with syntactic dependencies involving phenomena such as transitive verbs, reflexive pronouns, and subordinate clauses, as realized in Brazilian Portuguese. Results described the existence of specialized heads within arcs, such as subject–verb and verb–object. These findings open up new research opportunities to evaluate syntactic sensitivity in Transformer models and to contribute to the development of more linguistically informed models for Brazilian Portuguese.
LLM evaluations on tasks like high-stakes multidisciplinary tests still rely on raw accuracy, a metric that weights easy and difficult questions equally and ignores guessing. To help bridge this methodological gap, we repurpose the official three-parameter logistic Item Response Theory (IRT) calibration that the Brazilian education authority (INEP) uses to score humans on the Exame Nacional do Ensino Médio (ENEM), and apply it to LLM responses. We then fit a four-dimensional 3-PL model aligned with ENEM’s knowledge domains. Results show that similar accuracies can mask proficiency gaps exceeding one standard deviation across domains. Mathematics remains the toughest domain for both humans and models, whereas questions on Human Sciences are systematically easier for both.
Os modelos de linguagem de grande escala (LLMs) revolucionaram a aquisição virtual de informações. Os LLMs são amplamente utilizados em diferentes tarefas, dada sua facilidade de manuseio e alcance de tópicos. Todavia, não é possível garantir precisão na aprendizagem dos modelos acerca de questões escassamente documentadas, mesmo em se tratando de problemáticas relevantes ou úteis ao seu conhecimento, tal como a declaração de imposto de renda no Brasil. Este trabalho então avalia a coerência de respostas trazidas por essas ferramentas generativas e para isso lhes foram submetidas as perguntas mais frequentes no tema. Assim, os resultados revelam que os LLMs comerciais são convenientes para combater dúvidas sobre a DIRPF.