Descrevem-se dois tipos de reestruturação de completiva-sujeito de adjetivo em português do Brasil: elevação de sujeito (Que João faça isso é bacana / João é bacana em fazer isso) e elevação de objeto (Fazer isso é incomum / Isso é incomum de se fazer). A formação e a extensão desse fenômeno são descritas a partir de uma lista dos lemas de adjetivos mais frequentes em um corpus. Observou-se que os adjetivos que aceitam elevação de sujeito formam um subconjunto, composto principalmente por adjetivos de comportamento e avaliativos, dos que aceitam elevação de objeto.
We present the iRead4Skills Intelligent Complexity Analyzer, an open-access platform specifically designed to assist educators and content developers in addressing the needs of low-literacy adults by analyzing and diagnosing text complexity. This multilingual system integrates a range of Natural Language Processing (NLP) components to assess input texts along multiple levels of granularity and linguistic dimensions in Portuguese, Spanish, and French. It assigns four tailored difficulty levels using state-of-the-art models, and introduces four diagnostic yardsticks—textual structure, lexicon, syntax, and semantics—offering users actionable feedback on specific dimensions of textual complexity. Each component of the system is supported by experiments comparing alternative models on manually annotated data.
The automatic assessment of text complexity has an important role to play in the context of language education. In this study, we shift the focus from L2 learners to adult native speakers with low literacy by exploring the new iRead4Skills dataset in European Portuguese. Furthermore, instead of relying on classical machine learning approaches or fine-tuning a pre-trained language model, we leverage the capabilities of prompt-based Large Language Models (LLMs), with a special focus on few-shot prompting approaches. We explore prompts with varying degrees of information, as well as different example selection approaches. Overall, the results of our experiments reveal that even a single example significantly increases the performance of the model and that few-shot approaches generalize better than fine-tuned models. However, automatic complexity assessment is a difficult and highly subjective task that is still far from solved.
A tarefa de Correção Automática de Redação tem despertado crescente interesse na área de processamento de texto em português. Entre os conjuntos de dados disponíveis, destaca-se um corpus de redações narrativas produzidas por alunos do 5º ao 9º ano do ensino fundamental no Brasil. Essas redações são avaliadas segundo quatro competências: registro formal, coerência temática, estrutura retórica narrativa e coesão textual. Este trabalho explora a criação de um sistema baseado em conhecimentos derivados de outro dataset (desenvolvido com base em textos produzidos para o ENEM) e de outras tarefas (cálculo de complexidade textual e análise de legibilidade). O sistema desenvolvido combina modelos neurais, características (features) curadas calculadas por programas de análise textual e seleção de features em um modelo de Aprendizado em Dois Estágios. Com isso, foi possível elevar a performance em relação ao estado-da-arte, nomeadamente, em 9% para a primeira competência, 5,5% para a terceira e 8,9% para a quarta.
This paper examines the syntactic properties of Portuguese multiword adverbs, focusing specifically on disjunctive adverbs of style (PS). Also known as enunciative, metalinguistic, or illocutionary adverbs, PS adverbs function as sentence-external modifiers, typically expressing the speaker’s attitude on a given statement. Our research has cataloged approximately 3,700 multiword adverbs in Brazilian and European Portuguese, among which 90 have been identified as disjunctive adverbs of style. This study aims not only to define the formal properties and semantic nuances of this adverbial category, but also to provide a comprehensive analysis of its diverse roles in discourse. To achieve this, we examine their occurrences in the Roda Viva corpus (Miranda et al., 2024), which consists of transcripts from 711 interviews in contemporary Brazilian Portuguese.
A partir de um conjunto de dados semi-automaticamente anotados do Corpus de Textos Antigos (CTA), este artigo propõe-se a analisar os resultados obtidos sobre a síncope de -d- intervocálico no morfema da 2.ª pessoa plural, e a consequente resolução do hiato, e as terminações de Particípio Passado -udo/-ido nos verbos com origem etimológica nas 2.ª e 3.ª conjugações latinas. A novidade deste artigo está no recurso a métodos de Processamento de Linguagem Natural (PLN) para a otimização da obtenção e extração sistemática dos dados relevantes para análise, contribuindo para um estudo que engloba um maior conjunto de textos. É apresentada a metodologia adotada para a anotação dos dados, e consequente extração dos dados relevantes à análise, afirmando-se a importância do recurso a métodos e ferramentas de PLN para o estudo linguístico e para a descrição dos estados anteriores da língua portuguesa.
Automatic Essay Scoring is a field that has been receiving a lot of attention in Portuguese. Among the available datasets, one stands out: a corpus of narrative essays written by students from 5th to 9th grade in Brazil. These essays were evaluated according to four traits: formal register, thematic coherence, narrative rhetorical structure, and textual cohesion. This work explores the development of a system based on knowledge from another dataset (developed from texts produced for the Brazilian national entrance exam, ENEM) and from other tasks (textual complexity and legibility analysis). This developed system combines neural models, handcrafted features calculated by textual analysis software, and feature selection, through a Two Stage Learning algorithm. With this system, the state-of-the-art performance was enhanced by 9% for the first trait, 5.5% for the third, and 8.9% for the fourth one.
Este estudo apresenta uma adaptação do esquema de Representação Abstrata de Significado (em inglês, Abstract Meaning Representation – AMR) para o português europeu. Esta adaptação, a que se chamou Representação Lexicalizada de Significado (Lexicalized Meaning Representation – LMR) foi considerada necessária para lidar com desafios específicos apresentados pela gramática da língua, mas também por várias questões linguísticas suscitadas pela versão atual das diretivas de anotação de AMR. Alguns destes aspetos foram uma consequência do uso de notação semelhante ao AMR para representar textos reais, do domínio jurídico, que permitisse o seu uso em aplicações de processamento de linguagem natural (PLN). Neste contexto, vários aspetos do AMR foram drasticamente simplificados, por exemplo, a representação de expressões multipalavra, entidades mencionadas e expressões temporais; enquanto outros foram introduzidos de novo, tendo sido feitos esforços para manter o esquema de representação o mais compatível possível com a notação em AMR padrão.
A avaliação da inteligibilidade de textos e a sua classificação por níveis de complexidade é essencial para o ensino de língua e para indústrias relacionadas com a linguagem que dependem de uma comunicação eficaz. O Quadro Europeu Comum de Referência para as Línguas (CEFR) é uma referência amplamente reconhecida para a classificação dos níveis de proficiência linguística. Este quadro pode ser utilizado não apenas para avaliar a proficiência de aprendentes de uma língua, mas também, de uma perspetiva de inteligibilidade, como um meio de identificar a proficiência necessária para compreender um texto. O objetivo deste estudo é desenvolver e avaliar modelos automáticos capazes de classificar textos em português europeu de acordo com os níveis de complexidade definidos pelo CEFR. Para tal, exploramos o ajuste de vários modelos de base pré-treinados em dados textuais utilizados para fins de avaliação de proficiência e exploramos abordagens que tiram partido da natureza ordinal dos níveis. Realizamos ainda uma análise preliminar da capacidade de base que modelos baseados em instruções têm para desempenhar esta tarefa. Nas experiências, os melhores modelos conseguem atingir mais de 80% de taxa de acerto e 75% de medida F1 mas têm dificuldade em generalizar para diferentes tipos de texto, o que revela a necessidade de dados de treino adicionais e mais diversificados.
Isabel Trancoso合作论文数Instituto Superior Tecnico, University of Lisbon11