
Nous experimentons la contextualisation automatique de textes courts sur la base du Wikipedia anglais comme approche comparative du discours politique francais. Le Wikipedia anglais constitue la ressource encyclopedique la plus complete du moment mais aussi la plus utilisee par les assistants vocaux. Nous analysons ainsi si le Wikipedia anglais peut servir de referentiel des notions relevees dans des communiques politiques en francais, si la traduction automatique peut etre un moyen de projection d’un discours et si la recherche d’information ciblee a partir de ces traductions est adaptee a la contextualisation. Nous appliquons cette methodologie au cas des usages des references feminines dans les discours de l’extreme-droite en France.
Comparative analysis of political discourses in Canada and Quebec using four corpora: the throne speeches (Canada) and the inaugural speeches (Quebec), from 1867 to the present day, and the occasional speeches made by prime ministers outside of the house of representatives. After a reminder of the standards for the constitution of the corpora, the comparison concerns stylistic and lexicometric indices. A new method is presented in order to study the lexical characteristics within two corpora of nearly the same lengths. The differences between Canada and Quebec reflect the division of powers between the federal and provincial levels, but also different conceptions of power, political action, and relations to citizens.
Dans son message annuel sur l’Etat de l’Union (State of the Union) le president americain adresse au Congres ses recommandations et indique ses priorites legislatives. Dans ce cadre relativement fixe, plusieurs etudes ont analyse l’evolution de la rhetorique presidentielle de 1790 a 2018. Avec le temps, les phrases deviennent plus breves, le vocabulaire se simplifie et la longueur moyenne des mots diminue. Le style evolue vers un ton plus assertif et intimiste ; la frequence des pronoms augmente. Le president ne prononce plus de longues explications et donne au discours une tonalite plus religieuse et optimiste. S’appuyant sur une classification automatique, on observe aussi que chaque president apres 1945 dispose generalement d’un style propre et distinct. Toutefois, certaines figures rompent plus nettement avec leurs predecesseurs comme A. Lincoln, T. Roosevelt, W. Wilson, F.D. Roosevelt ou J.F. Kennedy
L’article invite a revisiter l’ouvrage de J.-M. Cotteret et R. Moreau sur le vocabulaire du General de Gaulle (1969). Cinq pistes de recherche sont approfondies a l’aide des discours des 6 successeurs a la presidence de la Republique (G. Pompidou, V. Giscard d’Estaing, F. Mitterrand, J. Chirac, N. Sarkozy, F. Hollande) : la relation a l’auditoire, la personnalisation du discours, la richesse du vocabulaire, la longueur des phrases et les mots preferes. Ces cinq dimensions soulignent la singularite de C. de Gaulle par rapport a tous les autres
Presentation du corpus des interventions de J. Chirac durant ses deux presidences (1995-2002 et 2002-2007) : poids des differents modes de communication, description du vocabulaire, vocables les plus utilises. On constate une stabilite de la communication sur les 12 ans et un poids considerable de l'Europe dans les principaux themes. Mais quel sens donnait J. Chirac a ce mot ? Pour repondre a cette question, on reconstitue le reseau d'associations, d'oppositions et de substitutions qui relie ce mot aux autres vocables du corpus. Les principales caracteristiques de cet univers montrent que le president Chirac avait une attitude distanciee vis-a-vis de la construction de l'Europe.
Recemment, divers travaux se sont interesses a la detection de source de diffusion dans les reseaux sociaux : il s’agit de determiner l’utilisateur a partir duquel une information propagee a initialement ete emise. Dans cet article, nous proposons une nouvelle methode pour la detection de source de diffusion, basee sur des techniques d’apprentissage de representation. Plutot que de s’appuyer sur un modele de diffusion appris a priori pour estimer la source des diffusions observees, l’idee est de projeter les utilisateurs du reseau dans un espace de representation, dans lequel la source de diffusion peut etre efficacement extraite en fonction des positions relatives des utilisateurs infectes par l’information propagee. Cela permet d’etablir un modele de prediction bien moins sensible au bruit et a l’incompletude des donnees que les modeles existants, pour un temps de calcul bien plus faible en prediction. Le modele propose a en effet demontre de bonnes performances sur divers jeux de donnees reels et artificiels.
Les reseaux sociaux permettent une diffusion massive et rapide des informations. Un des problemes principaux de ces canaux de communication est l’absence de verification associee a la viralite de l’information partagee. C’est ce probleme difficile que les participants de la tâche Verifying Multimedia Use du workshop Mediaeval ont aborde. Pour cela, ils ont propose plusieurs strategies et types d’indices relevant de differentes modalites (texte, image, informations sociales). Dans cet article, nous explorons l’interet de combiner et fusionner ces approches pour evaluer le pouvoir predictif de chaque modalite et tirer parti de leur eventuelle complementarite.
RÉSUMÉ. De nombreuses larges bases de connaissances (BC) incertaines sont disponibles sur le Web où les faits sont associés avec un degré de confiance α . En général, Les utilisateurs de ces BC n’ayant qu’une connaissance partielle de leur contenu, certaines de leurs requêtes échouent, c’est à dire qu’elles ne renvoient aucun résultat. Pour éviter cette situation frustrante, et au lieu de renvoyer un ensemble vide de réponses, nous avons proposé une approche expliquant l’échec (pour un degré α et pour plusieurs degrés) en fournissant un ensemble de α Minimal Failing Subqueries ( α MFS), et en calculant des requêtes alternatives, appelées α MaXimal Succeeding Subqueries ( α XSS), qui sont aussi proches que possible de la requête initiale. Les expérimenta-tions menées sur le benchmark WatDiv montrent l’intérêt de nos approches par rapport à une méthode de référence. ABSTRACT. Several large uncertain Knowledge Bases (KBs) are available on the Web where facts are associated with a certainty degree α . Usually, users have only a partial knowledge of the KBs contents, their queries may be failing i.e., they return no result for the desired certainty. To prevent this frustrating situation, instead of returning an empty set of answers, our approach explains the reasons of the failure (for a single degree α and for several degrees) with a set of α Minimal Failing Subqueries ( α MFSs), and computes alternative relaxed queries, called α MaXimal Succeeding Subqueries ( α XSSs), that are as close as possible to the initial failing query. The conducted experiments on the WatDiv benchmark show the relevance of our approaches compared to a baseline method. MOTS-CLÉS : BC incertaines, Requêtes SPARQL, Réponse vide.
ModRef is a project from the laboratory Labex "Les passés dans le présent", which coordinates various projects on digital humanities. ModRef focuses more precisely on the semantic web and linked open data. The goal is to move heterogeneous data into triplestores also called data warehouses or collections of RDF files in order to improve the sharing, exchange and discovery of new knowledge. For this purpose, the CIDOC-CRM norm has been chosen since it is, at present, the reference for the semantic description of museographic or cultural heritage data. In order to realise the proof of concept of ModRef, a general architecture has been defined, a semantic modelling and data mapping of selected sub-projects of ModRef have been proposed, triplestores have also been created. A web application has been implemented and deployed. This web application describes the ModRef project, as well as it enables visualising, querying and exploring created triplestores. RÉSUMÉ. ModRef est un projet du laboratoire Labex "Les passés dans le présent" qui accompagne divers projets sur des problématiques relatives aux humanités numériques. Le projet ModRef s’intéresse spécifiquement au web sémantique et aux données ouvertes et liées. Le but de ce projet est de réaliser une migration de données hétérogènes vers des triplestores encore appelés entrepôts ou collections de fichiers RDF afin d’améliorer le partage, l’échange et la découverte de nouvelles connaissances. Pour ce faire, la norme CIDOC-CRM a été choisie car elle est actuellement la norme de référence pour la description sémantique de l’information muséographique ou d’héritage culturel. Afin de réaliser la preuve conceptuelle de ModRef, une architecture générale a été définie, une modélisation sémantique et un alignement des données des trois sous projets pilotes de ModRef ont été proposés, une migration des données vers des triplestores a également été effectuée. Une application web a été développée et déployée. Cette application web décrit le projet ModRef et permet également de consulter et d’interroger les triplestores créés.
L'etude des caracteristiques contextuelles a ete largement traitee en Recherche d'Information (RI), mais les applications concretes sur de vrais flux de donnees ne sont pas tres repandues. Dans cet article, notre problematique concerne la decision automatique de retweeter un message. En considerant le centre d'interet d'un utilisateur, nous proposons un modele pour effectuer un filtrage automatique en temps-reel du flux Twitter en utilisant de multiples caracteristiques contextuelles. Le modele separe l'aspect contextuel du contenu du message en lui-meme, tout en conservant une tres grande vitesse d'execution. Des experimentations ont ete realisees sur la collection TREC Microblog 2015. Les resultats montrent que l'integration de caracteristiques de contexte a un impact positif sur l'efficacite du filtrage sans penaliser son efficience.
Le projet interdisciplinaire TERRE-ISTEX a pour objectif d'identifier l'evolution des fronts de recherche en relation avec les territoires d'etudes, les croisements disciplinaires ainsi que les modalites concretes de recherche a partir des contenus numeriques heterogenes disponibles dans les corpus scientifiques. Le projet se decompose en trois actions principales~: (1) identifier les periodes et les lieux qui ont fait l'objet d'etudes empiriques et dont rendent compte les publications issues des corpus analyses, (2) identifier les thematiques traitees dans le cadre de ces etudes et enfin (3) developper un demonstrateur Web de recherche d'information geographique (RIG). Les deux premieres actions font intervenir des approches combinant des patrons du traitement automatique du langage naturel a des methodes de fouille de textes. En croisant les trois dimensions (spatial, thematique et temporel) dans un moteur de RIG, il sera ainsi possible de comprendre quelles recherches ont ete menees sur quels territoires et a quel moment. Dans le cadre du projet, les experimentations sont menees sur un corpus heterogene constitue de theses electroniques et d'articles scientifiques provenant des bibliotheques numeriques d'ISTEX et du centre de recherche CIRAD.
Cet article analyse de maniere exploratoire la presence numerique des chercheurs en sciences humaines et sociales (SHS) a partir de deux plateformes developpees en France dans le contexte des SHS : une archive ouverte, HAL-SHS et une plateforme de blogs scientifiques, Hypotheses.org. Sur la base d’une analyse quantitative de grande ampleur, nous avons etudie la presence des chercheurs sur HAL-SHS par discipline, leur participation via une typologie d’usagers de HAL-SHS et leur presence conjointe sur les deux dispositifs.