Recemment, divers travaux se sont interesses a la detection de source de diffusion dans les reseaux sociaux : il s’agit de determiner l’utilisateur a partir duquel une information propagee a initialement ete emise. Dans cet article, nous proposons une nouvelle methode pour la detection de source de diffusion, basee sur des techniques d’apprentissage de representation. Plutot que de s’appuyer sur un modele de diffusion appris a priori pour estimer la source des diffusions observees, l’idee est de projeter les utilisateurs du reseau dans un espace de representation, dans lequel la source de diffusion peut etre efficacement extraite en fonction des positions relatives des utilisateurs infectes par l’information propagee. Cela permet d’etablir un modele de prediction bien moins sensible au bruit et a l’incompletude des donnees que les modeles existants, pour un temps de calcul bien plus faible en prediction. Le modele propose a en effet demontre de bonnes performances sur divers jeux de donnees reels et artificiels.
RÉSUMÉ. Récemment, divers travaux se sont interessés à la détection de source de diffusion dans les réseaux sociaux : il s’agit de déterminer l’utilisateur à partir duquel une information propagée a initiallement été émise. Dans cet article, nous proposons une nouvelle méthode pour la détection de source de diffusion, basée sur des techniques d’apprentissage de représentation. Plutôt que de s’appuyer sur un modèle de diffusion appris a priori pour estimer la source des diffusions observées, l’idée est de projeter les utilisateurs du réseau dans un espace de représentation, dans lequel la source de diffusion peut être efficacement extraite en fonction des positions relatives des utilisateurs infectés par l’information propagée. Cela permet d’établir un modèle de prédiction bien moins sensible au bruit et à l’incomplétude des données que les modèles existants, pour un temps de calcul bien plus faible en prédiction. Le modèle proposé a en effet démontré de bonnes performances sur divers jeux de données réels et artificiels.
Probabilistic cascade models consider information diffusion as an iterative process in which information transits between users of a network. The problem of diffusion modeling then comes down to learning transmission probability distributions, depending on hidden influence relationships between users, in order to discover the main diffusion channels of the network. Various learning models have been proposed in the literature, but we argue that the diffusion mechanisms defined in most of these models are not well-adapted to deal with noisy diffusion events observed from real social networks, where transmissions of content occur between humans. Classical models usually have some difficulties for extracting the main regularities in such real-world settings. In this paper, we propose a relaxed learning process of the well-known independent cascade model that, rather than attempting to explain exact timestamps of users’ infections, focus on infection probabilities knowing sets of previously infected users. Furthermore, we propose a regularized learning scheme that allows the model to extract more generalizable transmission probabilities from training social data. Experiments show the effectiveness of our proposals, by considering the learned models for real-world prediction tasks.
Le modele Independent Cascades (IC) est un modele central pour la capture des dynamiques de diffusion d’information sur les reseaux sociaux. Nous nous interessons ici a l’apprentissage des probabilites de transmission utilisees par ce modele. Plutot que de directement travailler sur le graphe du reseau social considere, ce qui implique un cout important du au nombre de parametres a apprendre pour les reseaux denses, nous proposons une approche basee sur des techniques d’apprentissage de representations, afin d’alleger le processus et de gagner en generalisabilite. L’idee est de chercher une projection des utilisateurs du reseau dans un espace vectoriel, de maniere a ce que les distances entre les individus representent leurs probabilites de transmission d’information. Les experimentations menees demontrent la pertinence de l’approche pour la modelisation des dynamiques de diffusion.
In this paper, we study the problem of source detection in the context of information diffusion through online social networks. We propose a representation learning approach that leads to a robust model able to deal with the sparsity of the data. From learned continuous projections of the users, our approach is able to efficiently predict the source of any newly observed diffusion episode. Our model does not rely neither on a known diffusion graph nor on a hypothetical probabilistic diffusion law, but directly infers the source from diffusion episodes. It is also less complex than alternative state of the art models. It showed good performances on artificial and real-world datasets, compared with various state of the art baselines.
In this paper, we focus on information diffusion through social networks. Based on the well-known Independent Cascade model, we embed users of the social network in a latent space to extract more robust diffusion probabilities than those defined by classical graphical learning approaches. Better generalization abilities provided by the use of such a projection space allows our approach to present good performances on various real-world datasets, for both diffusion prediction and influence relationships inference tasks. Additionally, the use of a projection space enables our model to deal with larger social networks.
Le modele Independent Cascades (IC) est un modele central pour la capture des dynamiques de diffusion d’information sur les reseaux sociaux. Nous nous interessons ici a l’apprentissage des probabilites de transmission utilisees par ce modele. Plutot que de directement travailler sur le graphe du reseau social considere, ce qui implique un cout important du au nombre de parametres a apprendre pour les reseaux denses, nous proposons une approche basee sur des techniques d’apprentissage de representations, afin d’alleger le processus et de gagner en generalisabilite. L’idee est de chercher une projection des utilisateurs du reseau dans un espace vectoriel, de maniere a ce que les distances entre les individus representent leurs probabilites de transmission d’information. Les experimentations menees demontrent la pertinence de l’approche pour la modelisation des dynamiques de diffusion.
Probabilistic cascade models consider information diffusion as an iterative process in which information transits from users to others in a network. The problem of diffusion modeling then comes down to learning transmission probability distributions, depending on hidden influence relationships between users, in order to discover the main diffusion channels of the network. Various learning models have been proposed in the literature, but we argue that the diffusion mechanisms defined in most of these models are too complex for real social networks, where transmissions of content occur between human users. Classical models usually have some difficulties for extracting the main regularities in such real-world settings. In this paper, we propose a relaxed learning process of the well-known Independent Cascade model that, rather than attempting to explain exact timestamps of users' infections, focus on infection probabilities knowing sets of previously infected users. Experiments show the effectiveness of our proposals, by considering the learned models for real-world prediction tasks.
We introduce a model for predicting the diffusion of content information on social media. When propagation is usually modeled on discrete graph structures, we introduce here a continuous diffusion model, where nodes in a diffusion cascade are projected onto a latent space with the property that their proximity in this space reflects the temporal diffusion process. We focus on the task of predicting contaminated users for an initial initial information source and provide preliminary results on differents datasets.
Analyzing and modeling the temporal diffusion of information on social media has mainly been treated as a diffusion process on known graphs or proximity structures. The underlying phenomenon results however from the interactions of several actors and media and is more complex than what these models can account for and cannot be explained using such limiting assumptions. We introduce here a new approach to this problem whose goal is to learn a mapping of the observed temporal dynamic onto a continuous space. Nodes participating to diffusion cascades are projected in a latent representation space in such a way that information diffusion can be modeled efficiently using a heat diffusion process. This amounts to learning a diffusion kernel for which the proximity of nodes in the projection space reflects the proximity of their infection time in cascades. The proposed approach possesses several unique characteristics compared to existing ones. Since its parameters are directly learned from cascade samples without requiring any additional information, it does not rely on any pre-existing diffusion structure. Because the solution to the diffusion equation can be expressed in a closed form in the projection space, the inference time for predicting the diffusion of a new piece of information is greatly reduced compared to discrete models. Experiments and comparisons with baselines and alternative models have been performed on both synthetic networks and real datasets. They show the effectiveness of the proposed method both in terms of prediction quality and of inference speed.
Depuis l’ emergence des reseaux sociaux en ligne il y a une dizaine d’annees, les problematiques liees a la diffusion d’information sur ces nouveaux medias ont quasiment toujours ete traitees sur la base de la topologie sociale des reseaux consideres. Faisant le constat que le graphe social d’un reseau, s’il est connu, ne reflete que rarement les veritables canaux de communication entre utilisateurs, nous proposons ici de traiter la diffusion d’information comme un processus de propagation dans un espace de representation continu, dans lequel les positions relatives des utilisateurs traduisent leur propension a echanger du contenu. Les resultats experimentaux obtenus sur des jeux de donnees reelles demontrent l’interet de l’approche proposee, tant en terme de rapidite qu’en terme de qualite de la prediction, et permettent d’envisager diverses directions de recherche dans le contexte de la diffusion d’information.
Dans ce manuscrit, nous étudions la diffusion d'information dans les réseaux sociaux en ligne. Des sites comme Facebook ou Twitter sont en effet devenus aujourd'hui des media d'information à part entière, sur lesquels les utilisateurs échangent de grandes quantités de données. La plupart des modèles existant pour expliquer ce phénomène de diffusion sont des modèles génératifs, basés sur des hypothèses fortes concernant la structure et la dynamique temporelle de la diffusion d'information. Nous considérerons dans ce manuscrit le problème de la prédiction de diffusion dans le cas où le graphe social est inconnu, et où seules les actions des utilisateurs peuvent être observées. - Nous proposons, dans un premier temps, une méthode d'apprentissage du modèle independent cascade consistant à ne pas prendre en compte la dimension temporelle de la diffusion. Des résultats expérimentaux obtenus sur des données réelles montrent que cette approche permet d'obtenir un modèle plus performant et plus robuste. - Nous proposons ensuite plusieurs méthodes de prédiction de diffusion reposant sur des technique d'apprentissage de représentations. Celles-ci nous permettent de définir des modèles plus compacts, et plus robustes à la parcimonie des données. - Enfin, nous terminons en appliquant une approche similaire au problème de détection de source, consistant à retrouver l'utilisateur ayant lancé une rumeur sur un réseau social. En utilisant des méthodes d'apprentissage de représentations, nous obtenons pour cette tâche un modèle beaucoup plus rapide et performant que ceux de l'état de l'art.