[0001]技术领域
[0002]本发明属于信息技术领域,具体涉及一种基于动态图表示学习的科研论文合作预测方法。
[0003]背景技术
[0004]随着科技发展的全球化以及研究问题的多元化、精细化和复杂化,科研合作成为学术成果产出的重要途径之一。把学者看作网络的节点,学者之间的合作关系如论文的发表看作网络的边,那么学者的科研合作行为就构成了典型的科研合作网络。分析学者的科研合作网络有助于理清学者合作现状,提升学者科研合作效率,促进学科资源融合,是一个重要的研究课题。科研合作网络具有较高的稀疏性,其关系预测能够在稀疏网络中,实现潜在合作者的精准推荐,从而增强不同学者之间的联系,提高网络密度,促进学科发展和知识传播,最终有效推动科研合作效率。
[0005]对于未来科研论文合作预测任务,可以将其看作动态图的链路预测,目前国内外关于动态图链路预测的文献中,主要是以图神经网络模型和循环神经网络模型相结合的方式,一方面利用图神经网络模型对各个时间段的子图进行图结构信息的捕获,另一方面利用循环神经网络模型对图的时间相关新信息进行捕获,比如EloveGCN等。这类方法通过利用循环神经网络,将前面子图的历史信息用于下一个子图嵌入向量的训练,会存在两个问题,第一上述训练过程中会逐渐丢失一部分历史信息;第二,该方式在训练的时,其存在的时序信息传递的过程,会导致训练效率低。
[0006]发明内容
[0007]本发明的目的在于针对上述现有技术中存在的不足,提供一种基于动态图表示学习的科研论文合作预测方法,解决了训练过程中会逐渐丢失一部分历史信息的问题,并提升了训练效率。
[0008]为达到上述发明目的,本发明采用的如下技术方案:
[0009]一种基于动态图表示学习的科研论文合作预测方法,包括以下步骤
[0010]S1、获取数据并对数据进行处理,得到初始邻接矩阵、初始特征向量、初始科研论文合作的历史信息向量;获取的数据包括科研论文合作网络原始邻接矩阵、原始特征向量以及科研论文合作的历史信息向量;
[0011]S2、将初始邻接矩阵A T 和初始特征向量X T 输入图卷积神经网络,通过图卷积神经网络得到节点嵌入向量;将初始科研论文合作历史信息向量输入全连接神经网络,通过全连接神经网络得到边嵌入向量;
[0012]S3、构建并训练科研论文合作关系预测模型;将S2得到的节点嵌入向量和边嵌入向量输入训练好的科研论文合作关系预测模型中,预测未来的科研论文合作情况。
[0013]进一步的,所述S1包括如下子步骤
[0014]S1.1、获取数据:
[0015]以科研论文合作的作者为节点,以科研论文合作关系为无向边,通过过去各个时段的子图,构建科研论文合作网络 其中t是时间快照的数量,G t 表示t时间段的子图,ε={E 1 ,E 2 ,...,E t },表示这一组连续图快照的边集, 表示这一组连续快照的节点集;
[0016]采用 表示一组连续图快照的邻接矩阵,则该邻接矩阵对应的节点属性矩阵为 对于邻接矩阵,若在某个时间段科研工作者之间有合作,则其对应节点之间存在连接,邻接矩阵对应位置为1,否则为0;对于节点属性矩阵,则采用one-hot编码人为对每个节点设置属性向量;
[0017]S1.2、数据预处理:
[0018]对S1.1中的原始邻接矩阵集 及其对应的属性矩阵集 进行处理,得到初始邻接矩阵A T 和初始特征向量X T ;
[0019]利用S1.1中各子图快照的边集代表各时间段合作关系的存在情况,并以此生成初始的科研论文合作历史信息向量S 0 。
[0020]更进一步的,S1.2中初始科研论文合作历史信息向量生成方法为:
[0021]S1.2.1整合各时间段存在过的边的集合,
[0022]E T =E 1 ∪E 2 ∪…∪E t-1
[0023]S1.2.2对于任意边e ab ∈E T 时间序列向量S ab =[s 1 s 2 …s t-1 ],初始化方式如下:
[0024]S 0 ={S e |e∈E T }。
[0025]进一步的,所述S3按如下步骤训练科研论文合作关系预测模型:
[0026]S3.1、对最后一个时间段的科研论文合作情况进行1:1正负采样,正采样指存在边的结果集E pos ,负采样指不存在边的结果集E neg ;
[0027]建立科研论文合作关系预测模型,该预测模型采用如下公式表示:
[0028]其中,e ij 表示边,E T 表示历史边集,S ij 为S中边e ij 对应的训练好的嵌入向量,z i 和z j 表示训练好的节点的嵌入向量矩阵Z中节点i和节点j的嵌入向量,表示控制节点嵌入向量信息与边的嵌入向量提供的时间相关信息的权重控制参数,λ∈[0,1], 表示预测的边e ij 未来时间段中的存在概率,sigmoid(*)表示sigmoid函数,sum(*)表示sum函数;
[0029]S3.2、根据S2得到的节点嵌入向量和边嵌入向量、S3.1建立的科研论文合作关系预测模型,预测最后一个时间段的科研论文合作概率;
[0030]S3.3、采用交叉熵损失函数作为损失函数,将S3.2得到的正负采样结果集引入交叉熵损失函数中,计算科研论文合作关系预测模型的损失,具体计算如公式如下:
[0031]其中,p e 代表边e是否存在, 代表预测边e存在的概率;
[0032]S3.4、以损失函数最小为目标,采用梯度下降法和Adam优化器对科研论文合作关系预测模型进行训练;
[0033]S3.5、判断损失函数值是否收敛,若是,则训练完成,否则返回步骤S3.4。
[0034]进一步的,所述S3利用训练好的科研论文合作关系预测模型,预测未来的科研论文合作情况的具体操作为:
[0035]对S2.得到的训练后的节点向量和边嵌入向量进行融合,获得未来科研合作关系的存在概率
[0036]判断得到研论文合作关系的存在概率 是否大于0.5,若是,则判定科研工作者i与科研工作者j在未来会有合作,若否,则二者未来没有合作。
[0037]进一步的,所述S2的图卷积申请网络为两层图卷积神经网络,每层的公式如下:
[0038]H (k+1) =σ(H k ,A T |W k )=σ(D -1/2 A T D 1/2 H k W k )
[0039]其中,σ代表激活函数,选用LeakyReLU激活函数,第1层图卷积层的输入为初始属性矩阵X T =H 0 ;将合并后的图的邻接矩阵信息A T 及其对应节点的属性信息X T 输入定义好的图卷积层模型后,可以得到第2层图卷积层的输出,该输出为节点的嵌入向量矩阵,即Z=H (2) ={z 1 ,z 2 ,…,z N } T 。
[0040]进一步的,所述S2的全连接神经网络同样为两层全连接神经网络,每层公式如下:
[0041]y (k+1) =σ(W (k+1) y (k) +b (k+1) )
[0042]其中,σ代表激活函数,本方法选用线性修正单元ReLU作为激活函数,y (k) 代表第k曾全连接层输出的结果,第1层全连接层的输入为初始合作历史信息向量矩阵S 0 =y 0 。第2层也就是最后一层全连接层输出的合作历史信息嵌入向量为S=y 2 。
[0043]本发明通过图卷积神经网络,捕获科研论文合作关系网络中的结构信息生成节点的嵌入向量;通过全连接神经网络,捕获表示科研论文合作关系网络中历史时间相关信息的边嵌入向量。然后融合这两种向量进行未来科研论文合作关系的预测,解决了训练过程中会逐渐丢失一部分历史信息的问题。由于没有使用循环神经网络这种序列式训练的方法,本发明方法对于节点、边嵌入向量的生成均为静态的训练方式,模型的训练效率大幅提升,且准确率更高。
[0044]与现有技术相比,本发明的预测方法能够准确、高效的预测未来科研论文合作关系,实现了稀疏网络中潜在合作者的精准推荐,增强了不同学者之间的联系,提高了网络密度,促进学科发展和知识传播,最终有效推动科研合作效率。
[0045]附图说明
[0046]图1为本发明提出的一种基于动态图表示学习的科研论文合作预测方法流程图;
[0047]图2为本发明提出的方法的工作流程框架图;
[0048]图3为本发明的实施例中科研论文合作网络实例示意图;
[0049]图4为本发明中节点、边嵌入向量权重设置的敏感性分析结果图;
[0050]图5为本发明中训练集时间长度调节后的对比实验结果示意图。
[0051]具体实施方式
[0052]下面对本发明的具体实施方式进行描述,以便于本技术领域的技术人员理解本发明,但应该清楚,本发明不限于具体实施方式的范围,对本技术领域的普通技术人员来讲,只要各种变化在所附的权利要求限定和确定的本发明的精神和范围内,这些变化是显而易见的,一切利用本发明构思的发明创造均在保护之列。
[0053]下面结合附图详细说明本发明的实施例。
[0054]图2为本发明提出的方法的工作流程框架图,在具体介绍模型各个具体细节步骤前做整体介绍。框架图从左到右分三部分来看:左侧是输入模块,将要训练的各时间片的图的邻接矩阵、节点属性矩阵送入模型;中间是嵌入生成模块,其中节点嵌入生成模块先进行各时间片的子图融合,融合后送入图卷积神经网络生成节点嵌入向量,边嵌入模块先进行边的存在向量统计,然后送入全连接神经网络得到边嵌入向量;右侧链路预测模块,利用得到的节点、边嵌入向量预测未来科研合作关系的存在情况。
[0055]如图1所示,本实施例提供的一种基于动态图表示学习的科研论文合作预测方法,包括以下步骤:
[0056]S1、获取初始邻接矩阵、特征向量以及科研论文合作的历史信息向量;
[0057]所述步骤S1包括以下子步骤:
[0058]S1.1、以科研论文合作的作者为节点,以科研论文合作关系为无向边,通过过去各个时段的子图,构建科研论文合作网络 其中t是时间快照的数量,G t 表示t时间段的子图,ε={E 1 ,E 2 ,…,E t },表示这一组连续图快照的边集, 表示这一组连续快照的节点集。
[0059]采用 表示一组连续图快照的邻接矩阵,该一阶邻接矩阵对应的节点属性矩阵为 对于邻接矩阵,若在某个时间段科研工作者之间有合作,则其对应节点之间存在连接,邻接矩阵对应位置为1,否则为0。对于节点属性矩阵,目前科研论文合作网络的节点通常没有具体的属性,本实施例采用one-hot编码人为对每个节点设置属性向量。
[0060]S1.2、利用S1.1中原始的邻接矩阵集合 以及属性矩阵集合 分别去除了最后一个时间段的矩阵进行合并生成初始邻接矩阵A T 和特征向量X T ,合成方式为:
[0061]A T =A 1 +A 2 +…+A t-1
[0062]S1.3、利用S1.1中各子图快照的边集ε,代表各时间段合作关系的存在情况,并以此生成初始科研论文合作历史信息向量。具体为:
[0063]整合各时间段存在过的边的集合:
[0064]E T =E 1 ∪E 2 ∪…∪E t-1
[0065]根据整合结果对于任意边e ab ∈E T 时间序列向量S ab =[s 1 s 2 …s t-1 ],按如下方式初始化:
[0066]S 0 ={S e |e∈E T }
[0067]得到的S 0 即为初始科研论文合作历史信息向量矩阵。
[0068]在本实施例中,使用的科研论文合作数据集是公开提供的,这个学术合作数据集包含了315名研究人员从2000年到2009年的科研合作合作,按照每年作为一个时间段划分的子图,每个子图上节点代表一个作者,一条边对应着一次科研论文合作关系。数据集的具体信息如表1所示。
[0069]表1科研合作网络数据统计
[0070]上表为CLOAB数据集的具体信息,本实例中训练集长度为7,我们选择前7个时间段的网络进行训练,预测第8个时间段的科研论文合作情况。
[0071]为便于理解,本实施按图3构建了一个含有5个时间段、5个用户科研论文合作网络实例的训练集。属性矩阵通过one-hot编码生成。
[0072]第1个时间段的网络的邻接矩阵和属性矩阵如表2、3所示。
[0073]表2第1个时间段网络邻接矩阵
[0074]表3第1个时间段节点属性矩阵
[0075]第2个时间段的网络的邻接矩阵和属性矩阵如表4、5所示。
[0076]表4第2个时间段网络邻接矩阵
[0077]表5第2个时间段节点属性矩阵
[0078]第3个时间段网络的邻接矩阵和属性矩阵如表6、7所示。
[0079]表6第3个时间段网络邻接矩阵
[0080]表7第3个时间段节点属性矩阵
[0081]第4个时间段网络的邻接矩阵和属性矩阵如表8、9所示。
[0082]表8第4个时间段网络邻接矩阵
[0083]表9第4个时间段节点属性矩阵
[0084]第5个时间段网络的邻接矩阵和属性矩阵如表10、11所示。
[0085]表10第5个时间段网络邻接矩阵
[0086]表11第5个时间段节点属性矩阵
[0087]训练时,我们选择训练集除最后一个时间段的子图外的时间段子图,形成步骤S1中的初始邻接矩阵、初始特征矩阵、初始科研论文合作关系的历史向量矩阵。
[0088]除去最后一个时间段合成后的初始邻接矩阵和特征矩阵如表12、13所示。
[0089]表12合成后的邻接矩阵
[0090]表13合成后节点属性矩阵
[0091]除去最后一个时间段形成的初始科研论文合作关系历史矩阵如表14所示。
[0092]表14初始的合作关系历史矩阵
[0093]S2、利用S1中处理好的数据训练模型参数,获得捕获了科研论文合作网络时空信息的节点和边的嵌入向量。所述步骤S2的具体操作为:
[0094]将初始邻接矩阵A T 和初始特征向量X T 输入图卷积神经网络,得到节点嵌入向量;将初始科研论文合作历史信息向量输入全连接神经网络,得到边嵌入向量。
[0095]图卷积神经网络具有平滑和传播信息的作用,图卷积神经网络为两层图卷积神经网络,每层的公式如下:
[0096]H (k+1) =σ(H k ,A T |W k )=σ(D -1/2 A T D 1/2 H k W k )
[0097]在本实例中,σ选用LeakyReLU激活函数,输入的 由于用到了两层图卷积神经网络,对应的两个参数矩阵 最后得到的节点的嵌入向量矩阵
[0098]两层全连接神经网络用于训练边的时序信息向量,每层公式如下:
[0099]y (k) =σ(W (k) y (k-1) +b (k) )
[0100]y (k+1) =σ(W (k+1) y (k) +b (k+1) )
[0101]在本实例中,σ选用ReLU激活函数,两层全连接网络的输入 564为训练集中除最后一个时间段外出现过的合作关系的数量,6代表时间段的数量。两层全连接层所对应的参数矩阵 对应的两个偏置矩阵 第2层也就是最后一层全连接层输出的合作历史信息嵌入向量为
[0102]S3、融合S2得到的节点嵌入向量和边嵌入向量,预测未来的科研论文合作情况。详细过程如下:
[0103]构建并训练科研论文合作关系预测模型:
[0104]S3.1、建立科研论文合作关系预测模型,该预测模型采用如下公式表示:
[0105]E T 为各时间段存在过的边的集合,||代表向量拼接, 二者为边(i,j)对应节点的嵌入向量, 为边(i,j)对应的训练后的历史合作信息。
[0106]有上述公式可知,本实施例采用的预测方法需要先判定要预测的边e ij 是否出现在历史边集E T 中,如果不在则用节点相似度的方式计算,否则我们先将节点的嵌入向量每位相乘,完成计算边存在概率的第一步,此时相当于得到了节点嵌入向量之间的一个相似度向量,然后将训练好的边的存在序列嵌入向量与当前得到的两节点嵌入向量乘积进行拼接,相当于对边特征进行了扩充,之后再进行边存在概率的计算。λ表示控制节点嵌入向量信息与边的嵌入向量提供的时间相关信息的权重控制参数,λ∈[0,1], 表示预测的边e ij 的存在概率,sigmoid(*)表示sigmoid函数,sum(*)表示sum函数。
[0107]对最后一个时间段的科研论文合作情况进行1:1正负采样用于损失函数的计算。采样正边也就是存在的边的结果集为 采样负边也就是不存在的边的结果集为
[0108]S3.2、根据S2得到的节点嵌入向量和边嵌入向量、S3.1建立的科研论文合作关系预测模型,预测最后一个时间段的科研论文合作概率;
[0109]S3.3、构建损失函数。本方法采用交叉熵损失函数作为损失函数,将S3.2得到的正负采样结果集引入交叉熵损失函数中,计算科研论文合作关系预测模型的损失,具体计算如公式如下:
[0110]其中,p e 代表边e是否存在, 代表预测边e存在的概率。
[0111]S3.4、以损失函数最小为目标,采用梯度下降法和Adam优化器对科研论文合作关系预测模型进行训练;
[0112]S3.5、判断损失函数值是否收敛,若是,则训练完成,否则返回步骤S3.4。
[0113]融合S2中获得的训练好的两种嵌入向量预测未来的科研论文合作情况:
[0114]利用训练好的建立科研论文合作关系预测模型,对S2得到的节点向量和边嵌入向量进行融合,获得未来科研合作关系的存在概率 计算公式如下:
[0115]在本实例中λ=0.3,E T 为各时间段存在过的边的集合,||代表向量拼接, 二者为边(i,j)对应节点的嵌入向量, 为边(i,j)对应的训练后的历史合作信息,sigmoid(*)表示sigmoid函数,sum(*)表示sum函数。 即为边(i,j)在测试集也就是未来时间段中的存在概率。
[0116]判断S3.1得到研论文合作关系的存在概率 是否大于0.5,若是,则判定科研工作者i与科研工作者j在未来会有合作,若否,则二者未来没有合作。
[0117]将目前主流的动态图链路预测方法作为基线方法,包括经典图嵌入方法GCN、GAT的动态图应用方式以及专门用作动态图的GCN-GRU、GC-LSTM、EloveGCN、HTGN,其中EloveGCN有-H和-O两种版本,前者循环神经网络使用GRU,后者使用LSTM。度量链路预测任务的指标选择AUC以及MAP,实验结果如表15所示。
[0118]表15链路预测结果表
[0119]根据表15我们可知,静态图方法GCN、GAT相比于专门用于动态图的其他方法效果差了很多,并且我们的方法在AUC以及MAP这两个指标上均做到了最优,具有更好的预测能力。
[0120]另外目前的基线方法均是采用循环神经网络作为时间信息捕获的方式,而循环神经网络的训练效率较低,我们的方法放弃了这种思路,将时间相关信息放在了边的嵌入向量中,采用静态训练的方式,具有更高的训练速度。表16为训练100个epoch各模型所需的平均时间单位为ms,这里只计算了专门用于动态图的方法,对于GCN、GAT这两个静态图方法没有进行计算。
[0121]表16一轮训练所需的平均时间表
[0122]通过表16可知我们的方法大幅降低了模型的训练时间,训练效率大幅提升。
[0123]图4展示了本发明在进行未来合作关系预测时节点、边的权重设置对于试验结果的影响,也就是方法对于λ的敏感性,λ越大代表节点嵌入向量对预测结果产生的影响就越大,而边嵌入向量对于预测结果产生的影响就越小。通过图4我们可以发现,当λ=0.4时,本实例中的预测效果最佳。另外当λ=0时代表完全用边的嵌入向量做预测,当λ=1时代表完全用节点嵌入向量做预测,这两种情况相比于其他都用到的情况预测效果降低明显,说明二者一起用会产生积极影响。以此绘制出了图4。
[0124]图5中展示了不同训练集长度的条件下,本发明与两个次优的基线方法HTGN、EloveGCN预测效果的变化情况,其中EloveGCN的结果取-H和-O版本的最优值。可以看出随着训练集长度的降低,三种方法的预测准确率均下降,这说明丰富的历史信息对于预测未来科研合作有着积极的影响。还可看出本方法在各个长度下基本做到了最优,说明其具有不错的鲁棒性。以此绘制出图5。
[0125]综上可见,本实施例的基于动态图表示学习的科研论文合作预测方法,具有预测准确率高、训练速度快的优点。在实际的生产环境中,给定已有的科研论文合作网络历史信息,利用本发明能够预测未来的科研论文合作关系,而科研论文合作网络的关系预测能够在稀疏网络中实现潜在合作者的精准推荐,从而增强不同学者之间的联系,提高网络密度,促进学科发展和知识传播,最终有效推动科研合作效率。