Although heterogeneous information networks (HINs) enable fine-grained modeling, their heterogeneous graph neural network (HGNN) implementations may yield biased predictions in human-centric applications. In this work, we revisit the problem of bias in HINs and fairness-enhancing methods for HGNNs, and propose the concept of self-limiting heterogeneous bias information. Accordingly, we introduce FairBubble, a general framework to promote fairness in HGNNs. FairBubble automatically identifies neutralizing information from the heterogeneous neighbors of target-type nodes and utilizes a hypergraph convolution-based pre-propagation mechanism to mitigate bias. The framework constructs fairness-promoting hyperrelations, enabling the dilution of biased information prior to standard message propagation in the target HGNN. Importantly, FairBubble is plug-and-play, requires no manual metapath engineering, and is broadly applicable across different HGNN architectures and application scenarios, thus demonstrating strong generalizability. Spectral analysis confirms that hypergraph convolution-based pre-propagation effectively neutralizes bias in HINs. Experiments on three public HIN benchmarks show that FairBubble achieves superior performance in both fairness and utility metrics compared to state-of-the-art HGNN fairness approaches.
The effectiveness of large language models (LLMs) to fact-check misinformation remains uncertain, despite their growing use. To this end, we present CANDY, a benchmark designed to systematically evaluate the capabilities and limitations of LLMs in fact-checking Chinese misinformation. Specifically, we curate a carefully annotated dataset of 20k instances. Our analysis shows that current LLMs exhibit limitations in generating accurate fact-checking conclusions, even when enhanced with chain-of-thought reasoning and few-shot prompting. To understand these limitations, we develop a taxonomy to categorize flawed LLM-generated explanations for their conclusions and identify factual fabrication as the most common failure mode. Although LLMs alone are unreliable for fact-checking, our findings indicate their considerable potential to augment human performance when deployed as assistive tools in scenarios. Our dataset and code can be accessed at https://github.com/SCUNLP/CANDY
Multi-label image classification is recognized as an important task within the field of computer vision, a discipline that has experienced a significant escalation in research endeavors in recent years. The widespread adoption of convolutional neural networks (CNNs) has catalyzed the remarkable success of architectures such as ResNet-101 within the domain of image classification. However, in multi-label image classification tasks, it is crucial to consider the correlation between labels. In order to improve the accuracy and performance of multi-label classification and fully combine visual and semantic features, many existing studies use graph convolutional networks (GCN) for modeling. Object detection and multi-label image classification exhibit a degree of conceptual overlap; however, the integration of these two tasks within a unified framework has been relatively underexplored in the existing literature. In this paper, we come up with Object-GCN framework, a model combining object detection network YOLOv5 and graph convolutional network, and we carry out a thorough experimental analysis using a range of well-established public datasets. The designed framework Object-GCN achieves significantly better performance than existing studies in public datasets COCO2014, VOC2007, VOC2012. The final results achieved are 86.9%, 96.7%, and 96.3% mean Average Precision (mAP) across the three datasets.
With the increasing use of open-source libraries and secondary development, software projects face security vulnerabilities. Existing studies on source code vulnerability detection rely on natural language processing techniques, but they overlook the intricate dependencies in programming languages. To address this, we propose a framework called Context and Multi-Features-based Vulnerability Detection (CMFVD). CMFVD integrates source code graphs and textual sequences, using a novel slicing method called Context Slicing to capture contextual information. The framework combines graph convolutional networks (GCNs) and bidirectional gated recurrent units (BGRUs) with attention mechanisms to extract local semantic and syntactic information. Experimental results on Software Assurance Reference Datasets (SARDs) demonstrate CMFVD’s effectiveness, achieving the highest F1-score of 0.986 and outperforming other models. CMFVD offers a promising approach to identifying and rectifying security flaws in large-scale codebases.
基于瞬态液晶测试技术和数值仿真,在相同孔隙率条件下,研究了桁架型点阵结构的单元类型和排布角度对矩形通道壁面对流传热特性的影响.结果表明:点阵单元类型对壁面传热性能有决定性的影响,其中交叉排布的体心立方(body centered cubic-0,BCC-0)和Kagome-0点阵归因于出色的传热强化效果,雷诺数在5 700~17 100的范围内,其综合传热效率分别比柱肋阵列高出了 9%~21%和4%~12%;而共线排布的面心立方点阵(face centered cubic,FCC)则都表现出较低的传热性能.在单元类型相同的条件下,选择合适的排布角度有利于进一步提高传热性能,其中Kagome-90和BCC-0分别比Kagome-0和BCC-45点阵的传热效率高3%~10%和5%~15%.
定向灰盒模糊器是由M.B?hme于2017年首次提出的,称之为AFLGo,其将主要的测试时间花在特定的目标区域上,有良好的定向性和实效性,但其能量调度策略存在能量分配不公平问题及路径探索不全面问题.针对上述问题,提出一种混合能量调度策略,综合考虑种子的稀有性和距离值对其能量分配的影响.在整个模糊测试的过程中,不只按照AFLGo基于种子距离值的能量调度策略为种子分配能量,也设计基于路径覆盖的种子能量因子算法全面调整种子能量,以提高其路径探索及漏洞挖掘能力,实现基于混合能量调度策略的模糊测试工具Gem-energy.在五个应用程序上测试了Gem-energy.实验证明,相比AFLGO,在总路径数,唯一崩溃量以及分支覆盖率三个评估指标上Gem-energy有所提升,且具有定向能力.
近年来,社交媒体上以图像和文本为主要内容的多模态信息不断增多,不同模态之间的情感信息相互关联,互为补充.利用海量的不同模态的社交媒体数据信息,有助于更好地对公众情感进行分析.为充分利用图像与文本各自模态中的情感信息,充分挖掘图像与情感信息之间的交互信息,提出一种基于注意力机制和双线性融合的多模态混合融合情感分析模型,构建BERT-BiGRU-Att文本分类模型和ResNet-Att图像分类模型,基于双线性融合的特征融合模型,并利用Dempster组合规则作为决策融合方式构建混合融合模型.在推特图文情感分析数据集上进行了实验,实验结果显示模型能够有效挖掘各模态特征,利用图文信息之间的相关性,在情感分析任务中获得更好的性能.
针对现有的静态代码分析工具有较高的误报率与漏报率,提出一种基于切片依赖图(Slice Dependency Graph,SDG)的自动化漏洞检测方法,将程序源代码解析为包含数据依赖和控制依赖信息的切片依赖图,然后使用图神经网络对切片依赖图的结构进行表征学习,最后使用训练的神经网络模型预测待测程序源代码中的漏洞.在5类常见缺陷分类(Common Weakness Enumeration,CWE)样本构成的数据集上开展了实验,结果表明误报率和漏报率均低于作为对比的其他方法,准确率和F1得分两个指标均有提高,因此所提方法能有效提高漏洞检测能力.
深度学习被应用于源代码漏洞检测,以解决传统的源代码漏洞检测方法高误报率、高漏报率等问题,但常见的基于循环神经网络的方法面临训练速度慢、可解释性差等问题.针对这些问题,提出了一种结合卷积神经网络和高速神经网络的源代码漏洞检测模型.该模型使用代码切片作为代码表征,通过卷积神经网络提取特征,结合高速神经网络学习代码的高级特征,并使用显著图对模型检测结果进行解释.实验结果表明,与现有方法相比,该模型可大幅降低漏报率,有效提升准确率、F1分数、马修斯相关系数等指标,还能够提升训练与预测速度.
AFL基于遗传算法和多种变异策略来生成程序测试用例,以检测程序的漏洞,但AFL仅依赖控制流信息决定参与进一步模糊的种子,难以发现c、c++程序中存在的内存操作问题,且AFL简单的favorite策略没有充分考虑种子的特性和执行路径的特征,导致能够触发崩溃的种子迟迟不能被执行.因此,通过插桩获取程序的反馈信息,然后计算路径的风险适应度以指导种子选择,并对favorite策略进行优化,设计实现了模糊测试工具Risk-AFL.在4个应用程序上对该测试工具进行评估,结果表明,相较于其他工具,其路径发现和漏洞发现的效率都有一定提高.
使用BERT预训练模型及神经网络提取公共安全事件命名实体.以中文突发事件语料库(Chinese emergency corpus,CEC)为实验数据集,使用BIO序列标注方法标记该数据集的实体.采用 BERT(bidirectional encoder representations from transformers)预训练模型获取单个汉字的词向量,并使用BiLSTM(双向长短期记忆网络)及CRF(条件随机场)的融合模型提取特征,用以识别公共安全事件的时间、地点、参与者及参与者的行为.采用CRF,BiLSTM,BiLSTM-CRF,BERT-BiLSTM-CRF进行对比实验.实验结果表明,使用的方法准确率达到90%以上,召回率及F1值均达到85%以上,证明该模型解决了一词多义的问题,可以有效获取公共安全事件中的重要实体信息.
基于边缘计算的物联网异常流量检测技术的出现很好地弥补了传统物联网异常流量检测技术的高时延、高通信开销等问题,但现有的基于边缘计算的物联网异常流量检测存在检测率低、模型不够轻量化等问题.基于上述原因,提出了一种基于XGBoost-BLS的新的轻量级检测模型,模型位于更靠近数据源的边缘计算层,将极端梯度提升的强大特征选择能力与宽度学习系统的强大的泛化能力相结合,提升了物联网异常流量检测的检测率.在两个公开数据集上进行测试,实验结果表明,模型在保证模型轻量化的同时又能得到较高的检测准确率.
物联网设备具备通信能力,安全认证设备端与服务器能有效保障用户隐私安全.物理不可克隆函数(Physical Undonable Function, PUF)具备可靠性、唯一性等特点,可作为物联网身份凭据.本文基于PUF设计了物联网设备与服务器双向认证轻量级方案,该方案具备对中闻人攻击、重放攻击等的抵抗能力,且具备前向安全和后向安全.
水下海洋观测仪器位于海底深处开放海域中,正常工作时处于无人值守状态,拥有功耗受限导致的休眠/激活模式,容易遭受假冒、侧信道分析攻击.针对休眠模式下仪器的不同唤醒方式,提出了基于PUF和伪随机序列的双向身份认证方案:外部唤醒时,认证服务器主动唤醒仪器进行认证;自主苏醒时,仪器主动通知认证服务器进行认证.该方案基于终端PUF,并使用序列号和轻量级哈希函数对其加密,完成双向身份认证.此外,通信中使用伪随机序列加密链路层数据,改变信息中"0"和"1"的分布规律.该方案无需仪器预先存储私密密钥,且只在特定时间窗口发送数据.安全性分析表明,该方案能抵抗多种常见攻击,适用于水下海洋观测仪器的双向身份认证.
物联网架构与设备的特殊性,传统集中式入侵检测方案的局限性以及物联网边缘数据的激增,都对物联网的安全性提出了更高的要求.边缘计算的出现为解决这一问题提供了新的思路.本文首先归纳总结了物联网常见攻击方式,并介绍了边缘计算相关概念;其次,本文对基于边缘计算的物联网入侵检测技术的最新研究进展进行了全面调查;最后讨论了基于边缘计算的物联网入侵检测技术的挑战与未来发展方向.
入网设备的身份认证是工业互联网、物联网安全运行的基础.通过分析物理不可克隆函数(Physical Unclonable Function,PUF)作为入网设备的身份凭据应具有的特性,建立了其性能的多层指标体系.按照性能指标的重要性分为必要指标、重要指标和应用指标,对每项指标及其评估方法进行了说明,并给出了可用于PUF选型的综合评估方案.实验结果表明,该PUF性能指标体系和评估方案在工程上是可行的.
为解决如何从海量新闻报道中检测并追踪到目标话题,选择了自增式聚类Single-Pass算法进行研究.在原有的基础上对其进行改进得到改进后的Single-Pass聚类算法,期望能得到更好的解决方法.对于原有算法进行的改进主要有在新闻文本的特征词选取中加入权重系数表达特征词位置信息,同时辅以时间特征进行新闻文本相似度计算,并且在Single-Pass聚类算法步骤中添加子话题阈值判断过程.实验验证改进后的Single-Pass聚类算法不止可得到不同粒度的话题聚类效果,同时也提升了聚类效率.实验结果证明,在相同条件下,改进Single-Pass聚类算法的漏检率和误检率上有明显的改善.
随着移动互联网的普及,大量的设备通过无线接入点连接互联网.然而,频繁发生的无线网络攻击使得无线安全问题成为研究的热点之一.目前,伪AP是无线网络攻击的主要方式之一.当前检测伪AP的方式主要存在特征易被伪造、部署成本较高等问题.提出一种基于无线设备指纹的伪AP检测方法,该方法使用的特征难以被伪造,训练时仅需要合法AP的数据即可在检测阶段实现对伪AP的检测.首先收集合法AP的CSI数据,通过数据预处理,提取基于CSI相位信息的无线设备指纹;然后,基于提取的设备指纹生成样本对,训练Siamese网络并生成AP指纹库;在检测阶段,将待测样本与样本库中的指纹通过Siamese网络进行比对以实现伪AP的检测.实验对比了基于传统深度神经网络结构和卷积神经网络结构的Siamese网络在不同时间窗口下的合法AP分类准确率以及伪AP检测率.实验结果表明,提出的方法具有良好的前景,且基于卷积神经网络实现的Siamese网络具有更高的检测率.
针对多数据类型区间决策图(MIDD)方法不能正确表示、处理属性的重要性标记特性,以及表示、处理责任及忠告等不清晰,造成节点表示不一致并增加了处理的复杂性等问题,对MIDD方法进行改进和扩展.首先,将MIDD的以实体属性为单位的图节点修改为以元素为单位的图节点,精准地表示基于属性的访问控制元素,使原来不能正确处理重要标志的问题得以解决;然后,将责任及忠告作为元素,用节点表示出来;最后,把规则和策略的组合算法加到决策节点中,以便在策略决策点(PDP)对访问请求进行决策时使用.分析结果表明,改进方法与原方法的时空复杂度相当.两种方法的对比仿真实验结果表明,在每个属性只有1个附属属性时(最一般的应用情况),两种方法每个访问请求的平均决策时间差异的数量级仅在0.01μs.验证了复杂度分析的正确性,说明两种方法的性能相当.附属属性个数仿真实验表明,即使1个属性有10个附属属性(实际应用中十分稀少),两种方法的平均决策时间差异也在相同的数量级.改进方法不但保证了原方法的正确性、一致性和方便性,更将其使用范围从可扩展访问控制标记语言(XACML)策略扩展到一般的基于属性的访问控制策略.
为了提高恶意软件分类检测的准确性和效率,提出一种基于卷积神经网络的恶意软件分类检测模型,首先是进行数据预处理,将数据进行归一化处理并构造合适的二维矩阵进而映射为灰度图像,然后将这些灰度图像作为特征输入卷积神经网络,自动学习其特征并分类.在该模型中,即使恶意软件变种也可以将其准确识别,这有助于精确地将恶意软件分类.由实验结果可以看出,与普通的机器学习相比,所提的基于卷积神经网络的恶意软件分类方法不仅提高恶意软件分类的精度,还减少需要用于分类的时间.