
The open-source ecosystem, as an important component of the modern software industry, has increasingly attracted attention from both academia and industry regarding its evaluation. However, current open-source evaluation methods face several issues, such as inconsistent evaluation standards, lack of theoretical support in the evaluation process, and poor comparability of evaluation results. Guided by the foundational theories of evaluatology, this paper proposes a new interdisciplinary research field, Open Source Evaluatology, and constructs an evaluation theoretical framework and methodology for open-source ecosystems. The main contributions of this paper include: (1) Based on the five axioms of evaluation theory, a theoretical system for Open Source Evaluatology is developed, and the basic concepts, evaluation dimensions, and evaluation standards for the open-source ecosystem are proposed; (2) An evaluation conditions (EC) framework is designed, encompassing five levels: problem definition, task instances, algorithm mechanisms, implementation examples, and supporting systems. A combined evaluation model (EM) based on statistical metrics and network metrics is also introduced; (3) Experimental validation using the GitHub dataset shows that the proposed evaluation framework effectively assesses various features of open-source projects, developers, and communities, and has been verified in multiple practical application scenarios. The research demonstrates that Open Source Evaluatology provides a standardized theoretical guide and methodological support for open-source ecosystem evaluation, which can be widely applied in various scenarios, such as open-source project selection, developer evaluation, and community management, and plays a significant role in promoting the healthy and sustainable development of open-source ecosystems.
The possibility of distinguishing Dirac and Majorana fermions by cosmic torsion in the spatial-flat FRW spacetime is discussed. The scattering amplitudes of two types of fermions deviate from each other by the vector part of torsion in non-minimal coupling case. The scattering of massive fermions by cosmic torsion leads to a shift of final state energy distribution. The difference between shift values of two types of fermions can be used to distinguish fermion types of neutrinos.
智能手机、监控摄像头等智能设备的普及导致了严重的人脸隐私安全问题.人脸去识别化技术被认为是解决上述问题的有效途径,该技术旨在将人脸图像中的身份信息去除以有效保护人脸的隐私.然而,现有的研究工作大多缺乏对去识别化人脸图像在身份上显式的控制与可控的变化,导致去识别化后的图像无法应用于人脸验证和检索等与身份相关的任务.因此,考虑到去识别化人脸图像在身份相关任务上的可用性,提出了一种新的面向身份相互关系一致性的人脸去识别化任务,即任意两个被去识别化的人脸之间的身份相互关系与去识别化前的人脸保持一致.为解决这一问题,引入了一种任务驱动的身份相互关系一致性生成对抗网络算法.该方法设计了一种基于特征向量旋转的去识别化模块,将原有的身份特征可控修改为具有身份相互关系一致性的去识别化特征.此外,还引入了身份控制损失,以保证去识别化后生成的人脸身份的准确性.大量的定性和定量结果表明,提出的方法在人脸的去识别化和去识别人脸的身份相互关系一致性上的表现远优于现有的方法.
由于定位设备误差、非机动车骑行习惯等因素的影响,骑行轨迹存在数据异常与定位信息缺失等质量问题,为骑行地图推断和骑行路径规划等基于轨迹的应用带来了极大挑战.为解决上述问题,提出了一个面向骑行地图推断的轨迹数据质量提升框架,包括网格索引构建、异常轨迹点的消除、徘徊轨迹段的消除、违章轨迹段的消除、漂移轨迹段的校准以及缺失轨迹的恢复等.在真实非机动车骑行轨迹数据集上进行了对比实验和消融实验,实验结果验证了所提方案对于提升骑行地图推断的精度优于现有方法.
无共享架构的分布式数据库是为了应对互联网业务的高可扩展性和高可用性而诞生的.目前无共享架构的分布式数据库虽然已经有了长足的进展,但是对于一些采用无状态计算层的无共享架构分布式数据库而言,往往存在着冲突检测链路过长的问题,这一问题在高冲突的场景下会更加突出.针对这一问题,设计了预先加锁和本地缓存两个策略,并开发了配套的高冲突检测模块,可以实现快速检测冲突并启动对应的高冲突处理策略.实验表明,对高冲突事务处理的架构设计和优化可以提高分布式数据库系统在高冲突负载下的性能.
为探究城市环境差异对树木展叶物候的影响,以上海城市森林中的纯林为研究对象,利用遥感数据提取9种树木的展叶开始时间,并分析其与温度、降水和夜间灯光之间的关系.结果显示如下.①展叶时间在物种之间存在差异,平均展叶时间从第95天至第104天;相比之下,展叶时间的种内差异更大,最早为第69天,最晚为第138天.②不同物种展叶物候对环境因子的响应不同:乌桕对降水变化最敏感,复羽叶栾对降水变化和城市化水平敏感,池杉对降水和温度变化敏感,其余6种树木对环境变化不敏感.③对于敏感物种,生长季前的平均降水量从48 mm增加64 mm,展叶开始时间提前45 d;平均温度每增加1℃,展叶开始时间延迟3 d.因而,城市森林建设可以根据树种物候的环境响应特点来进行合理配置,使其能更好地适应环境,发挥相应的生态作用.
基于双视图眼底图像的诊断方法被广泛应用于糖尿病视网膜病变(diabetic retinopathy,DR)的筛查,该方法可以有效地解决单视角下图像遮挡和视场受限的问题.针对如何有效融合不同视图信息来提高DR分级准确率,提出了一种基于注意力机制的多视角图像之间特征融合的学习方法.针对眼底图像中病灶占比率较小的问题,引入了自注意力机制以加强局部病灶特征的学习;针对双视图眼底图像分类场景,提出了一种跨视图注意力机制,有效地利用了双视图之间的信息.在内部数据集DFiD和公开数据集DeepDR上进行的实验,验证了所提方法能够有效提高DR分级精度,可用于大规模DR筛查,辅助医生实现高效诊断.
评论文本蕴含丰富的用户信息和物品信息,对于用户的购买决策有着重要作用.当用户面对不同的目标物品时,会展现复杂的兴趣.因此准确提取评论中的语义特征并建模物品和用户之间的上下文交互,对学习用户偏好和物品属性十分关键.专注于增强推荐系统的个性化捕捉和动态兴趣建模能力,考虑不同特征的有用性,提出了一种分层级描述感知的个性化推荐(description-aware personal recommendation,DAPR)算法:在评论集合的单词层级,设计个性化的信息选择网络,提取重要的单词语义特征;在评论层级,基于交叉注意力机制设计神经网络,动态地学习评论的有用性;拼接评论摘要作为描述,设计协同注意力网络,捕捉更丰富的上下文感知的特征.在5个Amazon数据集上的实验结果证明了所提方法能取得与基线模型相当的推荐性能.
于2020年和2021年的4-12月,每两周对上海市闵行区浦江郊野公园内的螽斯与蟋蟀种类进行连续调查.研究结果显示,该地区分布有螽斯8种、蟋蟀16种、蝼蛄1种.通过对它们生活史进行研究发现,其成虫时间十分规律,化性稳定,主要通过卵滞育的方式越冬,其次为若虫越冬.此外,还发现通过鸣声对物种进行鉴定,是一种进行鸣虫物候学研究与生态学研究的简便易行的方法.
胶原蛋白是细胞外基质的主要成分,由3条链缠绕构成三螺旋.在28种天然胶原中占比最大的是Ⅰ型胶原蛋白,它是由两条α1链与一条α2链构成的异三聚体,α1或α2链中甘氨酸单点突变会导致成骨不全症.基于更接近天然胶原的异三聚体模型(abc),3条链中分别引入Gly→Ala,构建7种突变体.差示扫描量热结果表明,单点突变体的熔融温度(Tm)值降低15℃,双点及三点突变体未形成三螺旋结构.利用梯阶模型分析分子动力学模拟轨迹,突变点附近梯阶参数值发生变化,表明三螺旋结构局部解折叠.引入弹性函数量化胶原结构变化程度,发现氢键能量与结构形变分数具有高关联性(R2=0.76),表明突变不仅破坏了氢键作用力,也导致了分子的弯曲与运动状态的变化.结合计算与实验,解析了甘氨酸突变对胶原整体结构与运动模式的影响,为进一步揭示甘氨酸突变的致病机理提供了理论基础.
中文情感分析是自然语言处理的重要研究内容,旨在探究中文文本中蕴含的情感倾向.近年来,中文情感分析研究取得了长足进步,但鲜有研究根据语言本身特征和下游任务需求进行探讨.鉴于此,针对中文文本的特殊性以及情感分析的实际需求,在字、词特征的基础上,引入部首特征和情感词性特征,利用双向长短期记忆网络、注意力机制、循环卷积神经网络等模型,提出了融合字、词、部首、词性等多粒度语义特征的中文文本情感分析方法.在融合各类特征的基础上,利用softmax函数进行情感预测.数据集NLPECC(natural language processing and Chinese computing)上的对比实验结果表明,所提方法的F1值均达到84.80%,一定程度上提高了已有方法的性能,较好地完成了中文文本情感分析任务.
生态系统服务供需平衡是可持续发展的关键,开展差异化分区研究有助于资源优化配置.本文基于CASA(carnegie-ames-stanford-approach)模型、水量平衡方程和 RUSLE(revised universal soil loss equation)模型,分析了长三角一体化示范区2000-2020年碳固持服务、水源涵养服务和水土保持服务供给量、需求量及供需匹配关系的时空演变特征,并运用SOM(self-organizing map)+K-means二阶聚类方法划定了不同类型的供需失衡区,提出了差异化的生态系统管控对策.研究发现,长三角一体化示范区近20年间:①碳固持服务供给减少,需求增加,水源涵养和水土保持服务供给量和需求量均呈增加趋势,各生态系统服务总体呈现供不应求的趋势;②碳固持服务和水土保持服务供需比均呈上升趋势,水源涵养服务供需比呈下降趋势,各生态系统服务供需比有明显的空间差异;③聚类分析将示范区划分为不同类型的生态调控区,其中,吴江、盛泽镇区城镇簇群以水源涵养服务提升为主,青浦城区城镇簇群以水源涵养服务和碳固持服务提升为主,先行启动区和嘉善城区城镇簇群生态系统服务供需差距较小,以综合保护为主.此研究结果可为示范区资源调配、生态补偿及区域一体化协同发展提供有益的参考.
基于现行的材料降解率测定标准及特定微生物的降解性能,设计了 4种材料降解率的检测方法,即两种标准方法(接种物:腐熟堆肥、蛭石+腐熟堆肥浸提液)和两种实验方法(接种物:蛭石+芽孢杆菌、蛭石+嗜热菌).采用生产环保胶带所用的原纸、塑料薄膜(主要成分为polylactic acid,PLA)和胶带成品作为受测材料,对比不同处理方法下材料降解性能的效率.结果表明,在60 d的实验周期中,原纸和PLA薄膜在4种方法处理下均呈现快速降解.然而,胶带成品降解率在腐熟堆肥、蛭石+腐熟堆肥浸提液处理下上升缓慢;在蛭石+芽孢杆菌处理下略高;在蛭石+嗜热菌处理下上升速率显著高于其他处理方法(约1.7~7.5倍).添加微生物菌剂尤其是嗜热菌,能有效提升产品降解率的测定效率.因此,优化降解接种物的方法可提高材料降解率的测试效率,有利于企业缩短可降解材料的研发及生产周期.
提出了一个基于动量更新表示与重构约束的神经网络训练框架:在视角标签信息缺失的限制性条件下,使用2D(two-dimensional)图像进行3D(three-dimensional)物品识别.首先,使用自监督学习来解决训练过程中标签缺失的问题.其次,在动态队列基础上,使用动量更新来保持物品表示的稳定性.更进一步地,在训练框架中加入自编码器模块,利用重构约束使模型学习到的表示具有更多的语义信息.最后,提出动态队列递减策略,解决训练过程中数据分布不均衡带来的准确度下降问题.在2个广泛使用的多视角数据集ModelNet和ShapeNet上进行了实验,结果表明所提方法具有良好的性能表现.
主流句子分类算法采用单一词向量表示模型获得文本表示,导致了对文本的映射能力不足.对此,通过融合多种词向量的文本表示以提高分类的准确率.针对多核学习在融合不同核函数时,常规的核函数系数寻优方法存在的训练时间长、难以求得局部最优解等问题,提出了一种新的核函数系数寻优方法,该方法基于参数空间分割与广度优先搜索不断逼近核系数的最优值.以支持向量机(support vector machine,SVM)为分类器,在7个文本数据集上进行了分类实验.实验结果表明,多核学习分类效果明显优于单核学习,并且所提出的寻优方法在训练次数少于常规方法时也能获得了好的分类效果.
开展了青浦区西部地区大型底栖无脊椎动物调查,基于底栖生物完整性指数(benthic index of biotic integrity,B-IBI)评价体系,评价了区域水生态健康状况,分析了 B-IBI指数与水质指标及相关指数的关系,探讨了 B-IBI指数在湖荡地区的适用性.结果表明:研究区域水生态健康状况总体良好,健康及亚健康样点占比67.7%,湖泊及湖荡区域的B-IBI指数多优于河流;B-IBI指数对水体有机污染、富营养化有较好的指示作用;各评价指数之间具有显著相关性,但B-IBI指数与丰富度指数、多样性指数评价结果有所差异;B-IBI指数在湖荡区水生态评价中具有很好的适用性.
针对ClickHouse存在的硬件资源无法被充分利用、缺少弹性和节点启动过慢的问题,在存算分离架构下,提出了一套针对描述数据信息的元数据(Part元数据)的管理策略.Part元数据是元数据中最重要的组成成分.为了能够有效管理远程共享存储上的数据,采集了所有Part元数据文件,并将其合并后,经过键值映射、序列化和反序列化,存入分布式键值数据库中.此外,还设计了一套同步策略,以确保远程共享存储上的数据与分布式键值数据库中的元数据的一致性.利用Part元数据管理策略及相关的同步策略,实现了一个针对Part元数据的管理系统,解决了ClickHouse节点启动过慢的问题,并支持高效的节点动态扩缩容.
存储计算分离方案已成为一种提高大规模数据处理性能及效率的系统架构,但其存储层的访问效率低、网络开销大、对小文件不友好,存在着极大的性能瓶颈.基于MergeTree的数据库ClickHouse在数据存储过程中会产生很多小文件.ClickHouse和S3存算分离方案中文件粒度固定的SSD(solid state driver)缓存区不仅和内存数据不匹配,还会造成缓存区空间浪费.提出了一种面向存算分离架构的缓存管理方案HG-Buffer(hybrid granularity buffer),旨在优化ClickHouse和S3的存储计算分离方案以及对象存储的小文件问题,以提高缓存空间的利用率,从而提高系统访问效率.HG-Buffer通过将SSD作为计算层和存储层之间的缓存层,并将 SSD 缓冲区组织成两个粒度的缓冲区来实现:对象缓冲区和块缓冲区.对象缓存粒度是对象存储中的数据粒度;而块缓存粒度是系统访问数据的数据粒度,其中块缓存粒度是对象缓存粒度的子集.HG-Buffer通过统计数据热度信息,自适应地选择数据存储的位置,以提高SSD空间的利用率,从而提高系统性能.在ClickHouse和S3上进行的实验评估证明了HG-Buffer的有效性和稳健性.
GPU(graphics processing unit)的高并行和高吞吐特性可以提高数据库OLAP(on-line analytical processing)查询的性能.然而目前openGauss无法利用GPU等异构计算硬件的优势.因此旨在探索如何使用 GPU加速该系统的 OLAP处理过程,以实现更高的性能.针对 openGauss与 SQL为系统PostgreSQL名称的一部分,因此不能修改执行粒度的差异,提出了基于分块读取和按键分发的CPU-GPU协同并行方案,该方案可缩短GPU Scan算子的I/O(input/output)时间以缩短GPU的空闲等待时间,又可多实例运行GPU Join以支持多GPU环境.针对openGauss与PostgreSQL体系结构的差异,提出了兼容向量化引擎的异构算子加速技术,实现了可嵌入向量化执行引擎的自定义算子框架,基于此实现了可处理openGauss列式数据的向量化GPU Scan算子.实现了原型系统,验证了所提出方案的效果.
随着网络攻击手段的不断发展,配用电通信网络安全防护面临严峻挑战.为解决配用电通信网络异常流量检测效率低、检测精度不足的问题,从特征提取和流量分类这两个方面进行改进研究,提出了一种配用电通信网络异常流量检测的新方法.在特征提取方面,使用时频域特征提取方法,采用自适应冗余提升多小波包变换快速提取频域特征,结合配用电网络通信特点提取时域特征;在流量分类检测方面,提出了基于分布式计算框架的并行深度森林分类算法,并对训练与分类任务调度策略进行了优化.使用终端流量及常用异常流量检测数据集进行实验,结果表明所提方法对配用电网络异常流量检测的误报率仅为2.63%,准确率可达98.29%,并且深度森林并行计算能均衡地分配任务,显著地加速了训练与分类过程.