[0001]技术领域
[0002]本发明属于计算机视觉与模式识别技术领域,主要涉及了一种基于多尺度的简易数学表达式检测方法。
[0003]背景技术
[0004]多尺度学习是计算机视觉的子领域目标检测中的核心技术之一,用以解决实际问题中物体尺度不同的问题,其核心思想是对图像进行不同倍率的下采样,从而获得不同尺度的特征图,使得不同尺度的物体特征都能被很好的表征。然后再通过图像金字塔的方法,对不同尺度的特征图进行特征融合,从而获得图像中更丰富的空间语义信息。随着目标检测的发展,多尺度目标检测网络将多尺度学习以一种自然的方式灵活集成到深度网络中,并以此提出了全新的深度学习网络结构。通过结合多尺度学习方法和深度学习,多尺度学习网络具有揭示不同尺度大小物体的空间特征以及图像前景背景语义依赖关系的潜力,取得比现有目标检测神经网络更好的性能表现。
[0005]作为一种更具竞争力的表征学习范式,多尺度学习网络逐渐引起研究者注意。基于图像金字塔的目标检测网络通过融合不同尺度的下采样特征图,获取图像中不同尺度的语义信息,能够有效减少小物体的漏检率,并且能够使得网络能够根据物体的大小,自适应调整输出目标框,从而进一步改善平均准确率,增强网络的鲁棒性,改善目标检测网络的学习过程。
[0006]在教育领域,尤其是小学生数学学习、检测和考核的日常任务中,需要从小学生的答题图像中检测出表达式以及相应字符,这就引发了一系列对于简易数学表达式的检测问题。对于简易数学表达式的检测任务中,涉及不同情景下的数据,需要网络具有很高的鲁棒性,能够有效过滤图像中的噪音。其次,该任务不同于传统的文本检测,其检测的目标框均为规则的矩形框,且只有较小概率出现目标框重叠的情况。但与此同时,还存在检测区域不一致,所检测的表达式种类繁多,其包括长横式、竖列式等,因此该任务更适合使用基于无锚框的检测网络进行学习。
[0007]目前,对于简易数学表达式的检测具有很大的市场需求,比如针对小学生数学学习过程中的数学表达式的检测问题,但目前并未有很好的落地项目能够处理该任务在实际应用中问题,也尚未出现能够可以满足用户不同需求的小学生数学表达式检测系统,因此如何将通用的检测方法应用于该领域,是亟需解决的问题。
[0008]发明内容
[0009]本发明正是针对现有技术中的问题,提供一种基于多尺度的简易数学表达式检测方法,包括低消耗模式和高性能模式两种模式可供选择,所述低消耗模式采用轻量化模型,根据简易数学表达式的原始图像,提取语义特征并做尺度的特征融合,将不同尺度融合特征输入到轻量化模型中,直接输出数学表达式检测矩形框,完成数学表达式的检测;所述高性能模式采用粗粒度高性能模型进行简易数学表达式的检测,对检测框的重叠区域进行过滤;再将检测结果输入细粒度高性能模型进行字符层级检测;最后聚合粗粒度高性能模型检测结果以及细粒度高性能检测结果,得到简易数学表达式以及字符检测的输出结果。本方法针对用户的不同需求,提出了不同的检测方案:在低消耗需求下,能够尽量满足检测精度需求;在高性能需求下,能够整合粗细粒度模型输出结果,输出更详细的检测结果。
[0010]为了实现上述目的,本发明采取的技术方案是:基于多尺度的简易数学表达式检测方法,该方法包括如下步骤:
[0011]S1,模式选择:用户根据自身需求,选择检测方法中的低消耗模式或高性能模式,若选择低消耗模式,转入步骤S2;若选择高性能模式,转入步骤S3;
[0012]S2,低消耗模式执行:所述低消耗模式采用轻量化模型,根据简易数学表达式的原始图像,提取语义特征并做尺度的特征融合,将不同尺度融合特征输入到轻量化模型中,直接输出数学表达式检测矩形框,完成数学表达式的检测,所述轻量化模型为:
[0013]Y=Head 1 (GhostPAN(ShuffleNetV2(X)))
[0014]其中,Head 1 (·)表示轻量级检测头模块,输入不同尺度特征融合图,输出预测标签Y;GhostPAN(·)表示使用Ghost模块的多尺度特征融合模块,输入不同下采样特征图,输出不同尺度特征融合图;ShuffleNetV2(·)为骨干网络,输入原始图像X,输出不同下采样倍数特征图;
[0015]S3,高性能模式执行:所述高性能模式包括粗粒度高性能模型和细粒度高性能模型,依次通过并聚合检测结果,其步骤具体包括:
[0016]S31:采用粗粒度高性能模型进行简易数学表达式的检测,对检测框的重叠区域进行过滤,所述粗粒度高性能模型为:
[0017]Y=Head 2 (FPN(ResNet50(X)))
[0018]其中,Head 2 (·)表示高性能检测头模块,输入不同尺度特征融合图,输出预测标签Y;FPN(·)表示基于图像金字塔的多尺度特征融合模块,输入不同下采样特征图,输出不同尺度特征融合图;ResNet50(·)骨干网络,输入原始图像X,输出不同下采样倍数特征图;
[0019]S32:将步骤S31的检测结果输入细粒度高性能模型进行字符层级检测,所述细粒度高性能模型为:
[0020]Y=Decoder(VGG16(X))
[0021]其中,VGG16(·)为采用VGG16网络的编码器,输入原始图像,得到不同下采样倍数特征图;Decoder(·)为解码器,输入不同下采样倍数的特征图,输出标签;
[0022]S33:聚合粗粒度高性能模型检测结果以及细粒度高性能检测结果,最终得到简易数学表达式以及字符检测的输出结果。
[0023]与现有技术相比,本发明具有的有益效果:
[0024](1)本发明针对用户的不同需求,提出了不同的检测方案:在低消耗需求下,能够尽量满足检测精度需求;在高性能需求下,能够整合粗细粒度模型输出结果,输出更详细的检测结果。
[0025](2)本发明对模型进行了轻量化,因而更加适用于在手机端或者网页端进行推理,更加符合小学生数学表达式检测的实际运用和实施落地,大大提高了对检测模型轻量化的需求,也是首次针对小学生教育领域中简易数学表达式检测的深入研究,有效辅助小学生的数学教育。
[0026](3)本发明也可以适应复杂环境下的高性能检测,当用户偏好高性能模型,本发明拥有足够资源对模型进行存储以及运行,依次进行粗粒度检测以及细粒度检测,检测过程中同时达到较高的平均准确率以及平均召回率。
[0027](4)在小学生数学表达式检测方法中,需要同时对表达式以及字符进行检测。为了配合小学生数学表达式检测的下游任务,常常需要同时获取表达式整体的检测结果,还需要获取表达式中每个字符的检测结果,但是现有的方法中没有同时完成这两项任务的模型,本案可以同时实现表达式及字符的双重检测,更加的精准高效。
[0028]附图说明
[0029]图1为本发明实施例1基于多尺度的简易数学表达式检测方法中低消耗模式的结构框架图;
[0030]图2为本发明实施例1基于多尺度的简易数学表达式检测方法中低消耗模式的实际检测结果图;
[0031]图3为本发明实施例2基于多尺度的简易数学表达式检测方法中高性能模式的结构框架图;
[0032]图4为本发明实施例2基于多尺度的简易数学表达式检测方法中高性能模式下,使用交并比前后效果图;
[0033]图5为本发明实施例2基于多尺度的简易数学表达式检测方法中经过高性能粗粒度模型的检测结果;
[0034]图6为本发明实施例2基于多尺度的简易数学表达式检测方法中经过高性能细粒度检测结果图;
[0035]图7为本发明实施例2基于多尺度的简易数学表达式检测方法中,高性能细粒度检测结果与高性能粗粒度检测结果聚合图;
[0036]图8为本发明基于多尺度的简易数学表达式检测方法的运行流程图。
[0037]具体实施方式
[0038]下面结合附图和具体实施方式,进一步阐明本发明,应理解下述具体实施方式仅用于说明本发明而不用于限制本发明的范围。
[0039]实施例1
[0040]在对该方法具体步骤进行描述之前,首先给出相关定义及表示:
[0041](a)图像金字塔网络(FPN):Feature Pyramid Nework;
[0042](b)卷积操作(Conv):Convo l ut ion;
[0043](c)批量归一化操作(BN):Batch Norma l i ze;
[0044]基于多尺度的简易数学表达式检测方法,包含低消耗检测模式和高性能检测模式,所述低消耗检测模式用于满足用户低消耗的检测需求,当用户选择低消耗模式时,利用低消耗检测模型NanoDet-p l us进行简易数学表达式检测,其框架图如图1所示,模型包括骨干网络、GhostPAN模块、轻量化检测头,低消耗模式的具体操作步骤如下:
[0045]1)将简易数学表达式的图像输入到骨干网络(Shuff l eNet v2)中,提取语义特征:
[0046]2)抽取8、16、32倍下采样的特征输入进Ghost-PAN做尺度的特征融合。
[0047]其中{X i |i=8,16,32}代表不同下采样倍数下的特征向量,{Y i |i=8,16,32}表示不同下采样倍数下Ghost-PAN操作的输出结果,其中BN表示批量归一化操作;
[0048]ReLU(x)=max(x,0)
[0049]ReLU(x)=max(x,0)
[0050]f可由下述公式表达,其中Conv代表卷积操作,{z i |1≤i≤c}表示Z在每个通道上的特征图,c为通道数,Φ k 表示Φ的每一维向量, 表示拼接操作:
[0051]Z=Conv(X)+b
[0052]Φ k =Conv(z i )
[0053]3)将从GhostPAN得到的不同尺度融合特征输入到轻量级检测头Head 1 ,获取边框回归以及边框分类的结果:
[0054]Head 1 (Y i )=Conv(Conv(Head 1 _Block(Head 1 _Block(Y i ))))
[0055]其中,ConvDW(·)表示深度可分离卷积操作,Conv(·)代表卷积操作。
[0056]4)利用非极大抑制,将边框分类置信度大于0.6的边框作为检测结果。
[0057]低消耗模式的具体案例如图2所示,图2中可以看出,含有简易数学表达式的原始图像经过上述步骤后,自动检测框出了数学表达式,经过测试,该轻量化模型推理一张图片的时间在9-10毫秒,模型参数大小为1.17兆,最终检测平均精度为mAP为0.75,检测平均召回率为0.804,检测精准度高且耗时少。
[0058]实施例2
[0059]基于多尺度的简易数学表达式检测方法包含低消耗模式和高性能模式,所述高性能模式包含粗粒度高性能检测模型与细粒度高性能检测模型,用于满足用户高性能的检测需求:
[0060]本实施例以小学生的数学答题纸为原始图像,高性能粗粒度检测模型利用FCOS模型进行小学生数学表达式检测,其框架图如图3所示,具体包括骨干网络、图像金字塔模块、高性能检测头,具体操作如下:
[0061]1)将小学生答题图像输入到骨干网络(ResNet50)中,提取语义特征:
[0062]2)抽取8、16、32倍下采样的特征输入进图像金字塔(FPN)做尺度的特征融合;
[0063]上式中,{C i |3≤i≤5}为不同尺度的下采样特征,{P i |3≤i≤7}为图像金字塔的输出结果;
[0064]3)将从图像金字塔中得到的不同尺度融合特征输入到高性能检测头Head 2 ,获取边框回归、边框分类、中心值的结果:
[0065]其中, 表示尺度度i下第j个高性能检测头的输出;
[0066]4)利用非极大抑制,过滤边框分类置信度小于0.2的边框;
[0067]5)两两计算目标框的交并比,收集所有交并比大于0.3的目标框作为同义框组,对于每一组同义框组,我们只选取分类置信度最高的框作为输出。
[0068]其中,交并比(I oU)可以下式计算:
[0069]G t 表示真实框,D t 表示预测框,area(·)表示框的面积。如图4所示,使用交并比后,能够对检测框的重叠区域进行过滤,避免检测重叠。图5为不同环境、不同数据下,经过高性能粗粒度模型检测后的示意图,图中可以看出,简易数学公式可被框出识别。
[0070]经过粗粒度高性能模型检测后,再将检测结果输入细粒度高性能模型进行字符层级检测,最后在聚合粗粒度高性能模型检测结果以及细粒度高性能检测结果,所述高性能细粒度检测模型利用CRAFT模型进行小学生数学表达式检测,具体操作如下:
[0071]1)将小学生答题图像输入CRAFT网络,可以得到区域中心分数图S r 以及邻近分数图S a ;其中,CRAFT网络由编码器VGG16以及解码器组成,解码器由若干UpConvBlock组成,具体过程如下所述:
[0072]UpConvBlock(X)=Conv(BN(Conv(BN(X))))
[0073]其中,UpConvBlock(·)表示对特征图进行上采样样,BN(·)表示对输入特征图的批量归一化操作;
[0074]E 0 =O 0
[0075]其中,{E i |0≤i≤4}表示经过不同倍数下采样图像融合后的特征图,{O i |0≤i≤4}表示不同倍数下采样图像,上式中 表示拼接操作;
[0076]O i =Conv i (O i-1 )
[0077]Conv i (·)表示CRAFT网络中编码器VGG16第i个下采样倍数的卷积操作。
[0078]2)对0-1之间的中心分数图以及邻近分数图取阈值计算,即将这两张概率图转化为二值图M,下式(21)中p表示图上对应像素的坐标:
[0079]3)对连通区域进行连通标记;
[0080]4)找到每个连通区域的最小面积外接矩形;
[0081]5)对每个外接矩形,将其修正为水平检测框。
[0082]x lefttop ,y lefttop ,x righttop ,y righttop ,x leftdown ,y leftdown ,x rightdown ,y leftdown 表示4)中最小外接矩形的四个顶点点坐标; 表示变换后水平检测框的坐上角和右下角坐标。图6为经过高性能细粒度模型的检测后,简易数学公式可被框出识别。
[0083]6)将字符检测结果与原来粗粒度表达式进行聚合,即对细粒度检测框分别进行重定位,将其坐标映射到原图像上。
[0084]其中, 表示重映射后细粒度目标框的坐标,p s 表示映射前细粒度目标框的坐标, 表示对应粗粒度目标检测输出的第i个目标框的坐标。如图7所示,经过本发明方法的高性能模式后,待检测纸张中的小学生数学表达式及字符,均能被识别检测出。
[0085]本方法还针对使用低消耗检测模型以及高性能粗粒度检测模型的检测结果进行了对比实验,具体如下表所示:
[0086]表1精度对比实验数据表
[0087]表2推理时间对比实验数据表
[0088]上表中可以看出,经过在不同小学生答题图像上测试,该模型能适应不同环境下的噪音,并达到0.893的平均准确率mAP,以及0.933的平均召回率。本方法针对用户的不同需求,提出了不同的检测方案:在低消耗需求下,能够尽量满足检测精度需求;在高性能需求下,能够整合粗细粒度模型输出结果,输出更详细的检测结果。且更加适用于在手机端或者网页端进行推理,更加符合小学生数学表达式检测的实际运用和实施落地,也是首次针对小学生教育领域中简易数学表达式检测的深入研究,有效辅助小学生的数学教育。
[0089]需要说明的是,以上内容仅仅说明了本发明的技术思想,不能以此限定本发明的保护范围,对于本技术领域的普通技术人员来说,在不脱离本发明原理的前提下,还可以做出若干改进和润饰,这些改进和润饰均落入本发明权利要求书的保护范围之内。