目前,汉语并列结构的研究对标注语料的依赖较强,无法利用未标注语料中的语义信息,且未引入半监督学习方法.该文以条件随机场为基本框架,提出了一种基于半监督学习的并列结构识别方法.从未标注语料中训练出词向量继而提取无监督特征,同时引入语言学特征进行对比实验,考察不同特征对并列结构识别效果的影响.实验表明,无监督特征的融入能提高并列结构的识别效果,使F值达到85.75%,语言学特征和无监督特征结合后的F值为85.77%.说明语言学特征对结果的影响甚微,而无监督特征的引入可以减少人工选取特征的工作量,并将语义信息以较简洁的方式融入识别模型中.
句法分析是自然语言处理领域中应用前景非常广阔的一个研究方向.针对目前句法分析多数是从字、词的角度出发且存在诸多不足,提出了二、三元词模型相结合的句法规则层次化分析算法,并结合分词、词性标注以及句子组织信息之间的结合度来解决词元间优先合成的问题,同时利用句子成分之间的语法结构关系对词性、词序的影响,实现句法规则的层次化分析实验.实验结果表明,二元与三元词模型相结合的句法规则层次化分析算法相比于独立二、三元词模型,准确率和召回率分别提高了82.04% 和80.83%,与现有基于二分结构句法分析的RN N-IN T算法和词汇化模型算法相比,准确率和召回率均有明显提升.
神经机器翻译是人工智能和自然语言处理领域中的一个非常重要的研究方向,而句法分析在信息处理中起着承上启下的作用,在翻译过程中融入句法层面的语言学知识,对于推动机器翻译的发展具有重要的理论意义和应用价值.针对句式结构复杂的长句翻译效果不佳的问题,本文提出了一种句法规则层次化分析方法,识别并提取出最长短语和句子框架部分,再采用分而治之的策略,训练基于自注意力机制的Transformer模型,对短语和框架分别翻译再组合,得到最终译文.在中-英翻译任务上,实验结果表明,与基准系统相比,该方法能显著提高翻译性能,译文BLEU值获得了0.95个点的提升.