目前,汉语并列结构的研究对标注语料的依赖较强,无法利用未标注语料中的语义信息,且未引入半监督学习方法.该文以条件随机场为基本框架,提出了一种基于半监督学习的并列结构识别方法.从未标注语料中训练出词向量继而提取无监督特征,同时引入语言学特征进行对比实验,考察不同特征对并列结构识别效果的影响.实验表明,无监督特征的融入能提高并列结构的识别效果,使F值达到85.75%,语言学特征和无监督特征结合后的F值为85.77%.说明语言学特征对结果的影响甚微,而无监督特征的引入可以减少人工选取特征的工作量,并将语义信息以较简洁的方式融入识别模型中.
神经机器翻译是人工智能和自然语言处理领域中的一个非常重要的研究方向,而句法分析在信息处理中起着承上启下的作用,在翻译过程中融入句法层面的语言学知识,对于推动机器翻译的发展具有重要的理论意义和应用价值.针对句式结构复杂的长句翻译效果不佳的问题,本文提出了一种句法规则层次化分析方法,识别并提取出最长短语和句子框架部分,再采用分而治之的策略,训练基于自注意力机制的Transformer模型,对短语和框架分别翻译再组合,得到最终译文.在中-英翻译任务上,实验结果表明,与基准系统相比,该方法能显著提高翻译性能,译文BLEU值获得了0.95个点的提升.