adequacy AAAI2019 | 腾讯AI Lab详解自然语言处理领域三大研究方向及入选论文( 八 )


24. 结构化常识在故事补全中的应用
Incorporating Structured Commonsense Knowledge in Story Completion
这项研究由加州大学戴维斯分校与腾讯AI Lab合作完成。为一个给定的故事选择恰当的结尾,被认为是通往叙述型文本理解的第一步。故事结尾预测不仅需要显式的线索,还得需要一些隐式的知识。之前绝大多数方法都没有明显地使用各种背景常识。该论文提出一个基于神经网络的故事结尾预测模型,这个模型整合了三种不同类型的信息来源:叙述线索、情感演变以及常识知识。实验结果表明本文的模型在一个公共数据机ROCStory Cloze Taks上取得了最好的性能。同时,实验结果表明引入常识知识带来了显著的性能增益。
25. 一种针对多模态数据的高效特征提取方法
An Efficient Approach to Informative Feature Extraction from Multimodal Data
这项研究由腾讯AI Lab主导,与清华大学、清华-伯克利深圳学院、麻省理工学院合作完成。多模态特征提取的一个研究重点在于如何找到每个模态中相关度最大的特征表达。作为一种常用的相关度度量方式,HGR最大相关度因较好的理论性质,经常被作为优化的目标函数。然而,HGR最大相关度中对于白化的严格约束,部分限制了其应用。为解决这一问题,本文提出了Soft-HGR的新框架,以解决从多个数据模态中提取有效特征的问题。具体来说,本方法在优化HGR最大相关度的过程中,避免了严格白化约束,同时也能保持特征的集合特性。Soft-HGR的优化目标仅包含两个内积项,可以保证优化过程的求解效率和稳定性。研究者进一步将该方法泛化,用于解决超过两个数据模态以及部分模态缺失的问题。对于数据中仅有部分标注信息的情况,研究者可以通过半监督适应的方法,使得所提取的特征更具有判别力。实验结果表明,本文的方法可以学习到更有信息量的特征映射,同时优化过程也更为高效。
26. Plan-And-Write: 更好的自动故事写作
Plan-And-Write: Towards Better Automatic Storytelling
这项研究由北京大学、南加州大学与腾讯AI Lab合作完成。自动故事生成的目标是用更长、更流畅的语句来描述一个有意义的事件序列,这是一个极具挑战的任务。尽管已有许多工作在研究自动故事生成,但是先前的研究要么局限于plot planning,要么只能生成特定领域的故事。该论文探索了开放领域的基于给定故事题目的故事生成任务。研究者提出了plan-and-write的层级生成框架,先生成故事线,再基于此生成整个故事。研究者对比了两种planning的策略:动态模式是将故事线的planning和故事的文本生成交替进行,而静态模式是先确定好故事线再生成故事。实验结果表明,在显式的故事线planning作用下,系统能生成更多样、更连贯、更切题的故事,在自动指标和人工评测结果中,都优于没有planning的对比方法。
27. 翻译记忆图的神经机器翻译
Graph based translation memory for neural machine translation
该论文由腾讯AI Lab主导,与卡内基梅隆大学合作完成,可有效地利用翻译记忆构建翻译模型。翻译记忆对提高统计机器翻译很有帮助,随着统计机器翻译向神经机器翻译的进化,将翻译记忆融入到神经翻译框架已经引起了很多关注。现有的工作中,有的为了保证效率,仅利用了翻译记忆中的局部信息;也有工作利用了翻译记忆中的全局信息,但是降低了效率。该论文提出了一个有效的方法,它可以充分利用翻译记忆的全局信息。它的基本思想是,将包括冗余词的序列化翻译记忆压缩成一个结构紧凑的图,然后计算一个基于图的注意力模型。在6个翻译任务上的实验表明,本文提出的方法是有效的:它获得了比基线系统Transformer更好的效果,而且也比现有的基于翻译记忆的模型更好。

推荐阅读