EMNLP 2021 | LayoutReader:基于ReadingBank的阅读序列抽取模型
阅读序列抽取是文档智能分析中一项非常重要的任务,其旨在通过抽取扫描文档或数字商业文档中的单词并重新进行排序,将原本独立的单词组合成读者可以理解的文本。但由于日常工作生活中使用的文档,往往模板和格式各不相同,所以在出现复杂格式时,按照传统方法进行排列往往无法取得较好的效果。因此,微软亚洲研究院自然语言计算组的研究员们构建了首个大规模阅读序列数据集 ReadingBank,并基于 ReadingBank 提出了阅读序列抽取模型 LayoutReader。本文将对 ReadingBank 和 LayoutReader 的实现原理进行简要介绍,欢迎感兴趣的读者点击阅读原文了解论文中的更多详情,本文已被 EMNLP 2021 作为长文录取。
发布时间:2021-11-04 类型:深度文章