加载中...
首页专利查询专利详情

*来源于国家知识产权局数据,仅供参考,实际以国家知识产权局展示为准

一种基于XLNet的新闻文本地域提取的方法及系统

发明专利有效专利
  • 申请号:
    CN202011009623.7
  • IPC分类号:G06F40/295;G06F40/289;G06F16/951;G06N3/04;G06N3/08;G06N20/00
  • 申请日期:
    2020-09-23
  • 申请人:
    中国科学院计算技术研究所厦门数据智能研究院
著录项信息
专利名称一种基于XLNet的新闻文本地域提取的方法及系统
申请号CN202011009623.7申请日期2020-09-23
法律状态实质审查申报国家中国
公开/公告日2020-11-20公开/公告号CN111967267A
优先权暂无优先权号暂无
主分类号G06F40/295IPC分类号G;0;6;F;4;0;/;2;9;5;;;G;0;6;F;4;0;/;2;8;9;;;G;0;6;F;1;6;/;9;5;1;;;G;0;6;N;3;/;0;4;;;G;0;6;N;3;/;0;8;;;G;0;6;N;2;0;/;0;0查看分类表>
申请人中国科学院计算技术研究所厦门数据智能研究院申请人地址
福建省厦门市软件园三期凤岐路208-3号 变更 专利地址、主体等相关变化,请及时变更,防止失效
权利人中国科学院计算技术研究所厦门数据智能研究院当前权利人中国科学院计算技术研究所厦门数据智能研究院
发明人童逸琦;马涛;倪斌;汪姿如;庄福振
代理机构厦门致群财富专利代理事务所(普通合伙)代理人暂无
摘要
本发明公开了一种基于XLNet的新闻文本地域提取的方法及系统,其方法包括如下步骤S1、利用互联网上获取海量未标注生语料,输入XLNet预训练模型中进行预训练;S2、将预处理后的数据输入到步骤S1预训练好的XLNet预训练模型中进行编码,将编码后的隐状态输入到BiLSTM+CRF模型中进行识别,输出识别后的地域实体;S3、地域实体消歧;S4、地域实体汇总;S5、地域主体补全操作;其系统包括地域实体识别模块、实体拼接模块、地域消歧义模块和地域汇总模块,地域实体识别模块由XLNet预训练模型和BiLSTM+CRF模型组成。本发明的二阶段训练过程克服了现有技术存在的预训练阶段和训练阶段存在使用模式不一致的问题,解决了传统的自回归模型无法同时学习上下文信息的痛点,实现了完整建模。

我浏览过的专利

专利服务由北京酷爱智慧知识产权代理公司提供