【首页】 【期刊简介】 【编委会】 【投稿指南】 【选题指南】 【过刊浏览】 【期刊订阅】 【联系我们】

今天是:
陈 辰,赵一冉,李春秋,周晓城.中文重名规范记录结构化数据抽取及实体匹配研究[J].国家图书馆学刊,2025,34(4):
中文重名规范记录结构化数据抽取及实体匹配研究
  
中文关键词:  名称规范记录 重名记录 实体匹配 数据抽取
英文关键词:
基金项目:本文系国家社会科学基金项目“名称规范控制向身份管理的转型研究”(项目编号:22BTQ038)的研究成果之一。
作者单位
陈 辰 河北大学管理学院 
赵一冉 河北大学管理学院图书馆学专业2022级本科生 
李春秋 北京师范大学政府管理学院 
周晓城 香港中文大学统计系统计学专业2022级博士研究生 
摘要点击次数: 969
全文下载次数: 183
中文摘要:
      针对名称规范记录文本进行结构化数据抽取和实体匹配研究,可解决重名规范记录的实体识别和跨库聚簇难题。选取重名率最高的前50个中文个人名称样本,并从中文名称规范联合数据库中获取总计6149条规范记录。基于RDA标准和规范文档实际构建抽取框架,利用GPT-4o按特定规则从附注项和参考数据源等字段抽取结构化数据,基于数据抽取结果利用中文语言大模型计算嵌入向量,结合余弦相似性、权重设置和层次聚类进行实体匹配。数据抽取得到的实体属性总数为53,837个,其中“发表著作”“活动领域”等属性抽取率较高,不同数据库属性值抽取频率有差异。通过实体匹配,识别出540个聚簇,含2个记录的聚簇居多,NLC重复记录较多,跨库中NLC与CSS、JULAC匹配数量高。结果表明研究方法有效,可为解决中文名称规范文档的重名消歧问题提供新思路,有助于提升名称规范数据质量和维护效率。图4。表5。参考文献38。
英文摘要:
      
查看全文   下载PDF阅读器
关闭

©中国国家图书馆版权所有 【您是本站第 3669964 位访问者】

主管:中华人民共和国文化和旅游部  主办:中国国家图书馆  出版:《国家图书馆学刊》编辑部
地址:北京市中关村南大街33号 邮编:100081 电话:010-88545737
本系统由北京勤云科技发展有限公司设计

京公网安备11010802043898京公网安备11010802043898 | 京ICP备05014420号

全国党政机关事业单位互联网网站标识管理服务平台