【NLP】推荐一些NER的英文数据集

机器学习初学者

共 920字,需浏览 2分钟

 ·

2020-10-11 21:10

 1   MUC Data Sets


https://www-nlpir.nist.gov/related_projects/muc/


 2   CoNLL-2002


https://www.clips.uantwerpen.be/conll2002/ner/


 3   CoNLL-2003


CoNLL 2003是由新闻通讯社的文章以四种不同的语言(西班牙语、荷兰语、英语和德语)创建的,重点关注4个实体:PER(人员),LOC(位置),ORG(组织)和MISC(其他,包括所有其他类型的实体)


https://www.clips.uantwerpen.be/conll2003/ner/


 4   2010 I2B2


2010 I2B2 NER任务考虑了临床数据,重点关注临床问题、测试和治疗实体类型


https://www.i2b2.org/NLP/Relations/


 5   DDIExtraction2013(Drug NER)


重点关注药品、品牌、集团和药品n(未批准或新药)实体类型


https://www.cs.york.ac.uk/semeval-2013/task9/index.html


 6   CHEMPROT(Similar to 5)


相比5更侧重于化学和药物实体,例如缩写、配方、家族、标识符等


https://biocreative.bioinformatics.udel.edu/


 7   microbiology NER datasets


从PubMed和生物学网站收集,并且主要关注细菌、栖息地和地理位置实体


http://2016.bionlp-st.org/tasks/bb2    

(需要FQ访问)



往期精彩回顾






浏览 30
点赞
评论
收藏
分享

手机扫一扫分享

举报
评论
图片
表情
推荐
点赞
评论
收藏
分享

手机扫一扫分享

举报