FoolNLTK中文处理工具包

联合创作 · 2023-09-29 05:08

FoolNLTK

中文处理工具包

特点

可能不是最快的开源中文分词，但很可能是最准的开源中文分词

基于BiLSTM模型训练而成

包含分词，词性标注，实体识别,　都有比较高的准确率

用户自定义词典

Install

pip install foolnltk

使用说明

分词

import fool



text = "一个傻子在北京"

print(fool.cut(text))

# ['一个', '傻子', '在', '北京']

命令行分词

python -m fool [filename]

用户自定义词典

词典格式格式如下，词的权重越高，词的长度越长就越越可能出现,　权重值请大于1

难受香菇 10

什么鬼 10

分词工具 10

北京 10

北京天安门 10

加载词典

import fool

fool.load_userdict(path)

text = "我在北京天安门看你难受香菇"

print(fool.cut(text))

# ['我', '在', '北京天安门', '看', '你', '难受香菇']

删除词典

fool.delete_userdict();

词性标注

import fool



text = "一个傻子在北京"

print(fool.pos_cut(text))

#[('一个', 'm'), ('傻子', 'n'), ('在', 'p'), ('北京', 'ns')]

实体识别

import fool 



text = "一个傻子在北京"

words, ners = fool.analysis(text)

print(ners)

#[(5, 8, 'location', '北京')]

注意

暂时只在Python3 Linux 平台测试通过

浏览 22

点赞

收藏

分享

举报

评论

图片

表情

FoolNLTK — 简单好用的中文NLP工具包

Python实用宝典

FudanNLP中文自然语言处理工具包

FudanNLP主要是为中文自然语言处理而开发的工具包，也包含为实现这些任务的机器学习算法和数据集。演示地址:http://jkx.fudan.edu.cn/nlp/queryFudanNLP目前实现

FudanNLP中文自然语言处理工具包

FudanNLP主要是为中文自然语言处理而开发的工具包，也包含为实现这些任务的机器学习算法和数据集。

smallseg中文分词工具包

smallseg -- 开源的，基于DFA的轻量级的中文分词工具包特点：可自定义词典、切割后返回登

pkuseg中文分词工具包

pkuseg-python：一个高准确度的中文分词工具包pkuseg-python 简单易用，支持多

smallseg中文分词工具包

smallseg--开源的，基于DFA的轻量级的中文分词工具包特点：可自定义词典、切割后返回登录词列表和未登录词列表、有一定的新词识别能力。Python示例代码：s3=file("text.txt")

pkuseg中文分词工具包

pkuseg-python：一个高准确度的中文分词工具包pkuseg-python简单易用，支持多领域分词，在不同领域的数据上都大幅提高了分词的准确率。主要亮点pkuseg是由北京大学语言计算与机器学

JffmpegJava多媒体处理工具包

Jffmpeg是一个Java的多媒体框架插件，可以用来播放大部分格式的音频和视频格式的文件，基于ffmpeg项目开发，支持多种纯Java的编码器，使用JNI方式来调用ffmpeg进行多媒体格式文件处理

NYXImagesKitiOS 图像处理工具包

NYXImagesKit包含一组很有用的UIImage图像处理方法，包括filtering、blurring、enhancing、masking、reflecting、resizing、rotatin

JffmpegJava多媒体处理工具包

Jffmpeg 是一个 Java 的多媒体框架插件，可以用来播放大部分格式的音频和视频格式的文件，基

点赞

收藏

分享

举报