分词

Python 原生实现文本(句子/词语)切分

文本切分(Text Segmentation)就是把一段连续的文字按规则切成更小的单元——先切成句子,再在每个句子内部切成词语,它是几乎所有文本分析任务(情感分析、关键词提取、机器翻译)的第一步,也是中文自然语言处理中最经典的基础问题。 很…

术→技巧 ·
0 0 23

自然语言处理之Subword子词算法

[LATEXPAGE] 背景与基础 目前的机器学习模型都是数学模型,其对应的输入要求必须是数字形式(number)的,而我们处理的真实场景往往会包含许多非数字形式的输入(有时候即使原始输入是数字形式,我们也需要转换),最典型的就是 NLP …

法→原理 ·
3 1 1

自然语言处理工具包推荐

[LATEXPAGE] 结巴分词 就是前面说的中文分词,这里需要介绍的是一个分词效果较好,使用起来像但方便的Python模块:结巴。 结巴中文分词采用的算法 基于Trie树结构实现高效的词图扫描,生成句子中汉字所有可能成词情况所构成的有向无…

器→工具 ·
0 0 3

自然语言处理工具包之NLTK

NLTK简介 NLTK (Natural Language Toolkit)是由宾夕法尼亚大学计算机和信息科学使用 python 语言实现的一种自然语言工具包,其收集的大量公开数据集、模型上提供了全面、易用的接口,涵盖了分词、词性标注(Pa…

器→工具 ·
1 0 3