Python检测符号及乱码字符

文章内容如有错误或排版问题，请提交反馈，非常感谢！

最近在进行关键词的分析，发现在关键词词表中出现了很多乱码及特殊符号（有部分还是SQL注入），为了解决词问题，想着是否可以通过Python来检测符号和乱码字符。在在搜索引擎的帮助下，找到如下解决方案，测试下来效果不错。分享给大家。

检测字符串是否包含特殊符号

方案一：通过字符匹配的方式进行判定

def if_contain_symbol(keyword):
    symbols = "~!@#$%^&amp;*()_+-*/&lt;&gt;,.[]\/"
    for symbol in symbols:
        if symbol in keyword:
            return True
    else:
        return False

方案二：使用正则表达式判断（经测试\W在包含中文的情况下可用）

import re

def if_contain_symbol(keyword):
    if re.search(r"\W", keyword):
        return True
    else:
        return False

检测字符串中是否有乱码

人眼能识别的乱码在程序看来并没有想象中那么简单。针对程序来说”涓囧厓锛屾厛锽勬崘鐚”本身也是正常的字符。下面分享下一些折中的方案：

方案一：对分词后的分词率进行统计

从概率层面，正常的文本分词率（文本长度/分词后个数）>2，而乱码字符则接近1。具体代码如下：

# -*- encoding:utf-8 -*-
import jieba


def if_contain_chaos(keyword):
    str_len = len(keyword)
    seg_len = len(jieba.lcut(keyword))

    if str_len/seg_len &lt; 2:
        return True
    else:
        return False

存在的问题，如果字符串内存在英文，则此方法的可用性不高，特别是关键词长度非常小的场景。

方案二：通过是否包含生僻字的方法进行判断

1980年的GB2312一共收录了7445个字符，包括6763个汉字和682个其它符号。汉字区的内码范围高字节从B0-F7，低字节从A1-FE，占用的码位是72*94=6768。其中有5个空位是D7FA-D7FE。这6763个汉字在Unicode中不是连续的，分布在CJK统一汉字字符区（0x4E00-0x9FA5）的20902个汉字中。

对于直接将生僻字定义为非GB2312内字符。由于GB2312的字符不是连续的，所以不能直接使用正则表达式的方式进行限定。而我们的方案是通过将字符串的unicode转化为GB2312来判断是否含有生僻字。即当转化发生异常即为包含生僻字。

def if_contain_chaos(keyword):
    try:
        keyword.encode("gb2312")
    except UnicodeEncodeError:
        return True
    return False

Python检测符号及乱码字符

检测字符串是否包含特殊符号

检测字符串中是否有乱码

运营权重合理性评估与检测方法

文本易读性指标

《软件随想录》读书笔记

发表回复取消回复

Python检测符号及乱码字符

检测字符串是否包含特殊符号

检测字符串中是否有乱码

运营权重合理性评估与检测方法

文本易读性指标

《软件随想录》读书笔记

发表回复 取消回复

发表回复取消回复