美文网首页
中文分词

中文分词

作者: Luwnto | 来源:发表于2016-07-07 13:11 被阅读163次

    mysql全文索引

    mysql4.0以上支持全文检索,但是存储引擎类型必须为MYISAM

    mysql5.6以上支持INODB引擎类型的全文检索

    CREATE TABLE articles (
        id INT UNSIGNED AUTO_INCREMENT NOT NULL PRIMARY KEY,
        title VARCHAR(200),
        body TEXT,
        FULLTEXT (title,body)
    ) ENGINE=MyISAM  DEFAULT CHARSET=utf8;
    

    查询语句:

    SELECT * FROM articles
    WHERE MATCH (title,body) AGAINST ('well hellow');
    

    全文检索的原理是会把文本以空格标点符号分割成关键字,建立一个索引表,查询索引表
    获取数据的绑定信息,取得原数据
    基于这个原理,英文就非常好做全文索引了,但是中文呢

    默认是自然检索,会自动计算权重,默认过滤超过50%的词汇出现率

    改为布尔全文检索,会出现所有结果:

    SELECT * FROM articles WHERE MATCH (title,body)
     AGAINST ('apple banana' IN BOOLEAN MODE);
    

    修改最小匹配量:

    可以在mysql配置文件my.ini 更改最小字符长度,方法是在my.ini 增加一行 
    比如:ft_min_word_len = 2,改完后重启mysql即可。
    

    一些运算符

    +表示AND,即必须包含。- 表示NOT,即不包含

    SELECT * FROM articles WHERE MATCH (title,body)
    AGAINST ('+apple -banana' IN BOOLEAN MODE);
    

    apple和banana之间是空格,空格表示OR,即至少包含apple、banana中的一个

    SELECT * FROM articles WHERE MATCH (title,body)
    AGAINST ('apple banana' IN BOOLEAN MODE);
    

    返回同时包含apple和banana或者同时包含apple和orange的记录。但是同时包含apple和banana的记录的权重高于同时包含apple和orange的记录

    SELECT * FROM articles WHERE MATCH (title,body)
    AGAINST ('+apple +(>banana <orange)' IN BOOLEAN MODE);
    

    中文分词

    我们可以基于mysql全文索引的原理模拟出中文索引:

    1. 通过一系列的算法把中文文章分割成提取重要词语以空格隔开(基于词典)
    2. 然后建立一个全文索引表,一般以index_开头,专门存处理好的中文词,并把ID和原数据关联
    3. 查询的时候全文检索索引表,然后取得要查询的ID,通过ID命中源数据

    相关文章

      网友评论

          本文标题:中文分词

          本文链接:https://www.haomeiwen.com/subject/irzudttx.html