美文网首页
jieba分词工具的使用方法

jieba分词工具的使用方法

作者: 萌萌Msy | 来源:发表于2017-12-13 02:44 被阅读0次

作为我这样的萌新,python代码的第一步是:#coding=utf-8

环境:python3.5+jieba0.39

一、jieba包安装方法:

方法1:使用conda安装 conda install jieba(首先使用conda search jieba查看远程仓库有没有jieba资源,有的话就方法一安装,没有用方法二 ,原则是优先使用conda,其次选用pip)
方法2:使用pip安装 pip install jieba

二、jieba使用方法

实现的代码用到open()函数,以下是open()函数的第二个参数,其参数解释如下:

    r   以只读方式打开文件。文件的指针将会放在文件的开头。这是默认模式。
    rb  以二进制格式打开一个文件用于只读。文件指针将会放在文件的开头。这是默认模式。
    r+  打开一个文件用于读写。文件指针将会放在文件的开头。
    rb+ 以二进制格式打开一个文件用于读写。文件指针将会放在文件的开头。
    w   打开一个文件只用于写入。如果该文件已存在则将其覆盖。如果该文件不存在,创建新文件。
    wb  以二进制格式打开一个文件只用于写入。如果该文件已存在则将其覆盖。如果该文件不存在,创建新文件。
    w+  打开一个文件用于读写。如果该文件已存在则将其覆盖。如果该文件不存在,创建新文件。
    wb+ 以二进制格式打开一个文件用于读写。如果该文件已存在则将其覆盖。如果该文件不存在,创建新文件。
    a   打开一个文件用于追加。如果该文件已存在,文件指针将会放在文件的结尾。也就是说,新的内容将会被写入到已有内容之后。如果该文件不存在,创建新文件进行写入。
    ab  以二进制格式打开一个文件用于追加。如果该文件已存在,文件指针将会放在文件的结尾。也就是说,新的内容将会被写入到已有内容之后。如果该文件不存在,创建新文件进行写入。
    a+  打开一个文件用于读写。如果该文件已存在,文件指针将会放在文件的结尾。文件打开时会是追加模式。如果该文件不存在,创建新文件用于读写。
    ab+ 以二进制格式打开一个文件用于追加。如果该文件已存在,文件指针将会放在文件的结尾。如果该文件不存在,创建新文件用于读写。  

下面代码实现读取txt文件(test.txt)内容,利用jieba实现分词并将分词结果写到一个新的txt文件(result.txt):

    #coding=utf-8
    import jieba
    import jieba.posseg as pseg
    fileNeedCut = 'G:/experiment/jieba/test.txt'
    fileName = 'G:/experiment/jieba/result.txt'
    
    fn = open(fileNeedCut, "r", encoding="utf-8")
    f = open(fileName, "w+", encoding="utf-8")
    for line in fn.readlines():
        #words = pseg.cut(line) #带分词的词性
        words = jieba.cut_for_search(line) #只是分词,不带词性
        for w in words:
            print(w, file=f)
    f.close()
    fn.close()
三、分词结果

分词前文件内容:

    大会的主题是:不忘初心,牢记使命

分词后的内容:

    大会
    的
    主题
    是
    :
    不忘
    初心
    ,
    牢记
    使命

注:使用words = pseg.cut(line)可在每个分词后面添加词性标注

相关文章

  • 分词练习

    一、实验目标 尝试使用jieba对《龙族》进行分词,并进行分词效果比较分析 二、使用工具 在线分词工具、jieba...

  • jieba分词工具的使用方法

    作为我这样的萌新,python代码的第一步是:#coding=utf-8 环境:python3.5+jieba0....

  • 中文分词器JIEBA分词练习

    1.JIEBA简介 jieba是基于Python的中文分词工具,支持繁体分词、自定义词典和三种分词模式: 精确模式...

  • 常用分词工具使用教程

    常用分词工具使用教程 以下分词工具均能在Python环境中直接调用(排名不分先后)。 jieba(结巴分词) 免费...

  • 常用Python中文分词工具

    1. jieba 分词 “结巴” 分词,GitHub 最受欢迎的分词工具,立志做最好的 Python 中文分词组件...

  • 结巴中文分词介绍

    Python中分分词工具很多,包括盘古分词、Yaha分词、Jieba分词、清华THULAC等。它们的基本用法都大同...

  • jieba 分词学习 2018-10-26

    Python中分分词工具很多,包括盘古分词、Yaha分词、Jieba分词、清华THULAC等。它们的基本用法都大同...

  • jieba分词介绍

    Python中分分词工具很多,包括盘古分词、Yaha分词、Jieba分词、清华THULAC等。它们的基本用法都大同...

  • python3中文jieba分词设置说明

    jieba分词的安装 在虚拟环境中 / 本地下安装 jieba jieba分词的配置 jieba中文分词的使用 进...

  • jieba 源码解析

    阅读动机 jieba分词是Python 里面几个比较流行的中文分词工具之一。为了理解分词工具的工作原理,以及实现细...

网友评论

      本文标题:jieba分词工具的使用方法

      本文链接:https://www.haomeiwen.com/subject/iqioixtx.html