美文网首页Machine Learning & Recommendation & NLP & DL
自然语言处理N天-Day0501词袋和词向量模型

自然语言处理N天-Day0501词袋和词向量模型

作者: 我的昵称违规了 | 来源:发表于2019-02-09 15:04 被阅读0次
新建 Microsoft PowerPoint 演示文稿 (2).jpg
说明:本文依据《中文自然语言处理入门实战》完成。目前网上有不少转载的课程,我是从GitChat上购买。

第五课 文本可视化技巧

算是进入正题了,NLP重要的一个环节,构建词向量模型,在这里使用到了Gensim库,安装方式很简单
pip install gensim

词袋模型BOW

词袋将文本看作一个无序的词汇集合,忽略语法和单词顺序,对每一个单词进行统计,计算词频。
用在文本分类中,贝叶斯、LDA、LSA。

手工生成词袋

import jieba

punctuation = [",", "。", ":", ";", "?", ]  # 简易的标点集合
content = [
    "机器学习带动人工智能飞速的发展。",
    "深度学习带动人工智能飞速的发展。",
    "机器学习和深度学习带动人工智能飞速的发展。"
]

seg_1=[jieba.lcut(con) for con in content]
print(seg_1)

tokenized=[]
for sentence in seg_1:
    words=[]
    for word in sentence:
        if word not in punctuation:
            words.append(word)
    tokenized.append(words)
print(tokenized)

BOW=[x for item in seg_1 for x in item if x not in punctuation]
BOW=list(set(BOW))
print(BOW)

bag_of_word2vec=[]
for sentence in tokenized:
    token=[1 if token in sentence else 0 for token in BOW]
    bag_of_word2vec.append(token)
print(bag_of_word2vec)

可以看到生成的词袋是这样的
['的', '机器', '人工智能', '学习', '和', '飞速', '带动', '深度', '发展']
而文本内容的词向量是这样的
[[1, 1, 1, 1, 0, 1, 1, 0, 1], [1, 0, 1, 1, 0, 1, 1, 1, 1], [1, 1, 1, 1, 1, 1, 1, 1, 1]]
这其实就是一个ONE-HOT(独热)模型。很简陋。

使用Gensim生成词袋

import gensim
from gensim import corpora
import jieba

punctuation = [",", "。", ":", ";", "?", ]  # 简易的标点集合
content = [
    "机器学习带动人工智能飞速的发展。",
    "深度学习带动人工智能飞速的发展。",
    "机器学习和深度学习带动人工智能飞速的发展。"
]

seg_1 = [jieba.lcut(con) for con in content]
print(seg_1)

tokenized = []
for sentence in seg_1:
    words = []
    for word in sentence:
        if word not in punctuation:
            words.append(word)
    tokenized.append(words)
print(tokenized)


dictionary = corpora.Dictionary(tokenized)
dictionary.save('./tf_logs/gensim/deerwester.dict')
print(dictionary.token2id)

corpus = [dictionary.doc2bow(sentence) for sentence in seg_1]
print(corpus)

{'人工智能': 0, '发展': 1, '学习': 2, '带动': 3, '机器': 4, '的': 5, '飞速': 6, '深度': 7, '和': 8}
[[(0, 1), (1, 1), (2, 1), (3, 1), (4, 1), (5, 1), (6, 1)], [(0, 1), (1, 1), (2, 1), (3, 1), (5, 1), (6, 1), (7, 1)], [(0, 1), (1, 1), (2, 2), (3, 1), (4, 1), (5, 1), (6, 1), (7, 1), (8, 1)]]
对比生成结果会发现,和刚才手动生成的类似,但是工业化更高。但是问题是BOW的最大缺点是严重缺乏相似词之间的表达。

相关文章

  • 自然语言处理N天-Day0501词袋和词向量模型

    第五课 文本可视化技巧 算是进入正题了,NLP重要的一个环节,构建词向量模型,在这里使用到了Gensim库,安装方...

  • nlp面试题大全

    自然语言处理面试题 有哪些文本表示模型,它们各有什么优缺点? 词袋模型与N-gram  最基本的文本表示模型是词袋...

  • 自然语言处理N天-Day0502词袋和词向量模型

    说明:本文依据《中文自然语言处理入门实战》完成。目前网上有不少转载的课程,我是从GitChat上购买。 第五课 文...

  • 词袋模型BoW和词集模型SoW

    Bag-of-Words词袋模型,经常用在自然语言处理和信息检索当中.在词袋模型中,一篇文本(文章)被表示成"装着...

  • Word2vec

    预备知识:LR、贝叶斯公式、赫夫曼编码、统计语言模型、n-gram模型、神经概率语言模型、词向量、词袋模型、sof...

  • Character Embedding论文笔记

    学习目标 C2W模型背景介绍词向量的学习对于自然语言处理的应用非常重要,词向量可以 在空间上捕获词之间的...

  • Day12 #100DaysofMLCoding#

    2018 8 25-27 今日计划 cs231n 第13节 代码 词袋模型 词向量 word embedding(...

  • 词向量构造 - 词袋模型

    对于机器学习任务而言,不管是什么类型的数据(语言,声音,图像,视频),都必须转化为数值型数据,一般均为向量或者矩阵...

  • 预训练好的词向量资源

    词向量是用来表示词的向量,通常也被认为是词的特征向量。现在已经成为自然语言处理的基础技术。词向量的好坏,会直接影响...

  • CS224n笔记1:自然语言处理简介

    关键词:自然语言处理(NLP),词向量(Word Vectors),奇异值分解(Singular Value De...

网友评论

    本文标题:自然语言处理N天-Day0501词袋和词向量模型

    本文链接:https://www.haomeiwen.com/subject/qwzasqtx.html