文本分类

作者: 陈道乐 | 来源:发表于2020-04-10 16:18 被阅读0次

==刚刚看到这个课题的时候,刚觉很难,但是实际上有一个通用的轮子之后就很好处理了,这个轮子就是预处理模型==

一、预处理模型

实际上就是将现实生活中的东西进行量化处理。

包括这次要处理的文本分类,实际上也是建立在文本预处理模型的基础上,提供了一层将文本量化的操作,有如下的优点:

  • 不必关注文本处理
  • 从迁移学习中受益
  • 输出具有固定长度,容易数据处理

1.模型的加载和设置

embedding = "https://tfhub.dev/google/tf2-preview/gnews-swivel-20dim/1"
hub_layer = hub.KerasLayer(embedding, input_shape=[], dtype=tf.string, trainable=True)
  • default 指明模型的路径,本地路径或者网络路径都可以
  • input_shape 指明模型的输入形状
  • output_shape 指明输出形状, 默认[20] ,输出的就是[batch, 20] 和输入的batch也有关系
  • dtype 指明模型的输入数据类型
  • trainable 指明是否一起参与训练

二、数据集合

这是google提供的用于学习的数据集合,使的我们可以关注模型,而不是忙于采集数据

  • tensorflow_datasets
  • tensorflow.keras.database

1.数据加载

train_data, test_data = tensorflow_datasets.load(name="imdb_reviews")

其实重点就是指明数据集的名称,返回的数据包含两个部分,训练数据train_data , 测试数据 test_data

2.数据分割

train_data_split = tesorflow_datasets.Split.TRAIN.subsplit([6,4])
(train_data, validation_data), test_data =S tensorflow_datasets.load(
                            name="imdb_reviews", split=(train_data_split, tensorflow_datasets.Split.TEST)
                            );

重点就是创建一个分割的 train_data_split变量,分割比例 6:4, 分成train_data(训练数据集)和validation_data(验证数据集),这个只是指定train_data 是如何分割,test_data 不用分割直接指定tensorflow_datasets.Split.TEST。

3.数据格式

train_validation_split = tfds.Split.TRAIN.subsplit([6, 4])
(train_data, validation_data), test_data = tfds.load(
    name="imdb_reviews",
    split=(train_validation_split, tfds.Split.TEST),
    as_supervised=True
)

关注一下, ==as_supervised==字段,指明输出的格式是 ==输入数据 + 标签== 的格式。

比如: train_data中就包含(输入数据, 标签)的格式。

4.数据打乱

model.fit(train_data.shuffle(10000).batch(512), epochs=20, validation_data= validation_data.batch(512), verbose=1)

在使用数据中调用了 shuffle方法随机打乱数据,参数1000 指的是打乱前1000条数据

三、完整的案例

#!/usr/bin/env python
# -*- coding: utf-8 -*-

# Time : 2020/4/9 11:00 上午
# Author : Dale Chen
# Description: 
# File : imdb.py

import numpy as np
import tensorflow as tf
import tensorflow_hub as hub
import tensorflow_datasets as tfds

train_validation_split = tfds.Split.TRAIN.subsplit([6, 4])
(train_data, validation_data), test_data = tfds.load(
    name="imdb_reviews",
    split=(train_validation_split, tfds.Split.TEST),
    as_supervised=True
)

train_example_batch, train_labels_batch = next(iter(train_data.batch(10)))

embedding = "https://tfhub.dev/google/tf2-preview/gnews-swivel-20dim/1"
hub_layer = hub.KerasLayer(embedding, dtype=tf.string, trainable=True)

model = tf.keras.Sequential()
model.add(hub_layer)
model.add(tf.keras.layers.Dense(16, activation=tf.keras.activations.relu))
model.add(tf.keras.layers.Dense(1, activation=tf.keras.activations.sigmoid))

model.compile(optimizer=tf.keras.optimizers.Adam(), loss=tf.keras.losses.BinaryCrossentropy(), metrics=[tf.keras.metrics.Accuracy()])
model.fit(train_data.shuffle(10000).batch(512), epochs=20, validation_data= validation_data.batch(512), verbose=1)

results = model.evaluate(test_data.batch(512), verbose=2)
for name, value in zip(model.metrics_names, results):
    print("%s : %.3f" % (name, value))
  1. 激活函数的选择
model.add(tf.keras.layers.Dense(16, activation='relu'))

中间层的选择任然是常用的 relu 类型

model.add(tf.keras.layers.Dense(1, activation=tf.keras.activations.sigmoid))

输出层选用的是一个 sigmoid 激活函数,这个函数的的效果就是将输出值控制在 0 - 1 之间。

image

2.损失函数

这个是一个二元(Binary)或者二分类,采用的损失函数也是需要针对二分类的BinaryCrossentropy

model.compile(optimizer=tf.keras.optimizers.Adam(), loss=tf.keras.losses.BinaryCrossentropy(), metrics=[tf.keras.metrics.Accuracy()])

相关文章

  • 文本分类V1

    outline 什么是文本分类 特征工程+分类器 TextCNN 什么是文本分类 文本分类是自然语言处理的一个基本...

  • 文本分类;数据增强;模型微调 2020-02-25

    文本分类 文本情感分类数据集 使用循环神经网络进行情感分类 使用卷积神经网络进行情感分类文本分类是自然语言处理的一...

  • Python篇—文本分类

    1.自然语言整体概览 文本分类方法集锦基于text-cnn文本分类基于SVM基于dnn的文本情感分析多类别文本分类...

  • WWDC2018之Create ML(二)

    在上一篇我们主要讲了如何用CreateML分类图片,那么这一次,我们使用文本分类的功能。 何为文本分类? 文本分类...

  • 文本分类

    文本分类的一般流程: 预处理 文本表示及特征选择 构造分类器 分类 文本分类的应用 垃圾邮件的判定:是否为垃圾邮件...

  • 2018-11-10

    LSTM的应用 文本分类LSTM文本分类:使用LSTM的最后一个状态 文本分类中不用one-hot编码,使用emb...

  • 卷积神经网络CNN的文本分类原理和实战

    基于卷积神经网络CNN的文本分类原理和实战 前言 本文介绍了CNN在NLP中的应用:文本分类。 文本分类:是自然语...

  • 基于Text-CNN模型的中文文本分类实战

    1 文本分类 文本分类是自然语言处理领域最活跃的研究方向之一,目前文本分类在工业界的应用场景非常普遍,从新闻的分类...

  • Explicit Interaction Model towar

    文本分类的显式交互模型 摘要   文本分类是自然语言处理的基本任务之一。最近,与浅模型相比,深度神经网络在文本分类...

  • 【NLP】文本分类

    文本分类:将计算机对文本按照一定分类标准进行自动分类标记。 应用场景: 1. 情感分析(Sentiment Ana...

网友评论

    本文标题:文本分类

    本文链接:https://www.haomeiwen.com/subject/uvnrmhtx.html