交叉验证（Cross Validation）简介

作者: 程序猪小羊 | 来源:发表于2018-02-25 05:24 被阅读21次

2020-09-03--多项式回归02
交叉验证（Cross Validation）简介
饭店流量预测
机器学习基础知识
算法笔记（20）交叉验证及Python代码实现
交叉验证cross validation
交叉验证 Cross validation
2019-08-29-数据集测试集
7.cross_validation_and_grid_sear
k折交叉验证的keras和sklearn版本通吃

http://blog.csdn.net/holybin/article/details/27185659

侵删。

交叉验证（Cross Validation）是用来验证分类器的性能一种统计分析方法，基本思想是把在某种意义下将原始数据（dataset）进行分组，一部分做为训练集（training set），另一部分做为验证集（validation set），首先用训练集对分类器进行训练，在利用验证集来测试训练得到的模型（model），以此来做为评价分类器的性能指标。

常见的交叉验证方法如下：

1、Hold-Out Method
将原始数据随机分为两组，一组做为训练集，一组做为验证集，利用训练集训练分类器，然后利用验证集验证模型，记录最后的分类准确率为此分类器的性能指标。此种方法的好处的处理简单，只需随机把原始数据分为两组即可，其实严格意义来说Hold-Out Method并不能算是CV，因为这种方法没有达到交叉的思想，由于是随机的将原始数据分组，所以最后验证集分类准确率的高低与原始数据的分组有很大的关系，所以这种方法得到的结果其实并不具有说服性。

2、Double Cross Validation（2-fold Cross Validation，记为2-CV）
做法是将数据集分成两个相等大小的子集，进行两回合的分类器训练。在第一回合中，一个子集作为training set，另一个便作为testing set；在第二回合中，则将training set与testing set对换后，再次训练分类器，而其中我们比较关心的是两次testing sets的辨识率。不过在实务上2-CV并不常用，主要原因是training set样本数太少，通常不足以代表母体样本的分布，导致testing阶段辨识率容易出现明显落差。此外，2-CV中分子集的变异度大，往往无法达到“实验过程必须可以被复制”的要求。

3、K-fold Cross Validation（K-折交叉验证，记为K-CV）

   将原始数据分成K组（一般是均分），将每个子集数据分别做一次验证集，其余的K-1组子集数据作为训练集，这样会得到K个模型，用这K个模型最终的验证集的分类准确率的平均数作为此K-CV下分类器的性能指标。K一般大于等于2，实际操作时一般从3开始取，只有在原始数据集合数据量小的时候才会尝试取2。K-CV可以有效的避免过学习以及欠学习状态的发生，最后得到的结果也比较具有说服性。

网友评论

本文标题：交叉验证（Cross Validation）简介

本文链接：https://www.haomeiwen.com/subject/nyyhxftx.html

延伸阅读

深度阅读

您也可以注册成为美文阅读网的作者，发表您的原创作品、分享您的心情！

交叉验证（Cross Validation）简介

相关文章

2020-09-03--多项式回归02