网易首页 > 网易号 > 正文 申请入驻

【机器学习基础】详细介绍 7 种交叉验证方法!

0
分享至

在任何有监督机器学习项目的模型构建阶段,我们训练模型的目的是从标记的示例中学习所有权重和偏差的最佳值。

如果我们使用相同的标记示例来测试我们的模型,那么这将是一个方法论错误,因为一个只会重复刚刚看到的样本标签的模型将获得完美的分数,但无法预测任何有用的东西 - 未来的数据,这种情况称为过拟合。

什么是交叉验证?

交叉验证是一种用于估计机器学习模型性能的统计方法,它是一种评估统计分析结果如何推广到独立数据集的方法。

它是如何解决过拟合问题的?

在交叉验证中,我们将训练数据生成多个小的训练测试分割,使用这些拆分来调整您的模型。例如,在标准的 k 折交叉验证中,我们将数据划分为 k 个子集。然后,我们在 k-1 个子集上迭代训练算法,同时使用剩余的子集作为测试集。通过这种方式,我们可以在未参与训练的数据上测试我们的模型。

在本文中,我将分享 7 种最常用的交叉验证技术及其优缺点,我还提供了每种技术的代码片段,欢迎收藏学习,喜欢点赞支持。

下面列出了这些技术方法:


  • HoldOut 交叉验证



  • K-Fold 交叉验证



  • 分层 K-Fold交叉验证



  • Leave P Out 交叉验证



  • 留一交叉验证



  • 蒙特卡洛 (Shuffle-Split)



  • 时间序列(滚动交叉验证)


1、HoldOut 交叉验证

1.快速执行:因为我们必须将数据集拆分为训练集和验证集一次,并且模型将在训练集上仅构建一次,因此可以快速执行。

缺点


  1. 不适合不平衡数据集:假设我们有一个不平衡数据集,它具有“0”类和“1”类。假设 80% 的数据属于“0”类,其余 20% 的数据属于“1”类。在训练集大小为 80%,测试数据大小为数据集的 20% 的情况下进行训练-测试分割。可能会发生“0”类的所有 80% 数据都在训练集中,而“1”类的所有数据都在测试集中。所以我们的模型不能很好地概括我们的测试数据,因为它之前没有看到过“1”类的数据。



  2. 大量数据无法训练模型。


在小数据集的情况下,将保留一部分用于测试模型,其中可能具有我们的模型可能会错过的重要特征,因为它没有对该数据进行训练。

代码片段

from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression
from sklearn.metrics import accuracy_score
iris=load_iris()
X=iris.data
Y=iris.target
print("Size of Dataset {}".format(len(X)))
logreg=LogisticRegression()
x_train,x_test,y_train,y_test=train_test_split(X,Y,test_size=0.3,random_state=42)
logreg.fit(x_train,y_train)
predict=logreg.predict(x_test)
print("Accuracy score on training set is {}".format(accuracy_score(logreg.predict(x_train),y_train)))
print("Accuracy score on test set is {}".format(accuracy_score(predict,y_test)))
2、K 折交叉验证

在这种 K 折交叉验证技术中,整个数据集被划分为 K 个相等大小的部分。每个分区称为一个“折叠”。因此,因为我们有 K 个部分,所以我们称之为 K 折叠。一折用作验证集,其余 K-1 折用作训练集。

该技术重复 K 次,直到每个折叠用作验证集,其余折叠用作训练集。

  1. 整个数据集既用作训练集又用作验证集:

缺点


  1. 不用于不平衡的数据集:正如在 HoldOut 交叉验证的情况下所讨论的,在 K-Fold 验证的情况下也可能发生训练集的所有样本都没有样本形式类“1”,并且只有 类“0”。验证集将有一个类“1”的样本。



  2. 不适合时间序列数据:对于时间序列数据,样本的顺序很重要。但是在 K 折交叉验证中,样本是按随机顺序选择的。


代码片段

from sklearn.datasets import load_iris
from sklearn.model_selection import cross_val_score,KFold
from sklearn.linear_model import LogisticRegression
iris=load_iris()
X=iris.data
Y=iris.target
logreg=LogisticRegression()
kf=KFold(n_splits=5)
score=cross_val_score(logreg,X,Y,cv=kf)
print("Cross Validation Scores are {}".format(score))
print("Average Cross Validation score :{}".format(score.mean()))
3、分层 K 折交叉验证

分层 K-Fold 是 K-Fold 交叉验证的增强版本,主要用于不平衡的数据集。就像 K-fold 一样,整个数据集被分成大小相等的 K-fold。

但是在这种技术中,每个折叠将具有与整个数据集中相同的目标变量实例比率。

  1. 对于不平衡数据非常有效:分层交叉验证中的每个折叠都会以与整个数据集中相同的比率表示所有类别的数据。

缺点

  1. 不适合时间序列数据:对于时间序列数据,样本的顺序很重要。但在分层交叉验证中,样本是按随机顺序选择的。

代码片段

from sklearn.datasets import load_iris
from sklearn.model_selection import cross_val_score,StratifiedKFold
from sklearn.linear_model import LogisticRegression
iris=load_iris()
X=iris.data
Y=iris.target
logreg=LogisticRegression()
stratifiedkf=StratifiedKFold(n_splits=5)
score=cross_val_score(logreg,X,Y,cv=stratifiedkf)
print("Cross Validation Scores are {}".format(score))
print("Average Cross Validation score :{}".format(score.mean()))
4、Leave P Out 交叉验证

Leave P Out 交叉验证是一种详尽的交叉验证技术,其中 p 样本用作验证集,剩余的 np 样本用作训练集。

假设我们在数据集中有 100 个样本。如果我们使用 p=10,那么在每次迭代中,10 个值将用作验证集,其余 90 个样本将用作训练集。

重复这个过程,直到整个数据集在 p-样本和 n-p 训练样本的验证集上被划分。

优点

所有数据样本都用作训练和验证样本。

缺点


  1. 计算时间长:由于上述技术会不断重复,直到所有样本都用作验证集,因此计算时间会更长。



  2. 不适合不平衡数据集:与 K 折交叉验证相同,如果在训练集中我们只有 1 个类的样本,那么我们的模型将无法推广到验证集。


代码片段

from sklearn.model_selection import LeavePOut,cross_val_score
from sklearn.datasets import load_iris
from sklearn.ensemble import RandomForestClassifier
iris=load_iris()
X=iris.data
Y=iris.target
lpo=LeavePOut(p=2)
lpo.get_n_splits(X)
tree=RandomForestClassifier(n_estimators=10,max_depth=5,n_jobs=-1)
score=cross_val_score(tree,X,Y,cv=lpo)
print("Cross Validation Scores are {}".format(score))
print("Average Cross Validation score :{}".format(score.mean()))
5、留一交叉验证

留一交叉验证是一种详尽的交叉验证技术,其中 1 个样本点用作验证集,其余 n-1 个样本用作训练集。

假设我们在数据集中有 100 个样本。然后在每次迭代中,1 个值将用作验证集,其余 99 个样本作为训练集。因此,重复该过程,直到数据集的每个样本都用作验证点。

from sklearn.datasets import load_iris
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import LeaveOneOut,cross_val_score
iris=load_iris()
X=iris.data
Y=iris.target
loo=LeaveOneOut()
tree=RandomForestClassifier(n_estimators=10,max_depth=5,n_jobs=-1)
score=cross_val_score(tree,X,Y,cv=loo)
print("Cross Validation Scores are {}".format(score))
print("Average Cross Validation score :{}".format(score.mean()))

6、蒙特卡罗交叉验证(Shuffle Split)

蒙特卡罗交叉验证,也称为Shuffle Split交叉验证,是一种非常灵活的交叉验证策略。在这种技术中,数据集被随机划分为训练集和验证集。

我们已经决定了要用作训练集的数据集的百分比和用作验证集的百分比。如果训练集和验证集大小的增加百分比总和不是 100,则剩余的数据集不会用于训练集或验证集。

假设我们有 100 个样本,其中 60% 的样本用作训练集,20% 的样本用作验证集,那么剩下的 20%( 100-(60+20)) 将不被使用。

这种拆分将重复我们必须指定的“n”次。

1.我们可以自由使用训练和验证集的大小。

2.我们可以选择重复的次数,而不依赖于重复的折叠次数。

缺点


  1. 可能不会为训练集或验证集选择很少的样本。



  2. 不适合不平衡的数据集:在我们定义了训练集和验证集的大小后,所有的样本都是随机选择的,所以训练集可能没有测试中的数据类别 设置,并且该模型将无法概括为看不见的数据。


代码片段

from sklearn.model_selection import ShuffleSplit,cross_val_score
from sklearn.datasets import load_iris
from sklearn.linear_model import LogisticRegression
logreg=LogisticRegression()
shuffle_split=ShuffleSplit(test_size=0.3,train_size=0.5,n_splits=10)
scores=cross_val_score(logreg,iris.data,iris.target,cv=shuffle_split)
print("cross Validation scores:n {}".format(scores))
print("Average Cross Validation score :{}".format(scores.mean()))
7、时间序列交叉验证

什么是时间序列数据?

时间序列数据是在不同时间点收集的数据。由于数据点是在相邻时间段收集的,因此观测值之间可能存在相关性。这是区分时间序列数据与横截面数据的特征之一。

在时间序列数据的情况下如何进行交叉验证?

在时间序列数据的情况下,我们不能选择随机样本并将它们分配给训练集或验证集,因为使用未来数据中的值来预测过去数据的值是没有意义的。

由于数据的顺序对于时间序列相关问题非常重要,所以我们根据时间将数据拆分为训练集和验证集,也称为“前向链”方法或滚动交叉验证。

我们从一小部分数据作为训练集开始。基于该集合,我们预测稍后的数据点,然后检查准确性。

然后将预测样本作为下一个训练数据集的一部分包括在内,并对后续样本进行预测。

最好的技术之一。

缺点

不适用于其他数据类型的验证:与其他技术一样,我们选择随机样本作为训练或验证集,但在该技术中数据的顺序非常重要。

代码片段

import numpy as np
from sklearn.model_selection import TimeSeriesSplit
X = np.array([[1, 2], [3, 4], [1, 2], [3, 4], [1, 2], [3, 4]])
y = np.array([1, 2, 3, 4, 5, 6])
time_series = TimeSeriesSplit()
print(time_series)
for train_index, test_index in time_series.split(X):
print("TRAIN:", train_index, "TEST:", test_index)
X_train, X_test = X[train_index], X[test_index]
y_train, y_test = y[train_index], y[test_index]
结论

在本文中,我试图概述各种交叉验证技术的工作原理以及我们在实施这些技术时应牢记的事项,我真诚地希望在这个数据科学之旅中对你有所帮助。





三连在看,月入百万

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
华盛顿:25年前那个决定,是个天大的错误,对中国却是天大的好事!

华盛顿:25年前那个决定,是个天大的错误,对中国却是天大的好事!

微评社
2026-08-18 16:55:16
因为39万亿美元还不起,特朗普很有可能已经有了弄死第一大"债主"的想法?现在美国欠的钱,快到40万亿了

因为39万亿美元还不起,特朗普很有可能已经有了弄死第一大"债主"的想法?现在美国欠的钱,快到40万亿了

扶苏聊历史
2026-08-18 14:09:59
白眼狼的下场!刚扣押完中国人,走投无路的马科斯因暴雨求援中方

白眼狼的下场!刚扣押完中国人,走投无路的马科斯因暴雨求援中方

闻香阁
2026-08-18 08:34:49
帕劳总统称希望太平洋岛国就中国近期洲际弹道导弹试射一事形成“统一战线”,中方:帕方言论毫无根据、用心险恶,不值一评

帕劳总统称希望太平洋岛国就中国近期洲际弹道导弹试射一事形成“统一战线”,中方:帕方言论毫无根据、用心险恶,不值一评

政知新媒体
2026-08-18 15:32:38
越扒越有!打赏千万要求女主播陪睡后续,聊天记录曝光隐秘细节

越扒越有!打赏千万要求女主播陪睡后续,聊天记录曝光隐秘细节

文刀贰
2026-08-17 21:48:39
顶着张歪瓜脸,混进央视剧中演特警咋咋呼呼,谁的审美出了问题?

顶着张歪瓜脸,混进央视剧中演特警咋咋呼呼,谁的审美出了问题?

白面书誏
2026-08-18 13:45:52
杭州酒局事件官方通告,副区长强制猥亵被实锤

杭州酒局事件官方通告,副区长强制猥亵被实锤

News脑洞
2026-08-18 18:29:45
外国游客因护照上的“马丘比丘纪念章”被航空公司拒绝登机

外国游客因护照上的“马丘比丘纪念章”被航空公司拒绝登机

曼谷陈大叔
2026-08-18 15:13:57
请问上海是不是在耍流氓?最低工资2740,也要按7546元标准缴社保

请问上海是不是在耍流氓?最低工资2740,也要按7546元标准缴社保

慧翔百科
2026-08-18 17:32:16
中华人民共和国正式向全世界宣告两件大事:

中华人民共和国正式向全世界宣告两件大事:

叶葉夜
2026-08-17 22:56:14
只为雇主一句嘱托,四川大哥独自在深山看守偏僻老宅,近乎与世隔绝生活20余年,今年63岁的他终于回家了

只为雇主一句嘱托,四川大哥独自在深山看守偏僻老宅,近乎与世隔绝生活20余年,今年63岁的他终于回家了

扬子晚报
2026-08-18 15:14:49
学籍案弟弟哽咽发声:妻离子散亲人离世,母亲却说他太自私

学籍案弟弟哽咽发声:妻离子散亲人离世,母亲却说他太自私

行者聊官
2026-08-18 17:40:54
无视珍妮反对!巴斯家族五位成员发表声明:决定出售湖人剩余股权

无视珍妮反对!巴斯家族五位成员发表声明:决定出售湖人剩余股权

罗说NBA
2026-08-19 05:26:31
我们都叫错了朱老!他根本不是高考状元,1947年清华自主招生湖南第一,这份成绩单比状元头衔硬核多了

我们都叫错了朱老!他根本不是高考状元,1947年清华自主招生湖南第一,这份成绩单比状元头衔硬核多了

子芫伴你成长
2026-08-18 18:19:38
伊朗悬赏3万美元猎杀美军!停火协议破裂,特朗普威胁再炸一国

伊朗悬赏3万美元猎杀美军!停火协议破裂,特朗普威胁再炸一国

闻识
2026-08-18 03:50:51
对同胞,他们比日本人还狠

对同胞,他们比日本人还狠

求实处
2026-08-18 22:25:10
塘主回应80只东方白鹳把蟹塘当食堂:每天损失三四万块,扛不住了

塘主回应80只东方白鹳把蟹塘当食堂:每天损失三四万块,扛不住了

齐鲁壹点
2026-08-18 17:56:26
中国人民银行新增8家数字人民币业务运营机构

中国人民银行新增8家数字人民币业务运营机构

界面新闻
2026-08-17 15:07:08
朝鲜没想到,派遣了1万多人去俄罗斯打仗,结果,现在俄罗斯生产的啤酒、烟草、菜籽油和猪肉都开始大量进入朝鲜了

朝鲜没想到,派遣了1万多人去俄罗斯打仗,结果,现在俄罗斯生产的啤酒、烟草、菜籽油和猪肉都开始大量进入朝鲜了

扶苏聊历史
2026-08-18 14:38:25
杭州酒局事件细节曝光:受害女生求助无果反抗被推倒致伤,事后赵海峰拿出百万求私了被拒

杭州酒局事件细节曝光:受害女生求助无果反抗被推倒致伤,事后赵海峰拿出百万求私了被拒

Mr王的饭后茶
2026-08-18 21:33:38
2026-08-19 06:56:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3510文章数 11195关注度
往期回顾 全部

科技要闻

英伟达的资本局:从AI卖铲人到AI央行

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

头条要闻

女子称住民宿被员工打开房门看光:我全裸在擦身体

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

一场酒局献祭,掀开了杭州地产潜规则

汽车要闻

满配华为乾崑智能科技 奕境X9预售价29.98万-37.98万

态度原创

旅游
数码
家居
公开课
军事航空

旅游要闻

今日,宜约会!北京这几个小众地儿,地铁直达,还不费钱!

数码要闻

杨元庆:AI可能局部过热,但远未结束

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

制胜铁拳 96A式主战坦克高清画面来了

无障碍浏览 进入关怀版