数据预处理--数据集处理

选择训练集/开发集/测试集大小

  之前,我只知道较普遍的 60/20/20 分隔。
  但对于一个非常大的数据集,应该使用 98/1/1 甚至 99/0.5/0.5 的分隔。这是因为开发集合测试集只要足够大能保证模型处于团队设定的置信区间即可。如果你使用 1 千万个训练样本,那么 10 万样本(即数据集的 1%)就足够保证开发集和/或测试集的置信区间了。

数据集如何确保开发集和测试集的数据分布一致?

  k折交叉验证!

猜你喜欢

转载自blog.csdn.net/wydbyxr/article/details/84832690
今日推荐