跳转至

datasets

壹丨Catboost中的数据集

数据集名称 适用 数量 代码
UCI Adult Data Set 二分类 Train:32561
Val:16281
Kaggle Amazon Employee Access Challenge 二分类 Train:32769
Val:58921
Epsilon dataset 二分类 Train:400000
Val:100000
HIGGS Data Set 二分类 Train:10500000
Val:5000000
monotonic1 from Yandex 分类、回归
monotonic2 from Yandex 回归
Microsoft Learning to Rank Dataset 排序 Train:723412
Val:241521
Microsoft Learning to Rank Dataset 排序 Train:10000
Val:10000
Rotten Tomatoes dataset 文本分类 Train:32712
Val:8179
Kaggle Titanic: Machine Learning from Disaster 二分类 Train:891
Val:418
# UCI Adult Data Set
from catboost.datasets import adult
adult_train, adult_test = adult()

adult_train.head(3)
# Kaggle Amazon Employee Access Challenge
from catboost.datasets import amazon
amazon_train, amazon_test = amazon()

amazon_train.head(3)
# Epsilon dataset
from catboost.datasets import epsilon
epsilon_train, epsilon_test = epsilon()
# HIGGS Data Set
from catboost.datasets import higgs
higgs_train, higgs_test = higgs()

higgs_train.head(3)
from catboost.datasets import monotonic1
monotonic1_train, monotonic1_test = monotonic1()

monotonic1_train.head(3)
from catboost.datasets import monotonic2
monotonic2_train, monotonic2_test = monotonic2()

monotonic2_train.head(3)
from catboost.datasets import msrank
msrank_train, msrank_test = msrank()

msrank_train.head(3)
from catboost.datasets import msrank_10k
msrank_10k_train, msrank_10k_test = msrank_10k()

msrank_10k_train.head(3)
from catboost.datasets import rotten_tomatoes
rotten_tomatoes_train, rotten_tomatoes_test = rotten_tomatoes()

rotten_tomatoes_train.head(3)
from catboost.datasets import titanic
titanic_train, titanic_test = titanic()

titanic_train.head(3)