From 455e73858e8bf5ef3d6bbd302e3763f68976c7f0 Mon Sep 17 00:00:00 2001 From: XianBW <36835909+XianBW@users.noreply.github.com> Date: Mon, 30 Sep 2024 01:21:45 +0800 Subject: [PATCH] fix bug in feature selection (#398) --- rdagent/scenarios/kaggle/developer/coder.py | 2 +- .../model/select_xgboost.py | 2 +- .../experiment/digit-recognizer_template/model/select_nn.py | 2 +- .../digit-recognizer_template/model/select_xgboost.py | 2 +- .../model/select_randomforest.py | 2 +- .../model/select_xgboost.py | 2 +- .../forest-cover-type-prediction_template/model/select_nn.py | 2 +- .../model/select_randomforest.py | 2 +- .../model/select_xgboost.py | 2 +- .../model/select_randomforest.py | 2 +- .../model/select_xgboost.py | 2 +- .../model/select_randomforest.py | 2 +- .../playground-series-s3e11_template/model/select_xgboost.py | 2 +- .../model/select_randomforest.py | 2 +- .../playground-series-s3e26_template/model/select_xgboost.py | 2 +- .../model/select_randomforest.py | 2 +- .../playground-series-s4e8_template/model/select_xgboost.py | 2 +- .../model/select_randomforest.py | 2 +- .../playground-series-s4e9_template/model/select_xgboost.py | 2 +- .../experiment/sf-crime_template/model/select_randomforest.py | 2 +- .../kaggle/experiment/sf-crime_template/model/select_xgboost.py | 2 +- .../experiment/spaceship-titanic_template/model/select_nn.py | 2 +- .../spaceship-titanic_template/model/select_randomforest.py | 2 +- .../spaceship-titanic_template/model/select_xgboost.py | 2 +- .../model/select_xgboost.py | 2 +- 25 files changed, 25 insertions(+), 25 deletions(-) diff --git a/rdagent/scenarios/kaggle/developer/coder.py b/rdagent/scenarios/kaggle/developer/coder.py index 1aa0ead1..3c02f552 100644 --- a/rdagent/scenarios/kaggle/developer/coder.py +++ b/rdagent/scenarios/kaggle/developer/coder.py @@ -29,7 +29,7 @@ def select(X: pd.DataFrame) -> pd.DataFrame: {% if feature_index_list is not none %} X = X.loc[:, X.columns.levels[0][{{feature_index_list}}].tolist()] {% endif %} - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X """ diff --git a/rdagent/scenarios/kaggle/experiment/covid19-global-forecasting-week-1_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/covid19-global-forecasting-week-1_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/covid19-global-forecasting-week-1_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/covid19-global-forecasting-week-1_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_nn.py b/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_nn.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_nn.py +++ b/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_nn.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/digit-recognizer_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/feedback-prize-english-language-learning_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_nn.py b/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_nn.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_nn.py +++ b/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_nn.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/forest-cover-type-prediction_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/optiver-realized-volatility-prediction_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s3e11_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s3e26_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s4e8_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/playground-series-s4e9_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/sf-crime_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_nn.py b/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_nn.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_nn.py +++ b/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_nn.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_randomforest.py b/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_randomforest.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_randomforest.py +++ b/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_randomforest.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/spaceship-titanic_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X diff --git a/rdagent/scenarios/kaggle/experiment/statoil-iceberg-classifier-challenge_template/model/select_xgboost.py b/rdagent/scenarios/kaggle/experiment/statoil-iceberg-classifier-challenge_template/model/select_xgboost.py index d2a15dee..f230f130 100644 --- a/rdagent/scenarios/kaggle/experiment/statoil-iceberg-classifier-challenge_template/model/select_xgboost.py +++ b/rdagent/scenarios/kaggle/experiment/statoil-iceberg-classifier-challenge_template/model/select_xgboost.py @@ -8,5 +8,5 @@ def select(X: pd.DataFrame) -> pd.DataFrame: # For now, we assume all features are relevant. This can be expanded to feature selection logic. if X.columns.nlevels == 1: return X - X.columns = ["_".join(str(col)).strip() for col in X.columns.values] + X.columns = ["_".join(str(i) for i in col).strip() for col in X.columns.values] return X