{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.14","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":84896,"databundleVersionId":10305135,"sourceType":"competition"}],"dockerImageVersionId":30804,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"code","source":"# This Python 3 environment comes with many helpful analytics libraries installed\n# It is defined by the kaggle/python Docker image: https://github.com/kaggle/docker-python\n# For example, here's several helpful packages to load\n\nimport numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\n\n# Input data files are available in the read-only \"../input/\" directory\n# For example, running this (by clicking run or pressing Shift+Enter) will list all files under the input directory\n\nimport os\nfor dirname, _, filenames in os.walk('/kaggle/input'):\n    for filename in filenames:\n        print(os.path.join(dirname, filename))\n\n# You can write up to 20GB to the current directory (/kaggle/working/) that gets preserved as output when you create a version using \"Save & Run All\" \n# You can also write temporary files to /kaggle/temp/, but they won't be saved outside of the current session","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:07.091872Z","iopub.execute_input":"2024-12-08T14:13:07.09229Z","iopub.status.idle":"2024-12-08T14:13:07.100976Z","shell.execute_reply.started":"2024-12-08T14:13:07.092254Z","shell.execute_reply":"2024-12-08T14:13:07.099874Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## Training Data","metadata":{}},{"cell_type":"code","source":"import pandas as pd\n\ndf_train=pd.read_csv('/kaggle/input/playground-series-s4e12/train.csv')\nprint(df_train.shape)\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:07.10267Z","iopub.execute_input":"2024-12-08T14:13:07.102986Z","iopub.status.idle":"2024-12-08T14:13:11.67985Z","shell.execute_reply.started":"2024-12-08T14:13:07.102953Z","shell.execute_reply":"2024-12-08T14:13:11.678773Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train=df_train.drop(columns=[\"id\",\"Policy Start Date\"])\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:11.681658Z","iopub.execute_input":"2024-12-08T14:13:11.681994Z","iopub.status.idle":"2024-12-08T14:13:11.854273Z","shell.execute_reply.started":"2024-12-08T14:13:11.681962Z","shell.execute_reply":"2024-12-08T14:13:11.853228Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train.info()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:11.85554Z","iopub.execute_input":"2024-12-08T14:13:11.855899Z","iopub.status.idle":"2024-12-08T14:13:12.438165Z","shell.execute_reply.started":"2024-12-08T14:13:11.855861Z","shell.execute_reply":"2024-12-08T14:13:12.437171Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"# define numerical & categorical columns\nnumeric_features = [feature for feature in df_train.columns if df_train[feature].dtype != 'object']\ncategorical_features = [feature for feature in df_train.columns if df_train[feature].dtype == 'object']\n\n# print columns\nprint('We have {} numerical features : {}'.format(len(numeric_features), numeric_features))\nprint('\\nWe have {} categorical features : {}'.format(len(categorical_features), categorical_features))","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:12.441178Z","iopub.execute_input":"2024-12-08T14:13:12.441638Z","iopub.status.idle":"2024-12-08T14:13:12.448892Z","shell.execute_reply.started":"2024-12-08T14:13:12.44159Z","shell.execute_reply":"2024-12-08T14:13:12.447709Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"print(\"Number of duplicated rows:\",df_train.duplicated().sum())\ndf_train=df_train.drop_duplicates()\nprint(\"Number of duplicated rows:\",df_train.duplicated().sum())","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:12.450339Z","iopub.execute_input":"2024-12-08T14:13:12.45074Z","iopub.status.idle":"2024-12-08T14:13:17.069346Z","shell.execute_reply.started":"2024-12-08T14:13:12.450696Z","shell.execute_reply":"2024-12-08T14:13:17.06815Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train.isna().sum().sort_values(ascending=False)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:17.0706Z","iopub.execute_input":"2024-12-08T14:13:17.070904Z","iopub.status.idle":"2024-12-08T14:13:17.649273Z","shell.execute_reply.started":"2024-12-08T14:13:17.070875Z","shell.execute_reply":"2024-12-08T14:13:17.648103Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train.nunique().sort_values(ascending=False)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:17.650523Z","iopub.execute_input":"2024-12-08T14:13:17.650848Z","iopub.status.idle":"2024-12-08T14:13:18.570699Z","shell.execute_reply.started":"2024-12-08T14:13:17.650818Z","shell.execute_reply":"2024-12-08T14:13:18.569589Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## We have 9 numerical features :\n1. 'Age'\n2. 'Annual Income'\n3. 'Number of Dependents'\n4. 'Health Score'\n5. 'Previous Claims'\n6. 'Vehicle Age'------------>(done)\n7. 'Credit Score'\n8. 'Insurance Duration'------------>(done)\n\n\n## We have 11 categorical features : \n1. 'Gender'------------>(done)\n2. 'Marital Status'\n3. 'Education Level'------------>(done)\n4. 'Occupation'\n5. 'Location'------------>(done)\n6. 'Policy Type'------------>(done)\n7. 'Customer Feedback'\n8. 'Smoking Status'------------>(done)\n9. 'Exercise Frequency'------------>(done)\n10. 'Property Type'------------>(done)","metadata":{}},{"cell_type":"markdown","source":"## 1. Age","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Age'].isna().sum())\nprint(\"Number of unique values:\",df_train['Age'].unique())\nprint(\"List of unique values:\",df_train['Age'].nunique())\n\nvalue_counts = df_train['Age'].value_counts().to_dict()\n\nprint(\"Age:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:18.572104Z","iopub.execute_input":"2024-12-08T14:13:18.572465Z","iopub.status.idle":"2024-12-08T14:13:18.623874Z","shell.execute_reply.started":"2024-12-08T14:13:18.572434Z","shell.execute_reply":"2024-12-08T14:13:18.622715Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 2.'Annual Income","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Annual Income'].isna().sum())\nprint(\"Number of unique values:\",df_train['Annual Income'].unique())\nprint(\"List of unique values:\",df_train['Annual Income'].nunique())\n\n\n# Get the value counts for 'Number of Dependents' and convert to a dictionary\nvalue_counts = df_train['Annual Income'].value_counts().sort_values(ascending=False).head(50).to_dict()\n\n# Print the top 50 most frequent values and their counts\nprint(\"Annual Income:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:18.625065Z","iopub.execute_input":"2024-12-08T14:13:18.625366Z","iopub.status.idle":"2024-12-08T14:13:18.767451Z","shell.execute_reply.started":"2024-12-08T14:13:18.625335Z","shell.execute_reply":"2024-12-08T14:13:18.76628Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 3.'Number of Dependents'","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Number of Dependents'].isna().sum())\nprint(\"Number of unique values:\",df_train['Number of Dependents'].unique())\nprint(\"List of unique values:\",df_train['Number of Dependents'].nunique())\n\nvalue_counts = df_train['Number of Dependents'].value_counts().to_dict()\nprint(\"Number of Dependents:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:18.772399Z","iopub.execute_input":"2024-12-08T14:13:18.772775Z","iopub.status.idle":"2024-12-08T14:13:18.829079Z","shell.execute_reply.started":"2024-12-08T14:13:18.772742Z","shell.execute_reply":"2024-12-08T14:13:18.828089Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 4. Health Score","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Health Score'].isna().sum())\nprint(\"Number of unique values:\",df_train['Health Score'].unique())\nprint(\"List of unique values:\",df_train['Health Score'].nunique())\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:18.830512Z","iopub.execute_input":"2024-12-08T14:13:18.830929Z","iopub.status.idle":"2024-12-08T14:13:19.030949Z","shell.execute_reply.started":"2024-12-08T14:13:18.83088Z","shell.execute_reply":"2024-12-08T14:13:19.029807Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 5. Previous Claims","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Previous Claims'].isna().sum())\nprint(\"Number of unique values:\",df_train['Previous Claims'].unique())\nprint(\"List of unique values:\",df_train['Previous Claims'].nunique())\n\nvalue_counts = df_train['Previous Claims'].value_counts().to_dict()\nprint(\"Previous Claims:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.03253Z","iopub.execute_input":"2024-12-08T14:13:19.033Z","iopub.status.idle":"2024-12-08T14:13:19.104366Z","shell.execute_reply.started":"2024-12-08T14:13:19.032951Z","shell.execute_reply":"2024-12-08T14:13:19.103111Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 6. Vehicle Age","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Vehicle Age'].isna().sum())\nprint(\"Number of unique values:\",df_train['Vehicle Age'].unique())\nprint(\"List of unique values:\",df_train['Vehicle Age'].nunique())\n\nvalue_counts = df_train['Vehicle Age'].value_counts().to_dict()\nprint(\"Vehicle Age:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.10579Z","iopub.execute_input":"2024-12-08T14:13:19.106142Z","iopub.status.idle":"2024-12-08T14:13:19.15865Z","shell.execute_reply.started":"2024-12-08T14:13:19.106075Z","shell.execute_reply":"2024-12-08T14:13:19.157523Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train['Vehicle Age']=df_train['Vehicle Age'].fillna(17.0)\ndf_train['Vehicle Age']=df_train['Vehicle Age'].astype(int)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.160193Z","iopub.execute_input":"2024-12-08T14:13:19.160632Z","iopub.status.idle":"2024-12-08T14:13:19.192323Z","shell.execute_reply.started":"2024-12-08T14:13:19.160586Z","shell.execute_reply":"2024-12-08T14:13:19.191316Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"### 7. Credit Score","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Credit Score'].isna().sum())\nprint(\"Number of unique values:\",df_train['Credit Score'].unique())\nprint(\"List of unique values:\",df_train['Credit Score'].nunique())","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.193693Z","iopub.execute_input":"2024-12-08T14:13:19.194014Z","iopub.status.idle":"2024-12-08T14:13:19.235367Z","shell.execute_reply.started":"2024-12-08T14:13:19.193983Z","shell.execute_reply":"2024-12-08T14:13:19.234265Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 8. Insurance Duration","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Insurance Duration'].isna().sum())\nprint(\"Number of unique values:\",df_train['Insurance Duration'].unique())\nprint(\"List of unique values:\",df_train['Insurance Duration'].nunique())\n\nvalue_counts = df_train['Insurance Duration'].value_counts().to_dict()\nprint(\"Insurance Duration:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.236663Z","iopub.execute_input":"2024-12-08T14:13:19.23703Z","iopub.status.idle":"2024-12-08T14:13:19.288333Z","shell.execute_reply.started":"2024-12-08T14:13:19.236999Z","shell.execute_reply":"2024-12-08T14:13:19.286996Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_train['Insurance Duration']=df_train['Insurance Duration'].fillna(9.0)\ndf_train['Insurance Duration']=df_train['Insurance Duration'].astype(int)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.289726Z","iopub.execute_input":"2024-12-08T14:13:19.290097Z","iopub.status.idle":"2024-12-08T14:13:19.31386Z","shell.execute_reply.started":"2024-12-08T14:13:19.290063Z","shell.execute_reply":"2024-12-08T14:13:19.312675Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 1.Gender","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Gender'].isna().sum())\nprint(\"Number of unique values:\",df_train['Gender'].unique())\nprint(\"List of unique values:\",df_train['Gender'].nunique())\n\nvalue_counts = df_train['Gender'].value_counts().to_dict()\nprint(\"Gender:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.315316Z","iopub.execute_input":"2024-12-08T14:13:19.315652Z","iopub.status.idle":"2024-12-08T14:13:19.596276Z","shell.execute_reply.started":"2024-12-08T14:13:19.315618Z","shell.execute_reply":"2024-12-08T14:13:19.595298Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"from sklearn.preprocessing import LabelEncoder\n\n# Initialize LabelEncoder\nlabel_encoder = LabelEncoder()\ndf_train['Gender'] = label_encoder.fit_transform(df_train['Gender'])\ndf_train.head(20)","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.597751Z","iopub.execute_input":"2024-12-08T14:13:19.598233Z","iopub.status.idle":"2024-12-08T14:13:19.861991Z","shell.execute_reply.started":"2024-12-08T14:13:19.598162Z","shell.execute_reply":"2024-12-08T14:13:19.860912Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 2. Martial Status","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Marital Status'].isna().sum())\nprint(\"Number of unique values:\",df_train['Marital Status'].unique())\nprint(\"List of unique values:\",df_train['Marital Status'].nunique())\n\nvalue_counts = df_train['Marital Status'].value_counts().to_dict()\nprint(\"Marital Status:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:19.863481Z","iopub.execute_input":"2024-12-08T14:13:19.863881Z","iopub.status.idle":"2024-12-08T14:13:20.129087Z","shell.execute_reply.started":"2024-12-08T14:13:19.863846Z","shell.execute_reply":"2024-12-08T14:13:20.128061Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 3. Education Level","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Education Level'].isna().sum())\nprint(\"Number of unique values:\",df_train['Education Level'].unique())\nprint(\"List of unique values:\",df_train['Education Level'].nunique())\n\nvalue_counts = df_train['Education Level'].value_counts().to_dict()\nprint(\"Education Level:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:20.130662Z","iopub.execute_input":"2024-12-08T14:13:20.131095Z","iopub.status.idle":"2024-12-08T14:13:20.444905Z","shell.execute_reply.started":"2024-12-08T14:13:20.131048Z","shell.execute_reply":"2024-12-08T14:13:20.44377Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"Education_level_mapping = {\n    \"High School\": 1,\n    \"Bachelor's\": 2,\n    \"Master's\": 3,\n    \"PhD\": 4\n}\n\ndf_train['Education Level']=df_train['Education Level'].map(Education_level_mapping)\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:20.446397Z","iopub.execute_input":"2024-12-08T14:13:20.446839Z","iopub.status.idle":"2024-12-08T14:13:20.546965Z","shell.execute_reply.started":"2024-12-08T14:13:20.446783Z","shell.execute_reply":"2024-12-08T14:13:20.545871Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 4. Occupation","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Occupation'].isna().sum())\nprint(\"Number of unique values:\",df_train['Occupation'].unique())\nprint(\"List of unique values:\",df_train['Occupation'].nunique())\n\nvalue_counts = df_train['Occupation'].value_counts().to_dict()\nprint(\"Occupation:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:20.548857Z","iopub.execute_input":"2024-12-08T14:13:20.549502Z","iopub.status.idle":"2024-12-08T14:13:20.792553Z","shell.execute_reply.started":"2024-12-08T14:13:20.549453Z","shell.execute_reply":"2024-12-08T14:13:20.791435Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 5. 'Location'\n","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Location'].isna().sum())\nprint(\"Number of unique values:\",df_train['Location'].unique())\nprint(\"List of unique values:\",df_train['Location'].nunique())\n\nvalue_counts = df_train['Location'].value_counts().to_dict()\nprint(\"Location:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:20.794129Z","iopub.execute_input":"2024-12-08T14:13:20.794441Z","iopub.status.idle":"2024-12-08T14:13:21.090394Z","shell.execute_reply.started":"2024-12-08T14:13:20.79441Z","shell.execute_reply":"2024-12-08T14:13:21.089292Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"location_mapping = {\n    \"Urban\": 1,\n    \"Suburban\": 2,\n    \"Rural\": 3\n}\ndf_train['Location'] = df_train['Location'].map(location_mapping)\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:21.091986Z","iopub.execute_input":"2024-12-08T14:13:21.092459Z","iopub.status.idle":"2024-12-08T14:13:21.208555Z","shell.execute_reply.started":"2024-12-08T14:13:21.092407Z","shell.execute_reply":"2024-12-08T14:13:21.207512Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 6. 'Policy Type'\n","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Policy Type'].isna().sum())\nprint(\"Number of unique values:\",df_train['Policy Type'].unique())\nprint(\"List of unique values:\",df_train['Policy Type'].nunique())\n\nvalue_counts = df_train['Policy Type'].value_counts().to_dict()\nprint(\"Policy Type:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:21.209808Z","iopub.execute_input":"2024-12-08T14:13:21.210132Z","iopub.status.idle":"2024-12-08T14:13:21.520789Z","shell.execute_reply.started":"2024-12-08T14:13:21.210101Z","shell.execute_reply":"2024-12-08T14:13:21.519753Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"Policy_Type_mapping = {\n  'Basic': 1,\n  'Comprehensive': 2,\n  'Premium': 3\n}\n\ndf_train['Policy Type']=df_train['Policy Type'].map(Policy_Type_mapping)\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:21.522308Z","iopub.execute_input":"2024-12-08T14:13:21.522725Z","iopub.status.idle":"2024-12-08T14:13:21.625525Z","shell.execute_reply.started":"2024-12-08T14:13:21.522661Z","shell.execute_reply":"2024-12-08T14:13:21.624389Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 7. 'Customer Feedback'\n","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Customer Feedback'].isna().sum())\nprint(\"Number of unique values:\",df_train['Customer Feedback'].unique())\nprint(\"List of unique values:\",df_train['Customer Feedback'].nunique())\n\nvalue_counts = df_train['Customer Feedback'].value_counts().to_dict()\nprint(\"Customer Feedback:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:21.63031Z","iopub.execute_input":"2024-12-08T14:13:21.630657Z","iopub.status.idle":"2024-12-08T14:13:21.885059Z","shell.execute_reply.started":"2024-12-08T14:13:21.630623Z","shell.execute_reply":"2024-12-08T14:13:21.883991Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"##  8. Smoking status","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Smoking Status'].isna().sum())\nprint(\"Number of unique values:\",df_train['Smoking Status'].unique())\nprint(\"List of unique values:\",df_train['Smoking Status'].nunique())\n\nvalue_counts = df_train['Smoking Status'].value_counts().to_dict()\nprint(\"Smoking Status:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:21.886324Z","iopub.execute_input":"2024-12-08T14:13:21.886631Z","iopub.status.idle":"2024-12-08T14:13:22.173696Z","shell.execute_reply.started":"2024-12-08T14:13:21.8866Z","shell.execute_reply":"2024-12-08T14:13:22.172711Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"from sklearn.preprocessing import LabelEncoder\n\n# Initialize LabelEncoder\nlabel_encoder = LabelEncoder()\ndf_train['Smoking Status'] = label_encoder.fit_transform(df_train['Smoking Status'])\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:22.174851Z","iopub.execute_input":"2024-12-08T14:13:22.175125Z","iopub.status.idle":"2024-12-08T14:13:22.421711Z","shell.execute_reply.started":"2024-12-08T14:13:22.175096Z","shell.execute_reply":"2024-12-08T14:13:22.420745Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 9.'Exercise Frequency'","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Exercise Frequency'].isna().sum())\nprint(\"Number of unique values:\",df_train['Exercise Frequency'].unique())\nprint(\"List of unique values:\",df_train['Exercise Frequency'].nunique())\n\nvalue_counts = df_train['Exercise Frequency'].value_counts().to_dict()\nprint(\"Exercise Frequency:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:22.423024Z","iopub.execute_input":"2024-12-08T14:13:22.423364Z","iopub.status.idle":"2024-12-08T14:13:22.720456Z","shell.execute_reply.started":"2024-12-08T14:13:22.423334Z","shell.execute_reply":"2024-12-08T14:13:22.719262Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"exercise_frequency_mapping = {\n    \"Daily\": 1,\n    \"Weekly\": 2,\n    \"Monthly\": 3,\n    \"Rarely\": 4\n}\n\ndf_train['Exercise Frequency'] = df_train['Exercise Frequency'].map(exercise_frequency_mapping)\ndf_train.head()\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:22.721636Z","iopub.execute_input":"2024-12-08T14:13:22.72196Z","iopub.status.idle":"2024-12-08T14:13:22.823823Z","shell.execute_reply.started":"2024-12-08T14:13:22.721929Z","shell.execute_reply":"2024-12-08T14:13:22.82268Z"}},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"## 10.'Property Type","metadata":{}},{"cell_type":"code","source":"print(\"Number of missing values:\",df_train['Property Type'].isna().sum())\nprint(\"Number of unique values:\",df_train['Property Type'].unique())\nprint(\"List of unique values:\",df_train['Property Type'].nunique())\n\nvalue_counts = df_train['Property Type'].value_counts().to_dict()\nprint(\"Property Type:\")\nfor value, count in value_counts.items():\n    print(f\"  {value}: {count}\")\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:22.825166Z","iopub.execute_input":"2024-12-08T14:13:22.825531Z","iopub.status.idle":"2024-12-08T14:13:23.121435Z","shell.execute_reply.started":"2024-12-08T14:13:22.825498Z","shell.execute_reply":"2024-12-08T14:13:23.120255Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"property_type_mapping = {\n    \"House\": 1,\n    \"Apartment\": 2,\n    \"Condo\": 3\n}\ndf_train['Property Type'] = df_train['Property Type'].map(property_type_mapping)\ndf_train.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:23.122951Z","iopub.execute_input":"2024-12-08T14:13:23.123928Z","iopub.status.idle":"2024-12-08T14:13:23.225659Z","shell.execute_reply.started":"2024-12-08T14:13:23.123877Z","shell.execute_reply":"2024-12-08T14:13:23.22462Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"from sklearn.model_selection import train_test_split\nfrom sklearn.ensemble import HistGradientBoostingRegressor\nfrom sklearn.metrics import mean_squared_error\n\n# Prepare the features and target variable\nX = df_train.drop(columns=['Premium Amount'])\ny = df_train['Premium Amount']\n\n# Split data into training and testing sets\nX_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=42)\n\n# Initialize the HistGradientBoostingRegressor with default parameters\nxgboost_model = HistGradientBoostingRegressor(\n    loss=\"squared_error\",              # Default loss function\n    learning_rate=0.1,                 # Default learning rate\n    max_iter=100,                      # Number of boosting iterations\n    max_leaf_nodes=31,                 # Max leaf nodes per tree\n    min_samples_leaf=20,               # Minimum samples per leaf node\n    l2_regularization=0.0,             # L2 regularization strength\n    scoring=\"loss\"                     # Default scoring metric for early stopping\n)\n\n# Fit the model on the training data\nxgboost_model.fit(X_train, y_train)\n\n# Predict on the test data\ny_pred = xgboost_model.predict(X_test)\n\n# Calculate the RMSE\nrmse = mean_squared_error(y_test, y_pred, squared=False)\nprint(f'Root Mean Squared Error (RMSE): {rmse}')\n","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:35:07.46334Z","iopub.execute_input":"2024-12-08T14:35:07.464308Z","iopub.status.idle":"2024-12-08T14:35:08.824655Z","shell.execute_reply.started":"2024-12-08T14:35:07.464199Z","shell.execute_reply":"2024-12-08T14:35:08.823032Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"markdown","source":"# Testing data","metadata":{}},{"cell_type":"code","source":"import pandas as pd\n\ndf_test=pd.read_csv('/kaggle/input/playground-series-s4e12/train.csv')\nprint(df_test.shape)\ndf_test.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:23.227278Z","iopub.execute_input":"2024-12-08T14:13:23.227688Z","iopub.status.idle":"2024-12-08T14:13:27.671271Z","shell.execute_reply.started":"2024-12-08T14:13:23.227642Z","shell.execute_reply":"2024-12-08T14:13:27.670257Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"df_test=df_test.drop(columns=\"id\")\ndf_test.head()","metadata":{"trusted":true,"execution":{"iopub.status.busy":"2024-12-08T14:13:27.672561Z","iopub.execute_input":"2024-12-08T14:13:27.672882Z","iopub.status.idle":"2024-12-08T14:13:27.863479Z","shell.execute_reply.started":"2024-12-08T14:13:27.672851Z","shell.execute_reply":"2024-12-08T14:13:27.862262Z"}},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null},{"cell_type":"code","source":"","metadata":{"trusted":true},"outputs":[],"execution_count":null}]}