{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.14","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"gpu","dataSources":[{"sourceId":70367,"databundleVersionId":9188054,"sourceType":"competition"}],"dockerImageVersionId":30786,"isInternetEnabled":false,"language":"python","sourceType":"notebook","isGpuEnabled":true}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"# Import Libraries","metadata":{}},{"cell_type":"code","source":"import pandas as pd\nimport numpy as np\nimport tensorflow as tf\nfrom tensorflow.keras.models import Sequential\nfrom tensorflow.keras.layers import Conv2D, MaxPooling2D, Flatten, Dense, Dropout\nimport pyarrow.parquet as pq\nimport matplotlib.pyplot as plt\nfrom sklearn.model_selection import train_test_split\n","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2024-10-04T17:15:31.829429Z","iopub.execute_input":"2024-10-04T17:15:31.830661Z","iopub.status.idle":"2024-10-04T17:15:31.839351Z","shell.execute_reply.started":"2024-10-04T17:15:31.830601Z","shell.execute_reply":"2024-10-04T17:15:31.837126Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Load Data (AIRS-CH0 and FGS1 signals)","metadata":{}},{"cell_type":"code","source":"planet_id = '100468857'\nairs_ch0_signal_path = f\"/kaggle/input/ariel-data-challenge-2024/train/{planet_id}/AIRS-CH0_signal.parquet\"\nfgs1_signal_path = f\"/kaggle/input/ariel-data-challenge-2024/train/{planet_id}/FGS1_signal.parquet\"\n\nairs_ch0_signal = pq.read_table(airs_ch0_signal_path).to_pandas()\nfgs1_signal = pq.read_table(fgs1_signal_path).to_pandas()\n\nairs_ch0_reshaped = airs_ch0_signal.values.reshape(-1, 32, 356)\nfgs1_reshaped = fgs1_signal.values.reshape(-1, 32, 32)\n","metadata":{"execution":{"iopub.status.busy":"2024-10-04T17:15:31.842965Z","iopub.execute_input":"2024-10-04T17:15:31.84357Z","iopub.status.idle":"2024-10-04T17:15:33.961489Z","shell.execute_reply.started":"2024-10-04T17:15:31.843519Z","shell.execute_reply":"2024-10-04T17:15:33.959989Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Preprocess Data (Apply Gain and Offset)","metadata":{}},{"cell_type":"code","source":"gain = 1.23\noffset = 10\nrestored_airs_ch0 = (airs_ch0_reshaped * gain) + offset\nrestored_fgs1 = (fgs1_reshaped * gain) + offset\n\n# Normalize the input data between 0 and 1\nrestored_airs_ch0 = restored_airs_ch0 / np.max(restored_airs_ch0)\n","metadata":{"execution":{"iopub.status.busy":"2024-10-04T17:15:33.963373Z","iopub.execute_input":"2024-10-04T17:15:33.963936Z","iopub.status.idle":"2024-10-04T17:15:36.478588Z","shell.execute_reply.started":"2024-10-04T17:15:33.963859Z","shell.execute_reply":"2024-10-04T17:15:36.477208Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Build the CNN Model","metadata":{}},{"cell_type":"code","source":"def create_cnn_model(input_shape):\n    model = Sequential()\n    model.add(Conv2D(32, kernel_size=(3, 3), activation='relu', input_shape=input_shape))\n    model.add(MaxPooling2D(pool_size=(2, 2)))\n    model.add(Conv2D(64, kernel_size=(3, 3), activation='relu'))\n    model.add(MaxPooling2D(pool_size=(2, 2)))\n    model.add(Flatten())\n    model.add(Dense(128, activation='relu'))\n    model.add(Dropout(0.5))\n    model.add(Dense(283, activation='linear'))\n    model.compile(optimizer='adam', loss='mean_squared_error', metrics=['mae'])\n    return model\n\ninput_shape = (32, 356, 1)\ncnn_model = create_cnn_model(input_shape)\n","metadata":{"execution":{"iopub.status.busy":"2024-10-04T17:15:36.4801Z","iopub.execute_input":"2024-10-04T17:15:36.480514Z","iopub.status.idle":"2024-10-04T17:15:36.634874Z","shell.execute_reply.started":"2024-10-04T17:15:36.480472Z","shell.execute_reply":"2024-10-04T17:15:36.633653Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Train the CNN Model","metadata":{}},{"cell_type":"code","source":"# Random target data for testing purposes\ny_train = np.random.rand(airs_ch0_reshaped.shape[0], 283)\n\n# Normalize target data\ny_train = y_train / np.max(y_train)\n\nX_train, X_test, y_train, y_test = train_test_split(restored_airs_ch0, y_train, test_size=0.2, random_state=42)\n\nX_train_cnn = X_train.reshape(X_train.shape[0], 32, 356, 1)\nX_test_cnn = X_test.reshape(X_test.shape[0], 32, 356, 1)\n\nhistory = cnn_model.fit(X_train_cnn, y_train, epochs=10, batch_size=32, validation_data=(X_test_cnn, y_test))\n","metadata":{"execution":{"iopub.status.busy":"2024-10-04T17:15:36.638292Z","iopub.execute_input":"2024-10-04T17:15:36.638801Z","iopub.status.idle":"2024-10-04T17:15:40.088782Z","shell.execute_reply.started":"2024-10-04T17:15:36.638743Z","shell.execute_reply":"2024-10-04T17:15:40.086641Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Generate Predictions","metadata":{}},{"cell_type":"code","source":"predicted_spectra = cnn_model.predict(X_test_cnn)\nn_planets = predicted_spectra.shape[0]\nplanet_ids = [f\"planet_{i}\" for i in range(n_planets)]\npredicted_uncertainties = np.random.rand(n_planets, 283) * 0.01\n","metadata":{"execution":{"iopub.status.busy":"2024-10-04T17:15:40.090313Z","iopub.status.idle":"2024-10-04T17:15:40.091035Z","shell.execute_reply.started":"2024-10-04T17:15:40.09069Z","shell.execute_reply":"2024-10-04T17:15:40.090725Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"markdown","source":"# Create Submission File","metadata":{}},{"cell_type":"code","source":"n_wavelengths = 283\nspectra_columns = [f\"wl_{i+1}\" for i in range(n_wavelengths)]\nuncertainty_columns = [f\"sigma_{i+1}\" for i in range(n_wavelengths)]\n\nsubmission_data = []\nfor i, planet_id in enumerate(planet_ids):\n    row = [planet_id] + predicted_spectra[i].tolist() + predicted_uncertainties[i].tolist()\n    submission_data.append(row)\n\nsubmission_df = pd.DataFrame(submission_data, columns=['planet_id'] + spectra_columns + uncertainty_columns)\n\n# Save submission\n\nsubmission_df = submission_df.round(3)\n\n# Save the submission file with the reduced precision\nsubmission_file_path = \"/kaggle/working/submission.csv\"\nsubmission_df.to_csv(submission_file_path, index=False)\n\nprint(f\"Submission file saved with 3 decimal places.\")\n\n","metadata":{"execution":{"iopub.status.busy":"2024-10-04T17:15:40.092784Z","iopub.status.idle":"2024-10-04T17:15:40.093287Z","shell.execute_reply.started":"2024-10-04T17:15:40.09304Z","shell.execute_reply":"2024-10-04T17:15:40.093062Z"},"trusted":true},"execution_count":null,"outputs":[]}]}