{"cells":[{"metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","trusted":true},"cell_type":"code","source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nimport os\nimport gc\nimport time\nfrom IPython.display import clear_output\nfrom tensorflow.keras.models import load_model\nfrom tensorflow.keras.callbacks import ModelCheckpoint as MC\nfrom tensorflow.keras import backend as K\n\n\nroot = '/kaggle/input/rsna-str-pulmonary-embolism-detection'\nfor item in os.listdir(root):\n    path = os.path.join(root, item)\n    if os.path.isfile(path):\n        print(path)\n","execution_count":null,"outputs":[]},{"metadata":{"_uuid":"d629ff2d2480ee46fbb7e2d37f6b5fab8052498a","_cell_guid":"79c7e3d0-c299-4dcb-8224-4455121ee9b0","trusted":true},"cell_type":"code","source":"# print('Reading train data...')\ntrain = pd.read_csv(\"../input/rsna-str-pulmonary-embolism-detection/train.csv\")\nprint(train.shape)\ntrain.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"#### print('Reading test data...')\ntest = pd.read_csv(\"../input/rsna-str-pulmonary-embolism-detection/test.csv\")\nprint(test.shape)\ntest.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print('Reading sample data...')\nss = pd.read_csv(\"../input/rsna-str-pulmonary-embolism-detection/sample_submission.csv\")\nprint(ss.shape)\nss.head()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"ids = ss.id\ncounter = [1 for _ in range(10)]\nmapper = []\nfor i in ids:\n    n = '_'.join(i.split('_')[1:])\n    if n not in mapper:\n        mapper.append(n)\n    else:\n        counter[mapper.index(n)] += 1\nprint(\"List of keys:\")\nprint(mapper, sep='\\n')\nprint()\nprint(\"Count of items per key:\")\nprint(counter)","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"import vtk\nfrom vtk.util import numpy_support\nimport cv2\n\nreader = vtk.vtkDICOMImageReader()\ndef get_img(path):\n    reader.SetFileName(path)\n    reader.Update()\n    _extent = reader.GetDataExtent()\n    ConstPixelDims = [_extent[1]-_extent[0]+1, _extent[3]-_extent[2]+1, _extent[5]-_extent[4]+1]\n\n    ConstPixelSpacing = reader.GetPixelSpacing()\n    imageData = reader.GetOutput()\n    pointData = imageData.GetPointData()\n    arrayData = pointData.GetArray(0)\n    ArrayDicom = numpy_support.vtk_to_numpy(arrayData)\n    ArrayDicom = ArrayDicom.reshape(ConstPixelDims, order='F')\n    ArrayDicom = cv2.resize(ArrayDicom,(512,512))\n    return ArrayDicom","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"fpath = \"../input/rsna-str-pulmonary-embolism-detection/train/0003b3d648eb/d2b2960c2bbf/00ac73cfc372.dcm\"\nds = get_img(fpath)\n\nimport matplotlib.pyplot as plt\n\n#Convert dcom file to 8bit color\nfunc = lambda x: int((2**15 + x)*(255/2**16))\nint16_to_uint8 = np.vectorize(func)\n\ndef show_dicom_images(dcom):\n    f, ax = plt.subplots(1,2, figsize=(16,20))\n    data_row_img = int16_to_uint8(ds)\n    ax[0].imshow(data_row_img, cmap=plt.cm.bone)\n    ax[1].imshow(ds, cmap=plt.cm.bone)\n    #print(data_row_img)\n    ax[0].axis('off')\n    ax[0].set_title('8-bit DICOM Image')\n    ax[1].axis('off')\n    ax[1].set_title('16-bit DICOM Image')\n    plt.show()\n    \nshow_dicom_images(ds)","execution_count":null,"outputs":[]},{"metadata":{},"cell_type":"markdown","source":""},{"metadata":{"trusted":true},"cell_type":"code","source":"# import tensorflow as tf\n# from tensorflow import keras\n# from tensorflow.keras.models import Model\n# from tensorflow.keras.layers import Input, Dense, Dropout, Conv2D\n\n# inputs = Input((128, 128, 3))\n# #x = Conv2D(3, (1, 1), activation='relu')(inputs)\n# base_model = keras.applications.DenseNet121(\n#     include_top=False,\n#     weights=\"imagenet\"\n# )\n\n# base_model.trainable = False\n\n# outputs = base_model(inputs, training=False)\n# outputs = keras.layers.GlobalAveragePooling2D()(outputs)\n# outputs = Dropout(0.25)(outputs)\n# outputs = Dense(1024, activation='relu')(outputs)\n# outputs = Dense(256, activation='relu')(outputs)\n# outputs = Dense(64, activation='relu')(outputs)\n# ppoi = Dense(1, activation='sigmoid', name='pe_present_on_image')(outputs)\n# rlrg1 = Dense(1, activation='sigmoid', name='rv_lv_ratio_gte_1')(outputs)\n# rlrl1 = Dense(1, activation='sigmoid', name='rv_lv_ratio_lt_1')(outputs) \n# lspe = Dense(1, activation='sigmoid', name='leftsided_pe')(outputs)\n# cpe = Dense(1, activation='sigmoid', name='chronic_pe')(outputs)\n# rspe = Dense(1, activation='sigmoid', name='rightsided_pe')(outputs)\n# aacpe = Dense(1, activation='sigmoid', name='acute_and_chronic_pe')(outputs)\n# cnpe = Dense(1, activation='sigmoid', name='central_pe')(outputs)\n# indt = Dense(1, activation='sigmoid', name='indeterminate')(outputs)\n\n# model = Model(inputs=inputs, outputs={'pe_present_on_image':ppoi,\n#                                       'rv_lv_ratio_gte_1':rlrg1,\n#                                       'rv_lv_ratio_lt_1':rlrl1,\n#                                       'leftsided_pe':lspe,\n#                                       'chronic_pe':cpe,\n#                                       'rightsided_pe':rspe,\n#                                       'acute_and_chronic_pe':aacpe,\n#                                       'central_pe':cnpe,\n#                                       'indeterminate':indt})\n\n# opt = keras.optimizers.Adam(lr=0.001)\n\n# model.compile(optimizer=opt,\n#               loss='binary_crossentropy',\n#               metrics=['accuracy'])\n\n# model.summary()\n# model.save('pe_detection_model.h5')\n# del model\n# K.clear_session()\n# gc.collect()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"\"\"\"\nBaseline model -> UNet\n\"\"\"\n\nimport os\n\nimport tensorflow.keras as keras\n\nfrom tensorflow.keras.layers import (\n    Input,\n    Conv2D,\n    Conv2DTranspose,\n    BatchNormalization,\n    Activation,\n    MaxPooling2D,\n    Dropout,\n    concatenate,\n    Dense,\n    Flatten\n)\n\n# from keras.callbacks import ModelCheckpoint\nfrom tensorflow.keras import Model\nfrom tensorflow.keras.utils import plot_model\n\nimport tensorflow as tf\n\n    \n# # detect and init the TPU\n# tpu = tf.distribute.cluster_resolver.TPUClusterResolver()\n# tf.config.experimental_connect_to_cluster(tpu)\n# tf.tpu.experimental.initialize_tpu_system(tpu)\n\n# # instantiate a distribution strategy\n# tpu_strategy = tf.distribute.experimental.TPUStrategy(tpu)\n\nlog_level = True\nprint(\"Logging: \", log_level)\nos.environ[\"TF_CPP_MIN_LOG_LEVEL\"] = \"3\"\n\n\nclass UNet:\n    \"\"\"\n    UNet Class Model\n    \"\"\"\n\n    def __init__(\n        self,\n        input_height: int = 128,\n        input_width: int = 128,\n        input_features: int = 3,\n        num_inputs: int = 1,\n        filter_size: int = 12,\n        depth: int = 6,\n        output_features: int = 1,\n        num_outputs: int = 9,\n        logging=log_level,\n    ):\n\n        self.input_height = input_height\n        self.input_width = input_width\n        self.num_inputs = num_inputs\n        self.input_features = input_features\n\n        self.input_size = (input_height, input_width, num_inputs * input_features)\n        self.filter_size = filter_size\n        self.kernel_size = 3\n        self.depth = depth\n\n        self.logging = logging\n\n        self.num_outputs = num_outputs\n        self.output_features = output_features\n\n        self.output_size = num_outputs * output_features\n\n    def input_layer(self):\n        x = Input(self.input_size)\n        return x\n\n    def single_conv_2d(self, input_layer, n_filters):\n        x = Conv2D(\n            filters=n_filters, padding=\"same\", kernel_size=(self.kernel_size, self.kernel_size), activation=\"sigmoid\",\n        )(input_layer)\n        return x\n\n    def double_conv_2d(self, input_layer, n_filters):\n        x = Conv2D(\n            filters=n_filters,\n            kernel_size=(self.kernel_size, self.kernel_size),\n            padding=\"same\",\n            kernel_initializer=\"he_normal\",\n        )(input_layer)\n        x = BatchNormalization()(x)\n        x = Activation(\"relu\")(x)\n        x = Conv2D(\n            filters=n_filters,\n            kernel_size=(self.kernel_size, self.kernel_size),\n            padding=\"same\",\n            kernel_initializer=\"he_normal\",\n        )(x)\n        x = BatchNormalization()(x)\n        x = Activation(\"relu\")(x)\n        return x\n\n    def deconv_2d(self, input_layer, n_filters, stride=2):\n        x = Conv2DTranspose(\n            filters=n_filters,\n            kernel_size=(self.kernel_size, self.kernel_size),\n            strides=(stride, stride),\n            padding=\"same\",\n        )(input_layer)\n        return x\n\n    def pool_and_drop(self, input_layer, dropout_rate=0.1, pool=2):\n        x = MaxPooling2D(pool_size=(pool, pool))(input_layer)\n        x = Dropout(rate=dropout_rate)(x)\n        return x\n\n    def generate_input_layers(self):\n        inputs = []\n        for _ in range(self.num_inputs):\n            inputs.append(Input((self.input_height, self.input_width, self.input_features)))\n        x = concatenate(inputs)\n        return inputs, x\n\n    def build_model(self):\n\n        # Initialize the Input\n        input_layer = Input(self.input_size)\n\n        conv2d_layers = []\n        pool_layers = []\n        for i in range(self.depth):\n            if len(conv2d_layers) == 0:\n                x = self.double_conv_2d(input_layer, self.filter_size)\n                conv2d_layers.append(x)\n            else:\n                x = self.double_conv_2d(pool_layers[-1], self.filter_size * (2 ** i))\n                conv2d_layers.append(x)\n\n            x = self.pool_and_drop(conv2d_layers[-1])\n            pool_layers.append(x)\n\n        mid = self.double_conv_2d(pool_layers[-1], self.filter_size * (2 ** self.depth))\n\n        deconv_layers = []\n        for i in range(self.depth - 1, -1, -1):\n            if len(deconv_layers) == 0:\n                x = self.deconv_2d(mid, self.filter_size * (2 ** i))\n                deconv_layers.append(x)\n                x = concatenate([conv2d_layers[i], deconv_layers[-1]])\n                x = self.double_conv_2d(x, self.filter_size * (2 ** i))\n                conv2d_layers.append(x)\n\n            else:\n                x = self.deconv_2d(conv2d_layers[-1], self.filter_size * (2 ** i))\n                deconv_layers.append(x)\n                x = concatenate([conv2d_layers[i], deconv_layers[-1]])\n                x = self.double_conv_2d(x, self.filter_size * (2 ** i))\n\n                conv2d_layers.append(x)\n\n        \n        outputs = self.single_conv_2d(conv2d_layers[-1], self.num_outputs * self.output_features)\n        \n        \n        outputs = Dense(256)(outputs)\n        outputs = Dense(32)(outputs)\n#         outputs = Dense(64)(outputs)\n        outputs = keras.layers.GlobalAveragePooling2D()(outputs)\n        outputs = Flatten()(outputs)\n        classes=[]\n        for i in range(self.depth):\n            x = Conv2D(32,(3,3),padding='same')(conv2d_layers[i])\n            x = Flatten()(x)\n            x = Dense(8)(x)\n            print(x)\n            classes.append(x)\n        x = concatenate(classes)\n        outputs = concatenate([Dense(48)(outputs),x])\n        outputs = Dense(32)(outputs)\n        \n        \n        \n        \n# concatenate([conv2d_layers[i], deconv_layers[-1]])\n        \n        ppoi = Dense(1, activation='sigmoid', name='pe_present_on_image')(outputs)\n        rlrg1 = Dense(1, activation='sigmoid', name='rv_lv_ratio_gte_1')(outputs)\n        rlrl1 = Dense(1, activation='sigmoid', name='rv_lv_ratio_lt_1')(outputs) \n        lspe = Dense(1, activation='sigmoid', name='leftsided_pe')(outputs)\n        cpe = Dense(1, activation='sigmoid', name='chronic_pe')(outputs)\n        rspe = Dense(1, activation='sigmoid', name='rightsided_pe')(outputs)\n        aacpe = Dense(1, activation='sigmoid', name='acute_and_chronic_pe')(outputs)\n        cnpe = Dense(1, activation='sigmoid', name='central_pe')(outputs)\n        indt = Dense(1, activation='sigmoid', name='indeterminate')(outputs)\n\n        model = Model(input_layer, outputs={'pe_present_on_image':ppoi,\n                                      'rv_lv_ratio_gte_1':rlrg1,\n                                      'rv_lv_ratio_lt_1':rlrl1,\n                                      'leftsided_pe':lspe,\n                                      'chronic_pe':cpe,\n                                      'rightsided_pe':rspe,\n                                      'acute_and_chronic_pe':aacpe,\n                                      'central_pe':cnpe,\n                                      'indeterminate':indt})\n\n        plot_model(model, to_file='model.png')\n\n        if self.logging:\n            print(model.summary())\n        return model\n\nmodel = UNet().build_model()\n\nopt = keras.optimizers.Adam(lr=0.0001)\n\nmodel.compile(optimizer=opt,\n              loss='binary_crossentropy',\n              metrics=['accuracy','mse','mae'])\n\n# model.summary()\nmodel.save('multi_unet_1.h5')\ndel model\nK.clear_session()\ngc.collect()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# import wandb\n\n# # Initialize a new run\n# wandb.init(anonymous='allow', project=\"rsna-pe-detection\", name=\"UNet  Deep\",tags=['lr=0.0001','Global Average Pool'])","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"def convert_to_rgb(array):\n    bin_size = 512 // 128\n    array = array.reshape((128, bin_size, \n                                   128, bin_size, 1)).max(3).max(1)\n    array = array.reshape((128, 128, 1))\n    return np.stack([array, array, array], axis=2).reshape((128, 128, 3))\n    \ndef custom_dcom_image_generator(batch_size, dataset, test=False, debug=False):\n    \n    fnames = dataset[['StudyInstanceUID', 'SeriesInstanceUID', 'SOPInstanceUID']]\n    \n    if not test:\n        Y = dataset[['pe_present_on_image', 'rv_lv_ratio_gte_1', 'rv_lv_ratio_lt_1', 'leftsided_pe',\n                     'chronic_pe', 'rightsided_pe', 'acute_and_chronic_pe', 'central_pe', 'indeterminate'\n                    ]]\n        prefix = 'input/rsna-str-pulmonary-embolism-detection/train'\n        \n    else:\n        prefix = 'input/rsna-str-pulmonary-embolism-detection/test'\n    \n    X = []\n    batch = 0\n    for st, sr, so in fnames.values:\n        if debug:\n            print(f\"Current file: ../{prefix}/{st}/{sr}/{so}.dcm\")\n\n        dicom = get_img(f\"../{prefix}/{st}/{sr}/{so}.dcm\")\n        image = convert_to_rgb(dicom)\n        X.append(image)\n        \n        del st, sr, so\n        \n        if len(X) == batch_size:\n            if test:\n                yield np.array(X)\n                del X\n            else:\n                yield np.array(X), Y[batch*batch_size:(batch+1)*batch_size].values\n                del X\n                \n            gc.collect()\n            X = []\n            batch += 1\n        \n    if test:\n        yield np.array(X)\n    else:\n        yield np.array(X), Y[batch*batch_size:(batch+1)*batch_size].values\n        del Y\n    del X\n    gc.collect()\n    return","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"# !wget https://github.com/aniketbiprojit/cdn/raw/master/dense121_3.h5 './pe_detection_model.h5'","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"history = {}\nstart = time.time()\ndebug = 0\nbatch_size = 1000 \ntrain_size = int(batch_size*0.8)\n\nmax_train_time = 3600 * 4 #hours to seconds of training\n# from wandb.keras import WandbCallback\n\ncheckpoint = [MC(filepath='../working/multi_unet_1.h5', monitor='val_loss', save_best_only=True, verbose=1)]\n#Train loop\n\nfor n, (x, y) in enumerate(custom_dcom_image_generator(batch_size, train.sample(frac=1), False, debug)):\n\n    if len(x) < 10: #Tries to filter out empty or short data\n        break\n\n#     clear_output(wait=True)\n    print(\"Training batch: %i - %i\" %(batch_size*n, batch_size*(n+1)))\n\n    model = load_model('./multi_unet_1.h5')\n    hist = model.fit(\n        x[:train_size], #Y values are in a dict as there's more than one target for training output\n        {'pe_present_on_image':y[:train_size, 0],\n         'rv_lv_ratio_gte_1':y[:train_size, 1],\n         'rv_lv_ratio_lt_1':y[:train_size, 2],\n         'leftsided_pe':y[:train_size, 3],\n         'chronic_pe':y[:train_size, 4],\n         'rightsided_pe':y[:train_size, 5],\n         'acute_and_chronic_pe':y[:train_size, 6],\n         'central_pe':y[:train_size, 7],\n         'indeterminate':y[:train_size, 8]},\n\n        callbacks = checkpoint,\n\n        validation_split=0.2,\n        epochs=3,\n        batch_size=8,\n        verbose=debug\n    )\n\n    print(\"Metrics for batch validation:\")\n    model.evaluate(x[train_size:],\n                   {'pe_present_on_image':y[train_size:, 0],\n                    'rv_lv_ratio_gte_1':y[train_size:, 1],\n                    'rv_lv_ratio_lt_1':y[train_size:, 2],\n                    'leftsided_pe':y[train_size:, 3],\n                    'chronic_pe':y[train_size:, 4],\n                    'rightsided_pe':y[train_size:, 5],\n                    'acute_and_chronic_pe':y[train_size:, 6],\n                    'central_pe':y[train_size:, 7],\n                    'indeterminate':y[train_size:, 8]\n                   }\n                  )\n\n    try:\n        for key in hist.history.keys():\n            history[key] = np.concatenate([history[key], hist.history[key]], axis=0)\n    except:\n        for key in hist.history.keys():\n            history[key] = hist.history[key]\n\n    #To make sure that our model don't train overtime\n    if time.time() - start >= max_train_time:\n        print(\"Time's up!\")\n        break\n\n    model.save('multi_unet_1.h5')\n    del model, x, y, hist\n    K.clear_session()\n    gc.collect()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"print('ok')","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"for key in history.keys():\n    if key.startswith('val'):\n        continue\n    else:\n        epoch = range(len(history[key]))\n        plt.plot(epoch, history[key]) #X=epoch, Y=value\n        plt.plot(epoch, history['val_'+key])\n        plt.title(key)\n        if 'accuracy' in key:\n            plt.axis([0, len(history[key]), -0.1, 1.1]) #Xmin, Xmax, Ymin, Ymax\n        plt.legend(['train', 'validation'], loc='upper right')\n        plt.show()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"predictions = {}\nstopper = 3600 * 4 #4 hours limit for prediction\npred_start_time = time.time()\n\np, c = time.time(), time.time()\nbatch_size = 500\n    \nl = 0\nn = test.shape[0]\n\nfor x in custom_dcom_image_generator(batch_size, test, True, False):\n    clear_output(wait=True)\n    model = load_model(\"../working/multi_unet_1.h5\")\n    preds = model.predict(x, batch_size=8, verbose=1)\n    \n    try:\n        for key in preds.keys():\n            predictions[key] += preds[key].flatten().tolist()\n            \n    except Exception as e:\n        print(e)\n        for key in preds.keys():\n            predictions[key] = preds[key].flatten().tolist()\n            \n    l = (l+batch_size)%n\n    print('Total predicted:', len(predictions['indeterminate']),'/', n)\n    p, c = c, time.time()\n    print(\"One batch time: %.2f seconds\" %(c-p))\n    print(\"ETA: %.2f\" %((n-l)*(c-p)/batch_size))\n    \n    if c - pred_start_time >= stopper:\n        print(\"Time's up!\")\n        break\n    \n    del model\n    K.clear_session()\n    \n    del x, preds\n    gc.collect()","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"for key in predictions.keys():\n    print(key, np.array(predictions[key]).shape)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"test_ids = []\nfor v in test.StudyInstanceUID:\n    if v not in test_ids:\n        test_ids.append(v)\n        \ntest_preds = test.copy()\ntest_preds = pd.concat([test_preds, pd.DataFrame(predictions)], axis=1)\ntest_preds.to_csv('test_predictions.csv', index=False)\ntest_preds","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"from scipy.special import softmax\n\nlabel_agg = {key:[] for key in \n             ['id', 'negative_exam_for_pe', 'rv_lv_ratio_gte_1',\n              'rv_lv_ratio_lt_1', 'leftsided_pe', 'chronic_pe',\n              'rightsided_pe', 'acute_and_chronic_pe',\n              'central_pe', 'indeterminate']\n            }\n\nfor uid in test_ids:\n    temp = test_preds.loc[test_preds.StudyInstanceUID ==uid]\n    label_agg['id'].append(uid)\n    \n    n = temp.shape[0]\n    #Check for any image level presence of PE of high confidence\n    positive = any(temp.pe_present_on_image >= 0.5) #50% threshhold\n    \n    #Only one from positive, negative and indeterminate should have value>0.5\n    #per exam\n    if positive: \n        label_agg['indeterminate'].append(temp.indeterminate.min()/2)\n        label_agg['negative_exam_for_pe'].append(0)\n    else:\n        if any(temp.indeterminate >= 0.5):\n            label_agg['indeterminate'].append(temp.indeterminate.max())\n            label_agg['negative_exam_for_pe'].append(1)\n        else:\n            label_agg['indeterminate'].append(temp.indeterminate.min()/2)\n            label_agg['negative_exam_for_pe'].append(1)\n    \n    #I decided that the total ratio should be equal to 1, so I used softmax\n    #We modify the weights by multiplying the bigger by 2 and dividing the smaller by 2\n    a, b = temp[['rv_lv_ratio_gte_1', 'rv_lv_ratio_lt_1']].mean().values\n    if a > b:\n        a, b = a*2, b/2\n    elif a < b:\n        a, b = a/2, b*2\n    a, b = softmax([a, b])\n    if positive:\n        label_agg['rv_lv_ratio_gte_1'].append(a)\n        label_agg['rv_lv_ratio_lt_1'].append(b)\n    else:\n        label_agg['rv_lv_ratio_gte_1'].append(a/2)\n        label_agg['rv_lv_ratio_lt_1'].append(b/2)\n    \n    #Next is for Chronic (C), Acute-Chronic (AC) and Acute (A) PE\n    #We need to see if we got a high confidence value from either C or AC\n    #If there is, we add it to a 50% based score for high confidence\n    #and half weight for low confidence score\n    if any(temp['acute_and_chronic_pe'] > 0.5): #50% confidence level\n        label_agg['acute_and_chronic_pe'].append(0.5 + temp['acute_and_chronic_pe'].mean()/2)\n        label_agg['chronic_pe'].append(temp['chronic_pe'].mean()/2)\n        \n    elif any(temp['chronic_pe'] > 0.5):\n        label_agg['acute_and_chronic_pe'].append(temp['acute_and_chronic_pe'].mean()/2)\n        label_agg['chronic_pe'].append(0.5 + temp['chronic_pe'].mean()/2)\n        \n    else: #Else, we set both to half values, as we declare the A as the value\n        label_agg['acute_and_chronic_pe'].append(temp['acute_and_chronic_pe'].mean()/2)\n        label_agg['chronic_pe'].append(temp['chronic_pe'].mean()/2)\n    \n    #for right, left, central, we use the same metric above\n    for key in ['leftsided_pe', 'rightsided_pe', 'central_pe']:\n        if positive:\n            label_agg[key].append(0.5 + temp[key].mean()/2)\n        else:\n            label_agg[key].append(temp[key].mean()/2)\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"uid = []\nlabels = []\ndf = pd.DataFrame(label_agg)\nfor key in ['negative_exam_for_pe', 'rv_lv_ratio_gte_1', 'rv_lv_ratio_lt_1', 'leftsided_pe', 'chronic_pe',\n            'rightsided_pe', 'acute_and_chronic_pe', 'central_pe', 'indeterminate']:\n    for i in df.id:\n        uid.append('_'.join([i, key]))\n        labels.append(df.loc[df.id==i][key].values[0])\ndel df\ngc.collect()\n\nuid += test_preds.SOPInstanceUID.tolist()\nlabels += test_preds['pe_present_on_image'].tolist()\n\nsub = pd.DataFrame({\"id\":uid, 'label':labels})\nsub\n","execution_count":null,"outputs":[]},{"metadata":{"trusted":true},"cell_type":"code","source":"sub.fillna(0.2, inplace=True)\nsub.to_csv('submission.csv', index=False)","execution_count":null,"outputs":[]}],"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"pygments_lexer":"ipython3","nbconvert_exporter":"python","version":"3.6.4","file_extension":".py","codemirror_mode":{"name":"ipython","version":3},"name":"python","mimetype":"text/x-python"}},"nbformat":4,"nbformat_minor":4}