{"metadata":{"kernelspec":{"language":"python","display_name":"Python 3","name":"python3"},"language_info":{"name":"python","version":"3.10.13","mimetype":"text/x-python","codemirror_mode":{"name":"ipython","version":3},"pygments_lexer":"ipython3","nbconvert_exporter":"python","file_extension":".py"},"kaggle":{"accelerator":"none","dataSources":[{"sourceId":70367,"databundleVersionId":9188054,"sourceType":"competition"}],"dockerImageVersionId":30746,"isInternetEnabled":true,"language":"python","sourceType":"notebook","isGpuEnabled":false}},"nbformat_minor":4,"nbformat":4,"cells":[{"cell_type":"markdown","source":"# NeurlIPS Ariel Data Quick View","metadata":{}},{"cell_type":"code","source":"import numpy as np # linear algebra\nimport pandas as pd # data processing, CSV file I/O (e.g. pd.read_csv)\nimport os","metadata":{"_uuid":"8f2839f25d086af736a60e9eeb907d3b93b6e0e5","_cell_guid":"b1076dfc-b9ad-4769-8c92-a6c4dae69d19","execution":{"iopub.status.busy":"2024-08-10T07:41:00.930607Z","iopub.execute_input":"2024-08-10T07:41:00.930985Z","iopub.status.idle":"2024-08-10T07:41:00.938055Z","shell.execute_reply.started":"2024-08-10T07:41:00.930949Z","shell.execute_reply":"2024-08-10T07:41:00.936712Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"paths=[]\nfor dirname, _, filenames in os.walk('/kaggle/input/ariel-data-challenge-2024/train/100468857'):\n    for filename in filenames:\n        path=os.path.join(dirname, filename)\n        paths+=[path]\n\nfor i in range(len(paths)):\n    df = pd.read_parquet(paths[i])\n    print(paths[i])\n    print(len(df))\n    display(df[0:2])\n    print()\n    print()\n    print()","metadata":{"execution":{"iopub.status.busy":"2024-08-10T07:41:00.939391Z","iopub.execute_input":"2024-08-10T07:41:00.939702Z","iopub.status.idle":"2024-08-10T07:41:02.831778Z","shell.execute_reply.started":"2024-08-10T07:41:00.939676Z","shell.execute_reply":"2024-08-10T07:41:02.830715Z"},"trusted":true},"execution_count":null,"outputs":[]},{"cell_type":"code","source":"pathsA=[]#csv\npathsB=[]#parquet\nfor filename in os.listdir('/kaggle/input/ariel-data-challenge-2024'):\n    path=os.path.join('/kaggle/input/ariel-data-challenge-2024',filename)\n    if filename.endswith('.csv'):\n        pathsA+=[path]\n    elif filename.endswith('.parquet') :\n        pathsB+=[path]       \n\nfor i in range(len(pathsB)):\n    df = pd.read_parquet(pathsB[i])\n    print(pathsB[i])\n    print(len(df))\n    display(df[0:2])\n    print()\n    print()\n    print()\n\nfor i in range(len(pathsA)):\n    df = pd.read_csv(pathsA[i])\n    print(pathsA[i])\n    print(len(df))\n    display(df[0:2])\n    print()\n    print()\n    print()    \n","metadata":{"execution":{"iopub.status.busy":"2024-08-10T07:41:02.833201Z","iopub.execute_input":"2024-08-10T07:41:02.83361Z","iopub.status.idle":"2024-08-10T07:41:03.024001Z","shell.execute_reply.started":"2024-08-10T07:41:02.833574Z","shell.execute_reply":"2024-08-10T07:41:03.022823Z"},"trusted":true},"execution_count":null,"outputs":[]}]}