Articles
Vol. 10 No. 7 (2025): Kohesi: Jurnal Sains dan Teknologi, ISSN 3025-1311
PENERAPAN BIG DATA LIFECYCLE UNTUK ANALISIS TREN GENRE DAN RATING FILM MENGGUNAKAN HADOOP ECOSYSTEM DI AZURE
UIN Sultan Maulana Hasanuddin Banten
UIN Sultan Maulana Hasanuddin Banten
UIN Sultan Maulana Hasanuddin Banten
UIN Sultan Maulana Hasanuddin Banten
UIN Sultan Maulana Hasanuddin Banten
-
Submitted
-
December 26, 2025
-
Published
-
2025-12-27
Abstract
Pertumbuhan industri film digital pada platform seperti IMDb telah menimbulkan tantangan kelebihan informasi bagi pengguna dalam memilih konten. Analisis berbasis popularitas yang lazim diterapkan sering mengabaikan preferensi individu dan kurang efektif bagi pengguna baru tanpa riwayat interaksi, sehingga diperlukan pendekatan analisis yang lebih tepat sasaran. Penelitian ini menerapkan kerangka Big Data Lifecycle, mencakup tahap pengumpulan, pembersihan, integrasi, analisis, dan representasi data. Dataset sekunder dari IMDb berukuran 8,83 GB diolah menggunakan Hadoop Ecosystem pada platform Azure, dengan Apache Spark untuk pemrosesan paralel dan Power BI untuk visualisasi. Proses dimulai dari pengunduhan data ke Azure Blob Storage, diikuti pembersihan nilai kosong dan penyaringan entri film, integrasi berdasarkan kunci tconst, analisis agregat dengan fungsi explode untuk genre, hingga pembuatan dashboard interaktif. Hasil analisis menunjukkan tren produksi film mencapai puncak pada dekade 2000-an dengan sekitar 20.000 entri, diikuti penurunan tajam pasca-2010. Genre Drama mendominasi dengan lebih dari 20.000 film dan akumulasi rating tertinggi, sementara rating rata-rata stabil antara 6 hingga 8 sepanjang periode. Hubungan durasi film dengan rating memperlihatkan pola positif lemah, dengan film panjang cenderung dinilai lebih tinggi pada genre tertentu. Pendekatan ini membuktikan kemampuan Big Data Lifecycle dalam menghasilkan wawasan empiris mengenai tren industri film, yang dapat mendukung pengurangan kelebihan informasi pada platform digital tanpa ketergantungan data interaksi pengguna.
References
- Armbrust, M., Das, T., Sun, L., Yavuz, B., Zhu, S., Murthy, M., Torres, J., Hovell, H. Van, Ionescu, A., Łuszczak, A., Switakowski, M., Szafra, M., Li, X., Ueshin, T., Mokhtar, M., Boncz, P., Ghodsi, A., Paranjpye, S., Senster, P., … Zaharia, M. (2020). Delta Lake : High-Performance ACID Table Storage over Cloud Object Stores. Proceedings of the VLDB Endowment, 13(12). https://doi.org/doi.org/10.14778/3415478.3415560
- Awan, M. J., Khan, R. A., Nobanee, H., & Yasin, A. (2021). A Recommendation Engine for Predicting Movie Ratings Using a Big Data Approach. Electronics 2021, 10(10). https://doi.org/https://doi.org/10.3390/electronics10101215
- Gupta, S., Adhikari, U., Varshney, S., & Choudhury, T. (2025). Computational Analysis of Genre Effects on Movie Ratings Using MLP Algorithms. Journal of Computer Science, 21(4), 905–917. https://doi.org/10.3844/jcssp.2025.905.917
- Jadiga, S. (2024). Big Data Engineering Using Hadoop and Cloud (GCP/AZURE) Technologies. International Journal of Computer Trends and Technology, 72(8), 60–69. https://doi.org/https://doi.org/10.14445/22312803/ IJCTT-V72I8P109
- Moeslim, A. G. S. (2025). Big Data Analysis of Indonesian Health Q & A for Identifying Dominant Disease Topics and Mitigation Information Patterns Using the Random Forest Algorithm Powered by Apache Spark on Google Colab. Data Science Indonesia. https://www.researchgate.net/publication/393650778_Big_Data_Analysis_of_Indonesian_Health_QA_for_Identifying_Dominant_Disease_Topics_and_Mitigation_Information_Patterns_Using_the_Random_Forest_Algorithm_Powered_by_Apache_Spark_on_Google_Colab
- Oussous, A., Benjelloun, F., Ait, A., & Belfkih, S. (2018). Big Data technologies : A survey. Journal of King Saud University - Computer and Information Sciences, 30(4), 431–448. https://doi.org/10.1016/j.jksuci.2017.06.001
- Prabaswara, I. R., & Saputra, R. (2020). Implementasi Hadoop Dan Spark Untuk Analisis Penyebaran Demam Berdarah Dengue Berdasarkan Data Twitter. IT Journal Research and Development (ITJRD), 4(2), 164–171. https://doi.org/10.25299/itjrd.2020
- Sabrina, S. S., Aswarulloh, H., & Shiddieq, D. F. (2024). VISUALISASI DATA PENYEBAB KEMATIAN DI INDONESIA RENTANG TAHUN 2000-2022 DENGAN POWER BI. JITET (Jurnal Informatika Dan Teknik Elektro Terapan), 12(2). https://doi.org/http://dx.doi.org/10.23960/jitet.v12i2.4071
- Zaharia, M., Chowdhury, M., Das, T., Dave, A., Ma, J., Mccauley, M., Franklin, M. J., Shenker, S., & Stoica, I. (n.d.). Resilient Distributed Datasets : A Fault-Tolerant Abstraction for In-Memory Cluster Computing. NSDI’12: Proceedings of the 9th USENIX Conference on Networked Systems Design and Implementation. https://www.usenix.org/system/files/conference/nsdi12/nsdi12-final138.pdf
- Zhu, L., & Zhuang, L. (2025). A higher-performance big data-based movie recommendation system. Nonlinear Engineering, 14(1). https://doi.org/10.1515/nleng-2025-0092