Pemrosesan Data Terdistribusi: MapReduce, Apache Spark
Membahas pemrosesan data secara terdistribusi menggunakan konsep MapReduce dan Apache Spark untuk menangani data berskala besar.
Tujuan Pembelajaran
Target pembelajaran utama pada pertemuan ini dirangkum secara singkat agar mudah dipindai dan diikuti.
- Memahami prinsip pemrosesan data terdistribusi.
- Menjelaskan fungsi MapReduce dan Apache Spark.
Koleksi materi pertemuan
Pilih materi yang ingin dibuka. Setiap kartu disusun agar lebih mudah dipindai, lebih hidup, dan tidak terasa monoton.
Analisis Batch dengan Hadoop MapReduce dan Arsitektur YARN
Materi ini menjelaskan konsep analisis batch pada big data menggunakan Hadoop dan model pemrograman MapReduce (fase Map dan Reduce), dilanjutkan dengan arsitektur Hadoop YARN generasi kedua beserta komponen utamanya (Resource Manager, Application Master, Node Manager, dan Container), alur interaksi eksekusi tugas, serta dua algoritma scheduler Hadoop yaitu Fair Scheduler dan Capacity Scheduler, ditutup dengan contoh implementasi MapReduce untuk analisis batch data sensor menggunakan Python.
Analisis Batch dengan MapReduce pada N-Gram Dataset dan Pengenalan Pig Latin
Materi ini membahas contoh penerapan MapReduce menggunakan pustaka MRJob Python untuk menganalisis Google N-Gram Dataset (menghitung bigram terpopuler) dan menemukan kata-N teratas dalam file teks, kemudian dilanjutkan dengan pengenalan Pig sebagai bahasa pemrosesan data tingkat tinggi (Pig Latin) beserta tipe data (tuple, bag, map) dan operator-operator utamanya seperti LOAD, FOREACH, FILTER, GROUP, UNION, JOIN, STORE, dan operator debugging (DUMP, DESCRIBE, EXPLAIN, ILLUSTRATE).
Studi Kasus: Analisis Batch pada Artikel Berita Menggunakan MapReduce dan Pig
Materi ini memaparkan studi kasus pembangunan sistem analisis batch untuk artikel berita dari berbagai sumber RSS feed, mencakup pengumpulan data dengan Python dan feedparser, perhitungan skor sentimen menggunakan leksikon AFINN, penyerapan data ke HDFS menggunakan Apache Flume, serta pemanfaatan MapReduce dan Pig untuk menemukan frasa dan kata paling umum dalam berita, dengan hasil akhir ditampilkan melalui aplikasi web Flask.
Apache Oozie: Penjadwalan Alur Kerja MapReduce dan Pengenalan Apache Spark
Materi ini menjelaskan Apache Oozie sebagai sistem scheduler alur kerja Hadoop yang menyusun rangkaian tindakan (seperti pekerjaan MapReduce) dalam bentuk Directed Acyclic Graph (DAG) menggunakan bahasa hPDL, lengkap dengan contoh alur kerja untuk menghitung kode status/kesalahan dari data log beserta spesifikasi XML dan file properti pekerjaannya, dilanjutkan dengan pengenalan Apache Spark sebagai kerangka kerja komputasi cluster in-memory beserta komponen utamanya (Spark Core, Spark Streaming, Spark SQL, MLlib, GraphX) dan arsitektur cluster Spark.
Apache Spark: Pembuatan RDD, Transformasi, Tindakan, dan Pengenalan Apache Solr
Materi ini membahas cara membuat Resilient Distributed Dataset (RDD) di Apache Spark beserta berbagai jenis transformasi (Map, Filter, reduceByKey, flatMap, Sample, Union, Intersection, Join) dan tindakan (Reduce, Collect, First, Count, Take, takeSample, saveAsTextFile, saveAsSequenceFile) dengan contoh kode Python, ditutup dengan program penghitungan jumlah kata menggunakan Spark serta pengenalan awal Apache Solr sebagai kerangka kerja pencarian data berbasis Apache Lucene beserta komponen-komponennya.
Apache Solr: Fitur Pencarian, Pengindeksan, dan Kueri Data serta Ringkasan Analisis Batch
Materi ini menjelaskan berbagai fitur utama Apache Solr seperti faceting, auto-suggest, pemeriksaan ejaan, highlighting, grouping, spatial searching, dan near real-time search, dilengkapi contoh praktis pengindeksan dokumen JSON, kueri data melalui dashboard admin dan REST API, serta operasi faceting dan range faceting, dan diakhiri dengan ringkasan keseluruhan bab mengenai alat-alat pemrosesan batch big data (Hadoop-MapReduce, Pig, Oozie, Spark, dan Solr).