PERTEMUAN 9 INF040 Semester 6

Pemrosesan Data Terdistribusi: MapReduce, Apache Spark

Membahas pemrosesan data secara terdistribusi menggunakan konsep MapReduce dan Apache Spark untuk menangani data berskala besar.

Daftar Pertemuan
9 Pertemuan
6 Materi
12 Pertemuan
Pengantar Big Data Buka materi ↗ · Lihat Pertemuan →

Tujuan Pembelajaran

Target pembelajaran utama pada pertemuan ini dirangkum secara singkat agar mudah dipindai dan diikuti.

  • Memahami prinsip pemrosesan data terdistribusi.
  • Menjelaskan fungsi MapReduce dan Apache Spark.

Koleksi materi pertemuan

Pilih materi yang ingin dibuka. Setiap kartu disusun agar lebih mudah dipindai, lebih hidup, dan tidak terasa monoton.

01 MODULE

Analisis Batch dengan Hadoop MapReduce dan Arsitektur YARN

Materi ini menjelaskan konsep analisis batch pada big data menggunakan Hadoop dan model pemrograman MapReduce (fase Map dan Reduce), dilanjutkan dengan arsitektur Hadoop YARN generasi kedua beserta komponen utamanya (Resource Manager, Application Master, Node Manager, dan Container), alur interaksi eksekusi tugas, serta dua algoritma scheduler Hadoop yaitu Fair Scheduler dan Capacity Scheduler, ditutup dengan contoh implementasi MapReduce untuk analisis batch data sensor menggunakan Python.

02 MODULE

Analisis Batch dengan MapReduce pada N-Gram Dataset dan Pengenalan Pig Latin

Materi ini membahas contoh penerapan MapReduce menggunakan pustaka MRJob Python untuk menganalisis Google N-Gram Dataset (menghitung bigram terpopuler) dan menemukan kata-N teratas dalam file teks, kemudian dilanjutkan dengan pengenalan Pig sebagai bahasa pemrosesan data tingkat tinggi (Pig Latin) beserta tipe data (tuple, bag, map) dan operator-operator utamanya seperti LOAD, FOREACH, FILTER, GROUP, UNION, JOIN, STORE, dan operator debugging (DUMP, DESCRIBE, EXPLAIN, ILLUSTRATE).

03 MODULE

Studi Kasus: Analisis Batch pada Artikel Berita Menggunakan MapReduce dan Pig

Materi ini memaparkan studi kasus pembangunan sistem analisis batch untuk artikel berita dari berbagai sumber RSS feed, mencakup pengumpulan data dengan Python dan feedparser, perhitungan skor sentimen menggunakan leksikon AFINN, penyerapan data ke HDFS menggunakan Apache Flume, serta pemanfaatan MapReduce dan Pig untuk menemukan frasa dan kata paling umum dalam berita, dengan hasil akhir ditampilkan melalui aplikasi web Flask.

04 MODULE

Apache Oozie: Penjadwalan Alur Kerja MapReduce dan Pengenalan Apache Spark

Materi ini menjelaskan Apache Oozie sebagai sistem scheduler alur kerja Hadoop yang menyusun rangkaian tindakan (seperti pekerjaan MapReduce) dalam bentuk Directed Acyclic Graph (DAG) menggunakan bahasa hPDL, lengkap dengan contoh alur kerja untuk menghitung kode status/kesalahan dari data log beserta spesifikasi XML dan file properti pekerjaannya, dilanjutkan dengan pengenalan Apache Spark sebagai kerangka kerja komputasi cluster in-memory beserta komponen utamanya (Spark Core, Spark Streaming, Spark SQL, MLlib, GraphX) dan arsitektur cluster Spark.

05 MODULE

Apache Spark: Pembuatan RDD, Transformasi, Tindakan, dan Pengenalan Apache Solr

Materi ini membahas cara membuat Resilient Distributed Dataset (RDD) di Apache Spark beserta berbagai jenis transformasi (Map, Filter, reduceByKey, flatMap, Sample, Union, Intersection, Join) dan tindakan (Reduce, Collect, First, Count, Take, takeSample, saveAsTextFile, saveAsSequenceFile) dengan contoh kode Python, ditutup dengan program penghitungan jumlah kata menggunakan Spark serta pengenalan awal Apache Solr sebagai kerangka kerja pencarian data berbasis Apache Lucene beserta komponen-komponennya.

06 MODULE

Apache Solr: Fitur Pencarian, Pengindeksan, dan Kueri Data serta Ringkasan Analisis Batch

Materi ini menjelaskan berbagai fitur utama Apache Solr seperti faceting, auto-suggest, pemeriksaan ejaan, highlighting, grouping, spatial searching, dan near real-time search, dilengkapi contoh praktis pengindeksan dokumen JSON, kueri data melalui dashboard admin dan REST API, serta operasi faceting dan range faceting, dan diakhiri dengan ringkasan keseluruhan bab mengenai alat-alat pemrosesan batch big data (Hadoop-MapReduce, Pig, Oozie, Spark, dan Solr).