Kiến thức cốt lõi về hệ sinh thái dữ liệu lớn Big Data

1. Tổng quan về Big Data Big Data được định nghĩa bởi các đặc trưng cơ bản giúp phân biệt với các hệ thống xử lý dữ liệu truyền thống: Khối lượng (Volume): Sự bùng nổ dữ liệu từ các nguồn phi cấu trúc khiến quy mô lưu trữ vượt xa ngưỡng Terabyte, tiến dần đến Petabyte (PB) và Zettabyte (ZB). Đa dạng (Variety): Dữ liệu không chỉ dừng l ...

Đăng vào ngày 5 tháng 8 lúc 04:38

Quản lý siêu dữ liệu trong HDFS (FSImage, Edits, CheckPoint)

Mục lục 1 - Siêu dữ liệu của NameNode 1.1 FSImage - Bản sao lưu siêu dữ liệu 1.2 Kiểm tra tệp FSImage 1.3 Edits - Nhật ký hoạt động 1.4 Xem nội dung tệp Edits 2 - Quy trình khởi động NameNode 3 - Quá trình CheckPoint 3.1 Lý do thực hiện CheckPoint 3.2 Quy trình CheckPoint 4 - SecondaryNameNode hỗ trợ quản lý FSImage và Edits 4.1 Cấu hìn ...

Đăng vào ngày 19 tháng 7 lúc 08:57

Kiểm tra Tài nguyên và Thoát Khỏi Chế độ An toàn trong Quá trình Khởi động NameNode HDFS

Tổng quan về quá trình khởi động NameNode Quá trình khởi tạo NameNode trong Hadoop Distributed File System (HDFS) bao gồm nhiều giai đoạn quan trọng, từ việc tải siêu dữ liệu đến khởi động các dịch vụ RPC và HTTP. Một trong những phần cốt lõi của quá trình này là việc kiểm tra tài nguyên và quản lý chế độ an toàn (Safe Mode), đảm bảo tính toàn ...

Đăng vào ngày 15 tháng 7 lúc 13:08

Cài đặt Hadoop Distributed File System trên macOS với Apache Hadoop 3.2.1

Để triển khai nhanh môi trường HDFS cục bộ nhằm kiểm thử và học tập, bài viết này hướng dẫn cài đặt Hadoop 3.2.1 trên hệ điều hành macOS — không yêu cầu cấu hình cụm phân tán hay máy ảo. 1. Tải và giải nén gói cài đặt Tải bản binary của Hadoop 3.2.1 từ trang chủ: https://hadoop.apache.org/releases.html. Sau khi tải xong, giải nén vào thư mục l ...

Đăng vào ngày 16 tháng 6 lúc 08:53

Xử lý tệp tin nhỏ trong Hadoop

1. Vấn đề phát sinh HDFS không phải là giải pháp tối ưu cho việc lưu trữ các tệp tin có kích thước nhỏ. Lý do là mỗi tệp tin, dù nhỏ, cũng chiếm ít nhất một block, và thông tin metadata của mỗi block đều được lưu trong bộ nhớ của NameNode. Khi số lượng tệp tin nhỏ tăng lên, bộ nhớ NameNode sẽ bị tiêu tốn đáng kể. Dưới đây là mô phỏng một kịch b ...

Đăng vào ngày 14 tháng 6 lúc 05:19

Tổng kết Hadoop: Kiến trúc và Nguyên tắc hoạt động

Hadoop về Khái niệm Big Data Không thể xử lý dữ liệu bằng một máy tính duy nhất Trọng tâm của Big Data là mẫu = tổng thể Đặc tính Big Data Lượng lớn (Volume): Trong Big Data, kích thước của một tệp tin riêng lẻ thường từ vài chục đến vài trăm GB trở lên Tốc độ (Velocity): Phản ánh tốc độ tạo ra dữ liệu và tần suất thay đổi dữ liệu Đa dạng (V ...

Đăng vào ngày 9 tháng 6 lúc 17:58

Tại Sao Việc Xóa Bảng Nội Bộ Trong Hive Xóa Toàn Bộ Dữ Liệu, Trong Khi Bảng Ngoại Chỉ Xóa Cấu Trúc? Tại Sao Sử Dụng Bảng Ngoại Lựa Chọn Tốt Hơn?

Apache Hive là một công cụ kho dữ liệu được xây dựng trên nền tảng Hadoop, cung cấp khả năng lưu trữ và quản lý các tập dữ liệu quy mô lớn. Hive phân loại bảng thành hai loại: bảng nội bộ (Internal Table) và bảng ngoại (External Table). Sự khác biệt trong cách quản lý dữ liệu giữa hai loại bảng này là đáng kể, đặc biệt khi thực hiện thao tác xó ...

Đăng vào ngày 29 tháng 5 lúc 15:48

Tối ưu hóa hiệu năng HDFS: Hợp nhất các tệp nhỏ

1. Lý do cần hợp nhất các tệp nhỏ HDFS được thiết kế để lưu trữ hiệu quả các tệp lớn. Mỗi tệp trong HDFS đều có thông tin siêu dữ liệu riêng. Khi có quá nhiều tệp nhỏ, lượng siêu dữ liệu này sẽ tăng lên đáng kể, gây áp lực lớn lên bộ nhớ của trình quản lý HDFS. Do đó, việc hợp nhất các tệp nhỏ thành các tệp lớn hơn là một phương pháp tố ...

Đăng vào ngày 29 tháng 5 lúc 10:28

Cấu Hình Và Cài Đặt CDH Trong Chế Độ Giả Lập

Hướng dẫn dưới đây trình bày quy trình thiết lập hệ thống CDH (Cloudera Distribution Hadoop) ở chế độ phân tán giả lập (pseudo-distributed). Yêu cầu cơ bản bao gồm máy chủ đã cài đặt sẵn môi trường chạy Java và dịch vụ SSH. 1. Tải về và Giải nén Thư mục Tìm kiếm gói cài đặt tương ứng với phiên bản 2.6.0 của Hadoop từ dòng sản phẩm CDH 5.9.0. S ...

Đăng vào ngày 22 tháng 5 lúc 07:31