Hướng dẫn triển khai hệ thống lưu trữ phân tán Hadoop HDFS 3.2
Hadoop 3.2 mang lại nhiều cải tiến về hiệu suất và tính năng so với các phiên bản tiền nhiệm. Trong bài viết này, chúng ta sẽ tập trung vào việc thiết lập các thành phần cốt lõi của HDFS bao gồm NameNode, DataNode và SecondaryNameNode để xây dựng một cụm lưu trữ dữ liệu lớn (Big Data storage).
1. Chuẩn bị môi trường và giải nén gói cài đặt
Trư ...
Đăng vào ngày 1 tháng 10 lúc 10:32
Cài đặt Hadoop 2.7.2 trên macOS với Homebrew
Môi trường cài đặt:
Máy tính: MacBook Air M2 2022
Ảo hóa: VMware Fusion 13
Hệ điều hành: Ubuntu 22.04
Bước 1: Cập nhật Homebrew
Đầu tiên, cập nhật Homebrew để đảm bảo phiên bản mới nhất:
brew update
Bước 2: Cài đặt JDK 8 (Temurin)
Sử dụng Homebrew để cài đặt OpenJDK 8 từ Adoptium:
brew install --cask temurin@8
Kiểm tra phiên bản Java đã cài ...
Đăng vào ngày 28 tháng 9 lúc 02:48
Triển khai HBase phân tán tích hợp với Hadoop và ZooKeeper
1. Tải và giải nén bộ cài đặt
Trước khi tiến hành, đảm bảo cụm ZooKeeper đã hoạt động ổn định. Thực hiện tải mã nguồn HBase và giải nén vào thư mục làm việc:
mkdir -p /data/bigdata && cd /data/bigdata
curl -O https://archive.apache.org/dist/hbase/2.1.10/hbase-2.1.10-bin.tar.gz
tar -xzf hbase-2.1.10-bin.tar.gz -C /data/bigdata/
mv hbase- ...
Đăng vào ngày 24 tháng 8 lúc 05:09
Kiến thức cốt lõi về hệ sinh thái dữ liệu lớn Big Data
1. Tổng quan về Big Data
Big Data được định nghĩa bởi các đặc trưng cơ bản giúp phân biệt với các hệ thống xử lý dữ liệu truyền thống:
Khối lượng (Volume): Sự bùng nổ dữ liệu từ các nguồn phi cấu trúc khiến quy mô lưu trữ vượt xa ngưỡng Terabyte, tiến dần đến Petabyte (PB) và Zettabyte (ZB).
Đa dạng (Variety): Dữ liệu không chỉ dừng l ...
Đăng vào ngày 5 tháng 8 lúc 04:38
Cài đặt và Triển khai HBase 2.0
Hướng dẫn này mô tả quy trình cài đặt và triển khai HBase phiên bản 2.0. Trước khi bắt đầu, hãy đảm bảo rằng bạn đã cài đặt thành công ZooKeeper, Kafka và Hadoop.
Kiến trúc hệ thống
Hệ thống được cấu hình trên ba máy chủ: hadoop101, hadoop102 và hadoop103. Cụ thể:
HDFS: NameNode trên hadoop101, SecondaryNameNode trên hadoop103. DataNode đ ...
Đăng vào ngày 24 tháng 7 lúc 22:31
Cài đặt và triển khai ba chế độ chạy Flink 1.6 cùng ứng dụng WordCount
Giới thiệu
Ba phương thức vận hành Flink: Chế độ cục bộ (Local), Chế độ độc lập (Standalone), Chế độ tích hợp với Yarn. Sau khi hoàn tất cài đặt, thực hiện WordCount bằng cả Scala và Java.
Môi trường
Phiên bản: Flink 1.6.2
Môi trường cụm: Hadoop2.6
Công cụ phát triển: IntelliJ IDEA
I. Chế độ cục bộ (Local)
Giải nén: tar -zxvf flink-1.6.2-bin- ...
Đăng vào ngày 12 tháng 7 lúc 08:57
Hadoop Pseudo-Distributed Environment Setup Guide (Linux)
1. Preparation
1.1 Configure Hostname and Hosts File
# 127.0.0.1 localhost localhost.localdomain localhost4 localhost4.localdomain4
# ::1 localhost localhost.localdomain localhost6 localhost6.localdomain6
192.168.241.128 nodeQLy
1.2 SSH Key Configuration
[root ...
Đăng vào ngày 10 tháng 7 lúc 14:42
Kết nối Kudu với Impala
Apache Kudu và Impala hỗ trợ tích hợp liền mạch để thực hiện các thao tác đọc/ghi dữ liệu bằng cú pháp SQL trên bảng Kudu thông qua công cụ truy vấn phân tán của Impala;
Cài đặt Impala
Lập kế hoạch triển khai
1: Dịch vụ catalog của Impala sẽ đồng bộ hóa thay đổi metadata sang các node trong cụm
2: Statestore của Impala giám sát trạng thái hoạt ...
Đăng vào ngày 7 tháng 7 lúc 07:43
Hướng dẫn cài đặt và kiểm thử dịch vụ Hive LLAP
Hướng dẫn cài đặt và kiểm thử dịch vụ Hive LLAP
1.Tổng quan
Từ phiên bản Hive 2.0, Apache đã giới thiệu LLAP (Live Long And Process), và phiên bản 2.1 đã có những cải tiến đáng kể. Có thể nói rằng Hive đã bước vào kỷ nguyên tính toán trong bộ nhớ,
Theo kết quả thử nghiệm của Hortonworks, hiệu suất của llap kết hợp với tez nhanh hơn 25 lần so ...
Đăng vào ngày 7 tháng 7 lúc 06:52
Các nguyên nhân và giải pháp cho hiện tượng dữ liệu nghiêng trong MapReduce
Giới thiệu về MapReduce
MapReduce là một mô hình, khung xử lý và nền tảng tính toán song song dành cho dữ liệu lớn, bao gồm ba ý nghĩa sau:
MapReduce là một nền tảng tính toán hiệu suất cao dựa trên cụm (Cluster Infrastructure). Nó cho phép sử dụng các máy chủ thương mại thông thường để tạo thành cụm phân tán và song song với hàng chục, trăm ...
Đăng vào ngày 18 tháng 6 lúc 04:50