Triển khai HBase phân tán tích hợp với Hadoop và ZooKeeper

1. Tải và giải nén bộ cài đặt Trước khi tiến hành, đảm bảo cụm ZooKeeper đã hoạt động ổn định. Thực hiện tải mã nguồn HBase và giải nén vào thư mục làm việc: mkdir -p /data/bigdata && cd /data/bigdata curl -O https://archive.apache.org/dist/hbase/2.1.10/hbase-2.1.10-bin.tar.gz tar -xzf hbase-2.1.10-bin.tar.gz -C /data/bigdata/ mv hbase- ...

Đăng vào ngày 24 tháng 8 lúc 05:09

Kiến thức cốt lõi về hệ sinh thái dữ liệu lớn Big Data

1. Tổng quan về Big Data Big Data được định nghĩa bởi các đặc trưng cơ bản giúp phân biệt với các hệ thống xử lý dữ liệu truyền thống: Khối lượng (Volume): Sự bùng nổ dữ liệu từ các nguồn phi cấu trúc khiến quy mô lưu trữ vượt xa ngưỡng Terabyte, tiến dần đến Petabyte (PB) và Zettabyte (ZB). Đa dạng (Variety): Dữ liệu không chỉ dừng l ...

Đăng vào ngày 5 tháng 8 lúc 04:38

Tích hợp Hive với HBase để truy vấn dữ liệu qua HiveQL

Giới thiệu HBase phù hợp để lưu trữ khối lượng dữ liệu rất lớn và cung cấp truy cập ngẫu nhiên theo rowkey với độ trễ thấp. Tuy nhiên, khả năng truy vấn của HBase khá hạn chế khi cần phân tích đa chiều, lọc theo nhiều điều kiện hay thực hiện các phép tính tổng hợp. Hive mang đến giao diện HiveQL gần với SQL, cho phép chạy các tác vụ phân tích b ...

Đăng vào ngày 1 tháng 8 lúc 08:46

Cài đặt và Triển khai HBase 2.0

Hướng dẫn này mô tả quy trình cài đặt và triển khai HBase phiên bản 2.0. Trước khi bắt đầu, hãy đảm bảo rằng bạn đã cài đặt thành công ZooKeeper, Kafka và Hadoop. Kiến trúc hệ thống Hệ thống được cấu hình trên ba máy chủ: hadoop101, hadoop102 và hadoop103. Cụ thể: HDFS: NameNode trên hadoop101, SecondaryNameNode trên hadoop103. DataNode đ ...

Đăng vào ngày 24 tháng 7 lúc 22:31

Hadoop Pseudo-Distributed Environment Setup Guide (Linux)

1. Preparation 1.1 Configure Hostname and Hosts File # 127.0.0.1 localhost localhost.localdomain localhost4 localhost4.localdomain4 # ::1 localhost localhost.localdomain localhost6 localhost6.localdomain6 192.168.241.128 nodeQLy 1.2 SSH Key Configuration [root ...

Đăng vào ngày 10 tháng 7 lúc 14:42

Spark Streaming với Kafka 1.0.1: Quản lý Offset trực tiếp vào HBase

Trong kiến trúc xử lý luồng thời gian thực, việc đảm bảo tính nhất quán và khả năng khôi phục sau sự cố phụ thuộc rất lớn vào cơ chế quản lý offset một cách đáng tin cậy. Bài viết này trình bày cách tích hợp Spark Streaming (phiên bản tương thích với Kafka 1.0.1) theo mô hình Direct Stream, đồng thời lưu trữ và truy vấn offset từ HBase — thay v ...

Đăng vào ngày 27 tháng 6 lúc 07:07

Giải Vấn Đề Bất Nhất Dữ Liệu Khi Truy Vấn HBase Bằng Spark

Triệu chứng: Bảng kết quả truy vấn: +----------+-------+--------+-----+-----+-----+----+----+------+---------+-------+--------+--------+------------+ |totalCount|January|February|March|April| May|June|July|August|September|October|November|December|totalMileage| +----------+-------+--------+-----+-----+-----+----+----+------+---------+-------+- ...

Đăng vào ngày 14 tháng 6 lúc 00:41

Đồng bộ dữ liệu MySQL sang HBase theo thời gian thực

Vấn đề với MySQL khi dữ liệu lớn Trong môi trường doanh nghiệp, MySQL là hệ quản trị cơ sở dữ liệu được sử dụng rộng rãi nhất. Tuy nhiên, MySQL có một hạn chế quan trọng: khi khối lượng dữ liệu đạt đến hàng triệu bản ghi, các thao tác truy vấn và cập nhật trở nên cực kỳ chậm chạp. Nếu hệ thống yêu cầu hiển thị dữ liệu theo thời gian thực, đây t ...

Đăng vào ngày 4 tháng 6 lúc 22:56