Kiến thức cốt lõi về hệ sinh thái dữ liệu lớn Big Data

1. Tổng quan về Big Data Big Data được định nghĩa bởi các đặc trưng cơ bản giúp phân biệt với các hệ thống xử lý dữ liệu truyền thống: Khối lượng (Volume): Sự bùng nổ dữ liệu từ các nguồn phi cấu trúc khiến quy mô lưu trữ vượt xa ngưỡng Terabyte, tiến dần đến Petabyte (PB) và Zettabyte (ZB). Đa dạng (Variety): Dữ liệu không chỉ dừng l ...

Đăng vào ngày 5 tháng 8 lúc 04:38

Cài đặt và Triển khai HBase 2.0

Hướng dẫn này mô tả quy trình cài đặt và triển khai HBase phiên bản 2.0. Trước khi bắt đầu, hãy đảm bảo rằng bạn đã cài đặt thành công ZooKeeper, Kafka và Hadoop. Kiến trúc hệ thống Hệ thống được cấu hình trên ba máy chủ: hadoop101, hadoop102 và hadoop103. Cụ thể: HDFS: NameNode trên hadoop101, SecondaryNameNode trên hadoop103. DataNode đ ...

Đăng vào ngày 24 tháng 7 lúc 22:31

Cài đặt và triển khai ba chế độ chạy Flink 1.6 cùng ứng dụng WordCount

Giới thiệu Ba phương thức vận hành Flink: Chế độ cục bộ (Local), Chế độ độc lập (Standalone), Chế độ tích hợp với Yarn. Sau khi hoàn tất cài đặt, thực hiện WordCount bằng cả Scala và Java. Môi trường Phiên bản: Flink 1.6.2 Môi trường cụm: Hadoop2.6 Công cụ phát triển: IntelliJ IDEA I. Chế độ cục bộ (Local) Giải nén: tar -zxvf flink-1.6.2-bin- ...

Đăng vào ngày 12 tháng 7 lúc 08:57

Hadoop Pseudo-Distributed Environment Setup Guide (Linux)

1. Preparation 1.1 Configure Hostname and Hosts File # 127.0.0.1 localhost localhost.localdomain localhost4 localhost4.localdomain4 # ::1 localhost localhost.localdomain localhost6 localhost6.localdomain6 192.168.241.128 nodeQLy 1.2 SSH Key Configuration [root ...

Đăng vào ngày 10 tháng 7 lúc 14:42

Kết nối Kudu với Impala

Apache Kudu và Impala hỗ trợ tích hợp liền mạch để thực hiện các thao tác đọc/ghi dữ liệu bằng cú pháp SQL trên bảng Kudu thông qua công cụ truy vấn phân tán của Impala; Cài đặt Impala Lập kế hoạch triển khai 1: Dịch vụ catalog của Impala sẽ đồng bộ hóa thay đổi metadata sang các node trong cụm 2: Statestore của Impala giám sát trạng thái hoạt ...

Đăng vào ngày 7 tháng 7 lúc 07:43

Hướng dẫn cài đặt và kiểm thử dịch vụ Hive LLAP

Hướng dẫn cài đặt và kiểm thử dịch vụ Hive LLAP 1.Tổng quan Từ phiên bản Hive 2.0, Apache đã giới thiệu LLAP (Live Long And Process), và phiên bản 2.1 đã có những cải tiến đáng kể. Có thể nói rằng Hive đã bước vào kỷ nguyên tính toán trong bộ nhớ, Theo kết quả thử nghiệm của Hortonworks, hiệu suất của llap kết hợp với tez nhanh hơn 25 lần so ...

Đăng vào ngày 7 tháng 7 lúc 06:52

Các nguyên nhân và giải pháp cho hiện tượng dữ liệu nghiêng trong MapReduce

Giới thiệu về MapReduce MapReduce là một mô hình, khung xử lý và nền tảng tính toán song song dành cho dữ liệu lớn, bao gồm ba ý nghĩa sau: MapReduce là một nền tảng tính toán hiệu suất cao dựa trên cụm (Cluster Infrastructure). Nó cho phép sử dụng các máy chủ thương mại thông thường để tạo thành cụm phân tán và song song với hàng chục, trăm ...

Đăng vào ngày 18 tháng 6 lúc 04:50

Giới thiệu về nén dữ liệu

Nén dữ liệu là gì? Nén dữ liệu là quá trình mã hóa lại thông tin ban đầu bằng các thuật toán và kỹ thuật đặc biệt để giảm kích thước lưu trữ hoặc băng thông truyền tải, trong khi vẫn giữ nguyên hoặc mất ít thông tin nhất có thể. Mục tiêu chính của việc nén dữ liệu là tăng hiệu quả trong lưu trữ, truyền tải và xử lý dữ liệu, đồng thời đảm bảo t ...

Đăng vào ngày 16 tháng 6 lúc 19:12

Cài đặt Hadoop Distributed File System trên macOS với Apache Hadoop 3.2.1

Để triển khai nhanh môi trường HDFS cục bộ nhằm kiểm thử và học tập, bài viết này hướng dẫn cài đặt Hadoop 3.2.1 trên hệ điều hành macOS — không yêu cầu cấu hình cụm phân tán hay máy ảo. 1. Tải và giải nén gói cài đặt Tải bản binary của Hadoop 3.2.1 từ trang chủ: https://hadoop.apache.org/releases.html. Sau khi tải xong, giải nén vào thư mục l ...

Đăng vào ngày 16 tháng 6 lúc 08:53

Xử lý tệp tin nhỏ trong Hadoop

1. Vấn đề phát sinh HDFS không phải là giải pháp tối ưu cho việc lưu trữ các tệp tin có kích thước nhỏ. Lý do là mỗi tệp tin, dù nhỏ, cũng chiếm ít nhất một block, và thông tin metadata của mỗi block đều được lưu trong bộ nhớ của NameNode. Khi số lượng tệp tin nhỏ tăng lên, bộ nhớ NameNode sẽ bị tiêu tốn đáng kể. Dưới đây là mô phỏng một kịch b ...

Đăng vào ngày 14 tháng 6 lúc 05:19