Kiến trúc Streaming LLM: Quản lý Server-Sent Events và Backpressure trong Backend
Thách thức của mô hình Request-Response đồng bộ
Độ trễ trong quá trình suy luận của các mô hình ngôn ngữ lớn (LLM) là một rào cản lớn đối với trải nghiệm người dùng. Với một phản hồi dài khoảng 2000 tokens, thời gian tạo ra có thể lên tới 20-40 giây. Nếu sử dụng kiến trúc HTTP đồng bộ truyền thống, client sẽ phải chịu đựng một khoảng thời gian ...
Đăng vào ngày 29 tháng 9 lúc 08:15
Xử lý xung đột dữ liệu giao dịch bằng Distributed Lock trên Redis và Khám phá hiệu năng nội bộ
Bối cảnh kỹ thuật
Khi hệ thống giao dịch đạt đến quy mô nhất định, áp lực truy cập gia tăng dẫn đến nhiều vấn đề về tính toàn vẹn dữ liệu. Một trường hợp điển hình là hiện tượng đơn hàng bị tạo lặp. Dù số lượng tiền và sản phẩm giống hệt nhau nhưng lại tồn tại hai bản ghi với thời gian sinh ra chênh lệch chỉ vài chục mili giây.
Nếu nguyên nhân ...
Đăng vào ngày 31 tháng 8 lúc 19:38
Phân tích kỹ thuật và khắc phục hiệu ứng Thundering Herd trong Nginx
Bản chất của hiệu ứng Thundering Herd trong hệ thống High-Load
Hiệu ứng Thundering Herd (tạm dịch: hiệu ứng bầy đàn) là một bài toán kinh điển trong lập trình hệ thống mạng song song, đặc biệt nghiêm trọng trong kiến trúc Nginx hiện nay. Vấn đề phát sinh khi nhiều tiến trình worker cùng lúc chuyển sang trạng thái chờ (block) trên cùng một liste ...
Đăng vào ngày 12 tháng 7 lúc 22:12
Từ Paxos đến Raft: Hướng Dẫn Dễ Hiểu Về Hai Thuật Toán Đồng Thuận
Chào các bạn! Hôm nay chúng ta sẽ nói về một chủ đề rất quan trọng trong hệ thống phân tán - thuật toán đồng thuận. Cụ thể, chúng ta sẽ tìm hiểu về Paxos và Raft - hai cái tên nổi bật nhất trong lĩnh vực này. Tôi sẽ giải thích bằng cách kể chuyện để mọi người dễ hiểu nhất có thể.
Tại Sao Cần "Mọi Người Cùng Quyết Định"?
Hãy tưởng tượn ...
Đăng vào ngày 10 tháng 7 lúc 20:36