Triển khai mô hình Qwen3.5-35B trên cụm 4 GPU RTX 4090 bằng SGLang
Trong hệ sinh thái suy luận mô hình ngôn ngữ lớn, việc lựa chọn framework tối ưu phụ thuộc vào đặc thù tải công việc. vLLM thường được xem là chuẩn mực nhờ cơ chế PagedAttention và kỹ thuật Continuous Batching, giúp tối đa hóa thông lượng cho các yêu cầu đơn lẻ. Ngược lại, SGLang vượt trội trong các kịch bản hội thoại đa vòng hoặc hệ thống Agen ...
Đăng vào ngày 2 tháng 9 lúc 03:18
Triển khai DeepSeek-V3-0324 cục bộ với vLLM và SGLang
Tải mô hình
Vào ngày phát hành DeepSeek-V3-0324, đội ngũ chính thức đã tải lên tất cả các tham số mô hình trên Hugging Face tại địa chỉ:
https://huggingface.co/deepseek-ai/DeepSeek-V3-0324
Để tiện lợi, tôi thường tải mô hình từ ModelScope. Vào sáng ngày 25/3, ModelScope đã phát hành mô hình này, ngay cả khi README chưa được tải lên và mô hình g ...
Đăng vào ngày 5 tháng 7 lúc 07:54