Cấu hình huấn luyện liên tục (CPT) cho llama-factory với mô hình Qwen3
Trong quá trình nâng cấp hệ thống mô hình Qwen3, tôi đã thực hiện điều chỉnh cấu hình huấn luyện trên tài nguyên GPU mới của công ty. Dưới đây là quá trình phân tích và tối ưu hóa bộ nhớ.
Vấn đề về phụ thuộc cấu hình
=========
Ban đầu sử dụng mô hình Qwen2.5-Coder-3B với cấu hình mặc định:
bf16: true
max_seq_length: 2048
train_dataset: afsim_ ...
Đăng vào ngày 28 tháng 7 lúc 04:00