Tinh chỉnh mô hình ngôn ngữ lớn với thư viện Hugging Face
1. Môi trường huấn luyện được đề xuất
Để tối ưu chi phí và tận dụng tài nguyên miễn phí, Google Colab và Kaggle là hai lựa chọn hàng đầu. Cả hai nền tảng này đều cung cấp GPU miễn phí hoặc với chi phí thấp.
Google Colab: Với bản Pro+ (khoảng 300 VNĐ/tháng), người dùng có thể truy cập GPU A100 40GB, mặc dù có giới hạn thời gian sử ...
Đăng vào ngày 18 tháng 6 lúc 01:07
Giải quyết vấn đề độ chính xác của mô hình sau khi huấn luyện LLM
Khi tiếp tục tiền huấn luyện (continual pre-training) dựa trên mô hình Qwen2.5-coder, trọng số của mô hình được lưu trữ tăng gấp đôi so với phiên bản gốc (Qwen2.5-coder 3b có kích thước 5 GB, sau khi huấn luyện và lưu trữ bằng safetensor là hơn 10 GB). Vấn đề này được phát hiện ngay sau khi hoàn thành quá trình huấn luyện, nhưng vì nó vẫn hoạt ...
Đăng vào ngày 9 tháng 6 lúc 17:36
Mô hình BTLM 3B: Hiệu suất ngang 7B, xử lý văn bản dài 8K với bộ nhớ chỉ 3GB
Bạn đang tìm kiếm một mô hình ngôn ngữ mạnh mẽ nhưng nhẹ nhàng về tài nguyên? BTLM-3B-8k-base là giải pháp đột phá — chỉ với 3 tỷ tham số, nó đạt hiệu năng tương đương mô hình 7B, hỗ trợ độ dài ngữ cảnh lên tới 8.000 token và tiêu thụ chưa đến 3GB RAM khi lượng tử hóa 4-bit. Bài viết này hướng dẫn triển khai thực tế từ cấu hình môi trường đến t ...
Đăng vào ngày 6 tháng 6 lúc 19:08
Sử dụng mô hình GPT để tạo văn bản tiếng Trung
Tạo lời nhạc cổ điển
Hiển thị mã nguồn
# Mô hình tạo lời nhạc tiếng Trung
from transformers import GPT2LMHeadModel, BertTokenizer, TextGenerationPipeline
bo_token = BertTokenizer.from_pretrained(r"D:\PycharmProjects\demo_16\model\models--uer--gpt2-chinese-lyric\snapshots\4a42fd76daab07d9d7ff95c816160cfb7c21684f")
mang_luoi = GPT2LMHeadModel.fr ...
Đăng vào ngày 6 tháng 6 lúc 04:10
Hướng dẫn sử dụng mô hình Hugging Face với Transformers trong Python
Cài đặt môi trường cần thiết
Để làm việc với các mô hình ngôn ngữ từ thư viện Hugging Face, bạn cần cài đặt một số gói chính như sau:
pip install transformers datasets tokenizers
Tải mô hình và bộ tách từ xuống máy cục bộ
Sử dụng phương thức from_pretrained để tải mô hình và tokenizer về một thư mục cụ thể nhằm tái sử dụng mà k ...
Đăng vào ngày 3 tháng 6 lúc 20:59
Mở Rộng Độ Dài Chuỗi Cho Mô Hình BERT Trong Huấn Luyện
Giới thiệu
Mô hình BERT tiêu chuẩn thường giới hạn độ dài chuỗi đầu vào ở mức 512 token. Tuy nhiên, trong nhiều bài toán thực tế, dữ liệu văn bản có thể dài hơn đáng kể. Để giải quyết vấn đề này, chúng ta cần điều chỉnh tham số max_position_embeddings trong cấu hình mô hình và tùy chỉnh quá trình huấn luyện để phù hợp với độ dài mới.
1. Xây dự ...
Đăng vào ngày 25 tháng 5 lúc 19:37