Hướng dẫn cấu hình tùy chỉnh Tokenizer cho Qwen2.5-7B-Instruct
Bạn đã bao giờ gặp phải tình huống mô hình hoạt động tốt nhưng khả năng phân tách từ tiếng Việt lại không như ý, các ký tự đặc biệt bị cắt vụn, văn bản dài bị kẹt ở một dấu câu cụ thể, hoặc các câu lệnh hệ thống tùy chỉnh của bạn bị tokenizer thay đổi một cách khó hiểu chưa? Đừng lo lắng, vấn đề rất có thể không nằm ở mô hình mà là do tokenizer ...
Đăng vào ngày 8 tháng 8 lúc 23:35
Kỹ Thuật Tùy Chỉnh Bộ Phân Tích (Analyzer) Trong Elasticsearch
Nguyên Lý Phân Tích Văn Bản
Trong Elasticsearch, quá trình phân tích (analysis) là bước tiền xử lý quan trọng để chuyển đổi dữ liệu văn bản thô thành các token phù hợp cho việc xây dựng chỉ mục nghịch đảo (inverted index). Nhiệm vụ này được thực hiện bởi một thành phần gọi là Analyzer.
Cấu Trúc Bộ Phân Tích
Một analyzer hoàn chỉnh thường bao g ...
Đăng vào ngày 27 tháng 5 lúc 03:06