Hướng dẫn thực hành GLM-4v-9b: Sử dụng pipeline transformers và tạo mẫu prompt tùy chỉnh
Đã bao giờ bạn muốn trải nghiệm một mô hình AI có thể hiểu hình ảnh và trò chuyện với bạn chưa? Hôm nay chúng ta sẽ cùng khám phá mô hình GLM-4v-9b - một mô hình đa phương thức mạnh mẽ có thể xử lý cả văn bản và hình ảnh. Với chỉ 9 tỷ tham số, mô hình này có thể chạy trên một card RTX 4090 duy nhất và hỗ trợ đầu vào hình ảnh chất lượng cao 1120 ...
Đăng vào ngày 14 tháng 7 lúc 21:08
Trải nghiệm GLM-OCR: Sức mạnh nhận diện tích hợp Văn bản, Bảng biểu và Công thức
Trong kỷ nguyên số hóa tài liệu, các công cụ OCR (Optical Character Recognition) truyền thống thường bộc lộ những hạn chế đáng kể khi đối mặt với các cấu trúc phức tạp. Nếu việc nhận diện văn bản thuần túy đã trở nên phổ biến, thì các thành phần như bảng biểu bị lỗi định dạng hay các công thức toán học biến thành những ký tự vô nghĩa vẫn là thá ...
Đăng vào ngày 6 tháng 7 lúc 18:33