Hướng dẫn thực hành GLM-4v-9b: Sử dụng pipeline transformers và tạo mẫu prompt tùy chỉnh

Đã bao giờ bạn muốn trải nghiệm một mô hình AI có thể hiểu hình ảnh và trò chuyện với bạn chưa? Hôm nay chúng ta sẽ cùng khám phá mô hình GLM-4v-9b - một mô hình đa phương thức mạnh mẽ có thể xử lý cả văn bản và hình ảnh. Với chỉ 9 tỷ tham số, mô hình này có thể chạy trên một card RTX 4090 duy nhất và hỗ trợ đầu vào hình ảnh chất lượng cao 1120 ...

Đăng vào ngày 14 tháng 7 lúc 21:08

GLM-4v-9b: Nhận diện chính xác mọi thông tin trên Căn cước công dân với độ phân giải 1120×1120

1. Giới thiệu: AI và OCR độ cao Việc xử lý hàng loạt căn cước công dân thủ công tốn nhiều thời gian và dễ xảy ra sai sót. Với mô hình AI đa phương thức GLM-4v-9b, chỉ cần chụp ảnh, hệ thống có thể tự động nhận diện chính xác mọi thông tin trên thẻ căn cước, bao gồm cả vị trí từng trường dữ liệu. GLM-4v-9b là mô hình thị giác-ngôn ngữ 9 tỷ tha ...

Đăng vào ngày 10 tháng 7 lúc 13:16