GLM-4V-9B: Khả năng Nhận dạng Hình ảnh và Văn bản Thực tế

GLM-4V-9B: Khả năng Nhận dạng Hình ảnh và Văn bản Thực tế Mô hình đa phương thức GLM-4V-9B đã tạo ra những bước tiến đáng kể trong lĩnh vực nhận dạng hình ảnh kết hợp xử lý ngôn ngữ tự nhiên. Bài viết này trình bày các khả năng thực tế của mô hình trong hai nhiệm vụ chính: trích xuất văn bản từ hình ảnh và nhận dạng động vật, kèm theo các ví d ...

Đăng vào ngày 8 tháng 10 lúc 05:50

Hướng dẫn thực hành GLM-4v-9b: Sử dụng pipeline transformers và tạo mẫu prompt tùy chỉnh

Đã bao giờ bạn muốn trải nghiệm một mô hình AI có thể hiểu hình ảnh và trò chuyện với bạn chưa? Hôm nay chúng ta sẽ cùng khám phá mô hình GLM-4v-9b - một mô hình đa phương thức mạnh mẽ có thể xử lý cả văn bản và hình ảnh. Với chỉ 9 tỷ tham số, mô hình này có thể chạy trên một card RTX 4090 duy nhất và hỗ trợ đầu vào hình ảnh chất lượng cao 1120 ...

Đăng vào ngày 14 tháng 7 lúc 21:08

GLM-4v-9b: Nhận diện chính xác mọi thông tin trên Căn cước công dân với độ phân giải 1120×1120

1. Giới thiệu: AI và OCR độ cao Việc xử lý hàng loạt căn cước công dân thủ công tốn nhiều thời gian và dễ xảy ra sai sót. Với mô hình AI đa phương thức GLM-4v-9b, chỉ cần chụp ảnh, hệ thống có thể tự động nhận diện chính xác mọi thông tin trên thẻ căn cước, bao gồm cả vị trí từng trường dữ liệu. GLM-4v-9b là mô hình thị giác-ngôn ngữ 9 tỷ tha ...

Đăng vào ngày 10 tháng 7 lúc 13:16