Xây dựng và triển khai mạng nơ-ron tích chập (CNN) phân loại hình ảnh bằng PyTorch
1. Xử lý và chuẩn bị dữ liệu hình ảnh
Trong quy trình huấn luyện mạng nơ-ron tích chập (CNN), bước tiền xử lý dữ liệu đóng vai trò quyết định. PyTorch cung cấp thư viện torchvision để hỗ trợ việc biến đổi và tải dữ liệu một cách hiệu quả.
Cấu hình các bước tiền xử lý (Transforms)
Để đảm bảo các hình ảnh đầu vào có cùng kích thước và định dạng ...
Đăng vào ngày 24 tháng 8 lúc 20:11
Phát Triển Hệ Thống Phát Hiện Khuyết Tật Bề Mặt Nhôm Với YOLOv8 Và PyQt5
Trong lĩnh vực thị giác máy tính, việc tự động hóa quá trình kiểm tra chất lượng bề mặt vật liệu là một bài toán quan trọng. Bài viết này trình bày chi tiết quy trình xây dựng một hệ thống phát hiện khuyết tật trên bề mặt nhôm, bao gồm các bước xử lý tập dữ liệu, huấn luyện mô hình YOLOv8 và thiết kế giao diện người dùng đồ họa (GUI) bằng PyQt5 ...
Đăng vào ngày 24 tháng 8 lúc 01:49
Nhận diện văn bản đa ngôn ngữ hiệu quả với mô hình LightOnOCR-2-1B
Giới thiệu về LightOnOCR-2-1B
Việc chuyển đổi dữ liệu từ hình ảnh hoặc tài liệu giấy sang định dạng văn bản (OCR) thường gặp nhiều khó khăn như sai lệch ngôn ngữ, cấu trúc phức tạp hoặc yêu cầu phần cứng lớn. LightOnOCR-2-1B được phát triển để giải quyết các rào cản này. Với kích thước mô hình chỉ 1 tỷ tham số (1B), công cụ này hỗ trợ nhận diện ...
Đăng vào ngày 31 tháng 7 lúc 17:00
Ứng dụng mô hình OFA tự động tạo mô tả sản phẩm tiếng Anh cho thương mại điện tử
1. Thách thức và Giải pháp trong Thương mại điện tử xuyên biên giới
Đối với các nhà bán hàng trên các nền tảng quốc tế như Amazon, eBay hay Etsy, việc soạn thảo mô tả sản phẩm (product description) bằng tiếng Anh chuyên nghiệp cho hàng nghìn SKU là một rào cản lớn. Quy trình thủ công không chỉ tốn kém chi phí nhân sự mà còn khó đảm bảo tính nh ...
Đăng vào ngày 22 tháng 7 lúc 18:20
Cải thiện tính nhất quán chuỗi hình ảnh với Kook Zimage Turbo và kỹ thuật LSTM
Trong lĩnh vực sinh ảnh bằng trí tuệ nhân tạo (AI Image Generation), một trong những thách thức lớn nhất là duy trì tính nhất quán về mặt thời gian (temporal consistency). Khi người dùng cố gắng tạo ra một loạt ảnh về cùng một nhân vật hoặc bối cảnh, các chi tiết như khuôn mặt, trang phục hay ánh sáng thường bị thay đổi đột ngột giữa các khung ...
Đăng vào ngày 22 tháng 7 lúc 10:18
Xây dựng hệ thống Embedding đa phương thức hiệu suất cao với CLIP-as-service
CLIP-as-service là một giải pháp mã nguồn mở mạnh mẽ được thiết kế để xử lý các tác vụ embedding (nhúng vector) văn bản và hình ảnh ở quy mô lớn. Dựa trên mô hình CLIP của OpenAI, công cụ này cung cấp khả năng tính toán vector, suy luận và xếp hạng, giúp các kỹ sư dễ dàng xây dựng các hệ thống tìm kiếm đa phương thức (cross-modal search) và khớ ...
Đăng vào ngày 22 tháng 7 lúc 06:04
Hướng Dẫn Sử Dụng OpenCV.js Để Xử Lý Ảnh Trên Trình Duyệt
OpenCV.js là một thư viện JavaScript mạnh mẽ được hỗ trợ bởi Intel, mang khả năng xử lý hình ảnh và thị giác máy tính của OpenCV lên nền tảng web. Thư viện này được xây dựng từ mã C++ của OpenCV (phiên bản 3.1.0 được đề cập trong ví dụ gốc) và biên dịch sang JavaScript thông qua trình biên dịch Emscripten. Điều này cho phép các nhà phát triển t ...
Đăng vào ngày 19 tháng 7 lúc 04:45
Hướng dẫn khắc phục lỗi 'solutions' không tồn tại trong MediaPipe cho người mới bắt đầu
Giới thiệu vấn đề
Trong quá trình phát triển dự án nhận dạng khuôn mặt bằng MediaPipe, nhiều lập trình viên mới thường gặp phải lỗi: AttributeError: module 'mediapipe' has no attribute 'solutions'. Lỗi này có thể khiến bạn mất nhiều thời gian nếu không biết cách xử lý. Bài viết này tổng hợp các phương pháp hiệu quả để giải quyết vấn đề này.
Ng ...
Đăng vào ngày 4 tháng 7 lúc 20:19
Triển Khai Mô Hình YOLOv5 với TensorRT trên Ubuntu
Triển Khai Mô Hình YOLOv5 với TensorRT trên Ubuntu
Giới thiệu YOLOv5
YOLOv5 mang đến nhiều cải tiến và tối ưu hóa so với các thuật toán phát hiện đối tượng trước đây. Đầu tiên, kiến trúc mạng sử dụng thiết kế nhẹ nhàng với CSPDarknet53 làm mạng xương sống, giảm lượng tính toán và tham số, nâng cao hiệu suất thời gian thực. Thứ hai, YOLOv5 áp dụ ...
Đăng vào ngày 29 tháng 6 lúc 19:57
Hệ thống phát hiện sự tập trung trong lớp học trực tuyến sử dụng thị giác máy tính
1 Giới thiệu
Hôm nay, chúng ta sẽ cùng tìm hiểu một dự án tốt nghiệp liên quan đến thị giác máy tính, cụ thể là Hệ thống phát hiện sự tập trung trong lớp học trực tuyến.
Hiệu quả hoạt động của dự án:
Dự án tốt nghiệp: Hệ thống phát hiện sự tập trung trong lớp học trực tuyến
Chia sẻ dự án: Xem phần cuối bài viết!
2 Các công nghệ liên quan
2.1 Gi ...
Đăng vào ngày 23 tháng 6 lúc 01:33