Ứng dụng Qwen3-ASR-0.6B trong biên dịch hội nghị và tạo phụ đề thời gian thực
Tổng quan về mô hình Qwen3-ASR-0.6B
Qwen3-ASR-0.6B là một bước tiến mới trong lĩnh vực nhận dạng giọng nói tự động (ASR) với kích thước siêu nhỏ gọn chỉ 600 triệu tham số. Được xây dựng trên nền tảng Qwen3-Omni và bộ mã hóa âm thanh AuT tự phát triển, mô hình này được tối ưu hóa cho các tác vụ đa ngôn ngữ, đòi hỏi độ trễ cực thấp và khả năng xử ...
Đăng vào ngày 26 tháng 7 lúc 10:22
LocalVocal: Giải pháp nhận dạng giọng nói thời gian thực không cần kết nối Internet
Công nghệ và Kiến trúc
LocalVocal là một plugin OBS hoàn toàn chạy trên máy tính cá nhân, sử dụng Whisper.cpp để cung cấp dịch vụ nhận dạng giọng nói và tạo phụ đề mà không cần tới các dịch vụ đám mây. Dự án này dựa trên mô hình Whisper của OpenAI, được tối ưu hóa cho việc xử lý trực tiếp trên CPU hoặc GPU, đảm bảo chất lượng phụ đề ngay cả k ...
Đăng vào ngày 8 tháng 6 lúc 17:07