28/08/2026 - 09:35

Google ra mắt mô hình mới Gemini 3.5 Transcribe, nâng cấp mạnh khả năng chuyển giọng nói thành văn bản 

Gemini 3.5 Transcribe được Google giới thiệu là mô hình chuyển giọng nói thành văn bản chính xác nhất của hãng, với khả năng xử lý tốt hơn đối với tiếng ồn, thuật ngữ chuyên ngành và giọng địa phương.

Ảnh: Google

Google vừa công bố Gemini 3.5 Transcribe, mô hình AI mới thuộc dòng Gemini dành cho tác vụ chuyển giọng nói thành văn bản (speech-to-text). Mô hình hiện bắt đầu được cung cấp cho các nhà phát triển, doanh nghiệp và người dùng phổ thông.

Theo Google, Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản chính xác nhất của hãng hiện nay. Nó được thiết kế để hiểu cách nói chuyện tự nhiên của người dùng, từ đó nhận diện ý định, từ ngữ riêng và những thuật ngữ đặc thù.

Xử lý tốt đối với tiếng ồn và thuật ngữ chuyên ngành

Một trong những điểm đáng chú ý của Gemini 3.5 Transcribe là cho ra kết quả chính xác hơn trong môi trường có nhiều tiếng ồn. Mô hình cũng được cải thiện trong việc nhận diện các từ ngữ chuyên ngành, các chuỗi ký tự đặc biệt gồm cả chữ và số, chẳng hạn như mã đơn hàng hoặc mã bưu chính.

Google cho biết những cải tiến từ mô hình mới sẽ giúp nâng cao trải nghiệm trên ứng dụng Gemini dành cho máy tính chạy hệ điều hành macOS cũng như tính năng gõ bằng giọng nói Rambler của ứng dụng bàn phím Gboard trên thiết bị Android.

Đối với các nhà phát triển, Gemini 3.5 Transcribe có thể được sử dụng để xây dựng trợ lý giọng nói, công cụ tạo phụ đề theo thời gian thực hoặc hệ thống phân tích nội dung sau các cuộc gọi.

Tự sửa lỗi, loại bỏ từ đệm và tự động định dạng văn bản

Không chỉ chuyển giọng nói thành chữ, Gemini 3.5 Transcribe còn được trang bị một loạt tính năng mới nhằm cải thiện chất lượng đầu ra.

Mô hình có khả năng tự sửa lỗi, loại bỏ các từ đệm trong lời nói và tự động định dạng nội dung. Khi cần thực hiện những tác vụ phức tạp hơn, Gemini 3.5 Transcribe có thể chuyển nhiệm vụ cho các mô hình Gemini khác, chẳng hạn như phân tích tập tin hoặc tạo hình ảnh.

Theo Google, Gemini 3.5 Transcribe đạt tỷ lệ lỗi từ Word Error Rate (WER) trung bình 4% đối với tác vụ truyền phát (streaming) và 2,6% đối với tác vụ không truyền phát (non-streaming). WER càng thấp đồng nghĩa với khả năng chuyển lời nói thành văn bản càng chính xác.

Gemini 3.5 Transcribe cũng hỗ trợ nhận diện giọng nói trong các điều kiện âm thanh phức tạp, đồng thời có thể phân biệt người nói trong các bản ghi âm có sẵn. Nó hỗ trợ gắn mốc thời gian và có thể xác định tối đa 3 người nói.

Hỗ trợ 85 ngôn ngữ

Gemini 3.5 Transcribe hiện hỗ trợ 85 ngôn ngữ, bao gồm các biến thể giọng địa phương và nhiều phương ngữ khác nhau. Mô hình có thể thích ứng với từ ngữ do người dùng tùy chỉnh, đồng thời nhận diện các thuật ngữ chuyên ngành và các mã số đặc biệt.

Google cho biết, tính năng này đặc biệt hữu ích trong những trường hợp người dùng sử dụng giọng nói để ra lệnh thực hiện tác vụ, thay vì chỉ đơn thuần chuyển nội dung nói thành văn bản.

Đã mở cho nhà phát triển

Gemini 3.5 Transcribe hiện được cung cấp dưới dạng public preview (thử nghiệm công khai) cho các nhà phát triển thông qua Gemini API trên nền tảng Google AI Studio và Google Antigravity.

Người dùng phổ thông cũng có thể trải nghiệm Gemini 3.5 Transcribe trên thiết bị Android và macOS. Google cho biết tính năng này sẽ sớm được tích hợp vào trình duyệt web Chrome, cho phép người dùng sử dụng giọng nói để nhập nội dung vào bất kỳ trường văn bản nào trên web.

LÊ PHI (Theo Neowin)

Chia sẻ bài viết