Cách dùng Video to Text | Tải lên, chuyển giọng nói thành văn bản và xuất kết quả

Tìm hiểu cách tải tệp lên, chọn cài đặt ngôn ngữ, bắt đầu chuyển giọng nói thành văn bản và xuất bản chép lời dưới dạng CSV, SRT, VTT hoặc TXT.

Dkphhh

Cách dùng Video to Text rất đơn giản: đăng nhập, tải lên một tệp được hỗ trợ, chọn cài đặt ngôn ngữ, chờ quá trình chuyển giọng nói thành văn bản hoàn tất, rồi xuất kết quả theo định dạng bạn cần.

Bài hướng dẫn này trình bày quy trình hiện tại trong ứng dụng. Nếu bạn muốn tìm hiểu chi tiết về định dạng trước, hãy xem Các định dạng tệp âm thanh và video được hỗ trợ trong Video to Text. Nếu bạn cần thông tin về ngôn ngữ, hãy đọc Các ngôn ngữ được hỗ trợ trong Video to Text.

Bước 1: Đăng nhập và chuẩn bị tín dụng

Trước khi bắt đầu chuyển giọng nói thành văn bản, hãy đăng nhập vào tài khoản của bạn. Ứng dụng sẽ kiểm tra quyền truy cập tài khoản và số tín dụng khả dụng trước khi bắt đầu xử lý.

Người dùng mới nhận được 30 tín dụng miễn phí. Nếu số tín dụng còn lại không đủ cho tệp bạn đã chọn, ứng dụng sẽ nhắc bạn nạp thêm trước khi quá trình chuyển giọng nói thành văn bản bắt đầu.

Bước 2: Tải lên tệp âm thanh hoặc video được hỗ trợ

Nhấp vào khu vực tải lên và chọn tệp của bạn.

Video to Text hiện chấp nhận các loại tệp sau:

  • Âm thanh: .aac, .flac, .m4a, .mp3, .oga, .ogg, .opus, .wav
  • Video: .mp4, .m4v, .mov, .mkv, .webm

Các quy tắc tải lên cũng rất quan trọng:

  • dung lượng tệp tối đa: 5 GB
  • thời lượng tệp tối đa: dưới 10 giờ

Nếu tệp của bạn vượt quá một trong hai giới hạn này, ứng dụng sẽ dừng quy trình trước khi quá trình chuyển giọng nói thành văn bản bắt đầu.

Bước 3: Chọn tùy chọn ngôn ngữ

Sau khi chọn tệp, hãy chọn cài đặt ngôn ngữ phù hợp với bản ghi âm của bạn:

  • chọn một ngôn ngữ cụ thể nếu bạn biết rõ
  • dùng tự động phát hiện nếu bạn không chắc chắn
  • dùng phát hiện đa ngôn ngữ nếu bản ghi âm chuyển đổi giữa nhiều ngôn ngữ

Lựa chọn này quan trọng nhất với các cuộc phỏng vấn dài, podcast và cuộc họp nhóm quốc tế.

Bước 4: Bật nhãn người nói nếu cần

Nhãn người nói hữu ích cho các cuộc trò chuyện có nhiều hơn một người. Khi tùy chọn này được bật, bản chép lời có thể tách nội dung theo từng người nói, giúp việc xem lại và xuất kết quả dễ đọc hơn.

Tính năng này đặc biệt hữu ích cho:

  • các cuộc họp
  • các cuộc phỏng vấn
  • các buổi thảo luận nhóm
  • các bản ghi âm bài giảng trong lớp học

Bước 5: Chờ tải lên và chuyển giọng nói thành văn bản hoàn tất

Sau khi bạn gửi tệp, ứng dụng sẽ tải tệp lên bộ lưu trữ rồi bắt đầu chuyển giọng nói thành văn bản. Các thông báo tiến độ sẽ xuất hiện trong khi tác vụ đang chạy.

Video to Text được xây dựng để xử lý nhanh, nhưng tổng thời gian vẫn phụ thuộc vào một vài yếu tố:

  • thời lượng tệp
  • tốc độ tải lên
  • dung lượng tệp
  • âm thanh có rõ ràng hay không

Nếu bạn muốn tìm hiểu kỹ hơn về thời gian dự kiến, hãy đọc Video to Text mất bao lâu?.

Bước 6: Xuất bản chép lời

Khi quá trình chuyển giọng nói thành văn bản hoàn tất, ứng dụng sẽ đưa bạn đến trang xuất kết quả. Bạn có thể xuất bản chép lời dưới dạng:

  • csv
  • srt
  • vtt
  • txt

Hãy chọn định dạng phù hợp với bước tiếp theo của bạn:

  • dùng srt hoặc vtt cho phụ đề
  • dùng csv để xem lại trong bảng tính hoặc bàn giao dữ liệu có cấu trúc
  • dùng txt để chỉnh sửa văn bản thuần và ghi chú

Tóm tắt quy trình nhanh

Nếu bạn chỉ cần bản tóm tắt ngắn, đây là các bước:

  1. Đăng nhập.
  2. Tải lên tệp được hỗ trợ.
  3. Xác nhận tệp dưới 5 GB và dưới 10 giờ.
  4. Chọn tùy chọn ngôn ngữ.
  5. Bật nhãn người nói nếu cần.
  6. Bắt đầu chuyển giọng nói thành văn bản.
  7. Xuất bản chép lời hoàn chỉnh dưới dạng csv, srt, vtt hoặc txt.

Mẹo để có kết quả suôn sẻ hơn

  • Tải lên tệp nguồn sạch nhất mà bạn có.
  • Dùng đúng tùy chọn ngôn ngữ bất cứ khi nào có thể.
  • Bật nhãn người nói cho các cuộc trò chuyện nhóm.
  • Xuất kết quả ở nhiều định dạng nếu mỗi thành viên trong nhóm cần một định dạng đầu ra khác nhau.

Tài liệu liên quan

Thẻ
video to texthướng dẫnxuất kết quảtài liệu