tooly

Chuyển video sang văn bản

Lấy lời nói ra khỏi video: văn bản thuần để dán vào nơi khác, hoặc phụ đề SRT và VTT dựng sẵn kèm thời gian. Nhận dạng dùng Whisper và hỗ trợ 99 ngôn ngữ, kể cả giọng địa phương và lời nói pha trộn.

Được chuyển đổi trên máy chủ của chúng tôi, xóa ngay sau đó

Cách sử dụng

  1. 1

    Chọn định dạng đầu ra — văn bản thuần hoặc phụ đề SRT/VTT kèm mã thời gian.

  2. 2

    Thả tệp video hoặc audio vào. Giữ nguyên ngôn ngữ ở chế độ Tự động trừ khi bản ghi ngắn hoặc nhiều tạp âm.

  3. 3

    Đọc bản ghi ngay trên trang, sao chép hoặc tải tệp về.

Câu hỏi thường gặp

Những ngôn ngữ nào được nhận dạng?

Whisper hỗ trợ 99 ngôn ngữ và tự động nhận diện ngôn ngữ đang nói. Tiếng Anh, Nga, Tây Ban Nha, Bồ Đào Nha, Đức và Pháp cho kết quả tốt nhất; các ngôn ngữ hiếm gặp yếu hơn rõ rệt.

Độ chính xác thế nào?

Với lời nói rõ ràng, kết quả gần bằng một người đánh máy cẩn thận. Độ chính xác giảm khi có tiếng ồn nền, nhiều người nói chồng nhau, giọng địa phương nặng và audio bitrate thấp. Luôn đọc lại trước khi đăng.

Mất bao lâu?

Gần bằng độ dài bản ghi: video 10 phút mất khoảng 10 phút. Bạn có thể đóng tab — kết quả sẽ chờ trong tài khoản, hoặc ngay trên trang này nếu bạn để mở.

Vì sao công cụ này tải tệp của tôi lên?

Nhận dạng giọng nói cần một mô hình quá lớn để chạy trong trình duyệt. Tệp media được xử lý trên máy chủ của chúng tôi và bị xóa ngay khi bản ghi sẵn sàng.

Có giới hạn nào không?

Một bản ghi mỗi ngày không cần tài khoản, tối đa 10 phút media và 500 MB. Premium bỏ giới hạn ngày và nâng mức lên 45 phút mỗi tệp.

SRT và VTT khác nhau thế nào?

Cả hai đều là tệp phụ đề kèm thời gian. SRT được hầu hết trình phát và YouTube hỗ trợ; VTT là định dạng mà video HTML5 dùng trên web. Nội dung văn bản giống hệt nhau.

Công cụ liên quan