Trích xuất văn bản từ PDF
Lấy văn bản từ tài liệu PDF với ngắt dòng theo bố cục, từng trang một. Mọi thứ chạy trong trình duyệt bằng PDF.js — tệp không bao giờ được tải lên.
Tệp của bạn không bao giờ rời khỏi trình duyệt
Cách sử dụng
- 1
Thả tệp PDF vào ô hoặc nhấp để chọn.
- 2
Đợi một chút trong khi các trang được đọc — có hiển thị tiến trình.
- 3
Sao chép văn bản hoặc tải về dạng .txt.
Câu hỏi thường gặp
PDF của tôi có bị tải lên không?
Không. Trích xuất chạy cục bộ bằng PDF.js. Tài liệu không bao giờ rời khỏi thiết bị.
Báo PDF không có văn bản — vì sao?
PDF là bản scan: các trang là ảnh không có lớp văn bản. Chuyển một trang bằng PDF sang JPG rồi dùng Ảnh sang văn bản (OCR).
Bố cục có được giữ không?
Dòng và đoạn văn giữ theo thứ tự đọc; cột, bảng và phông chữ thì không, vì đầu ra là văn bản thuần.
Có giới hạn số trang không?
Không có giới hạn cứng. Tài liệu hàng trăm trang vẫn được, chỉ lâu hơn vài giây.
Công cụ liên quan
Ảnh sang văn bản (OCR)Trích xuất văn bản từ ảnh, ảnh chụp màn hình và bản scan bằng OCR chạy trong trình duyệt. 12 ngôn ngữ, sao chép hoặc tải .txt. Ảnh không rời khỏi thiết bị.Chuyển PDF sang JPGChuyển từng trang PDF thành ảnh JPG trong trình duyệt. Chọn chất lượng và độ phân giải. Tệp không bao giờ rời khỏi thiết bị của bạn.Đếm từĐếm từ, ký tự, câu và đoạn văn ngay khi bạn gõ. Ước tính thời gian đọc và nói tức thì. Miễn phí, riêng tư, không tải lên.