tooly

Trích xuất văn bản từ PDF

Lấy văn bản từ tài liệu PDF với ngắt dòng theo bố cục, từng trang một. Mọi thứ chạy trong trình duyệt bằng PDF.js — tệp không bao giờ được tải lên.

Tệp của bạn không bao giờ rời khỏi trình duyệt

Cách sử dụng

  1. 1

    Thả tệp PDF vào ô hoặc nhấp để chọn.

  2. 2

    Đợi một chút trong khi các trang được đọc — có hiển thị tiến trình.

  3. 3

    Sao chép văn bản hoặc tải về dạng .txt.

Câu hỏi thường gặp

PDF của tôi có bị tải lên không?

Không. Trích xuất chạy cục bộ bằng PDF.js. Tài liệu không bao giờ rời khỏi thiết bị.

Báo PDF không có văn bản — vì sao?

PDF là bản scan: các trang là ảnh không có lớp văn bản. Chuyển một trang bằng PDF sang JPG rồi dùng Ảnh sang văn bản (OCR).

Bố cục có được giữ không?

Dòng và đoạn văn giữ theo thứ tự đọc; cột, bảng và phông chữ thì không, vì đầu ra là văn bản thuần.

Có giới hạn số trang không?

Không có giới hạn cứng. Tài liệu hàng trăm trang vẫn được, chỉ lâu hơn vài giây.

Công cụ liên quan