TanodTools
VI

PDF sang văn bản

Lấy văn bản ra khỏi PDF theo từng trang, rồi sao chép hoặc lưu thành tệp .txt. PDF scan không có sẵn văn bản để lấy; với loại này, hãy dùng OCR PDF.

Tệp của bạn không bao giờ rời khỏi thiết bị

Thả PDF vào đây

Hoặc kéo thả vào bất kỳ đâu trên trang này.

Mở ngay trên thiết bị này. Không có gì được tải lên.

Mỗi lần một PDF, tối đa 200 MB và 500 trang. Công cụ đọc phần văn bản được lưu sẵn trong PDF. PDF scan chỉ là ảnh chụp của các trang nên không có văn bản, và cần dùng OCR PDF thay thế. Bảng và văn bản chia cột được xuất ra theo từng dòng. Không mở được PDF có đặt mật khẩu.

Cách trích xuất văn bản từ PDF

  1. Chọn một tệp PDF, hoặc kéo thả vào trang.
  2. Chờ một lát để công cụ đọc từng trang. Chọn tất cả các trang hoặc một dải trang như 1-3, 5, rồi chọn có đánh dấu nơi mỗi trang bắt đầu hay không.
  3. Nhấn Tải xuống .txt, hoặc sao chép toàn bộ văn bản, hoặc sao chép riêng một trang trong danh sách.

Văn bản trong PDF đến từ đâu

Một tệp PDF do phần mềm soạn thảo văn bản, trình duyệt hay phần mềm thiết kế tạo ra sẽ lưu các từ của nó dưới dạng văn bản: mỗi chuỗi chữ cái đi kèm một phông chữ và một vị trí trên trang. Phần văn bản được lưu đó chính là thứ công cụ này đọc. Trình duyệt của bạn mở tệp bằng pdf.js, yêu cầu từng trang trả về văn bản của nó, rồi ghép các chuỗi chữ lại thành dòng theo đúng thứ tự tệp liệt kê. Công cụ không hề xem trang hiển thị ra sao trên màn hình.

PDF scan thì khác. Máy scan hoặc camera điện thoại tạo ra một bức ảnh cho mỗi trang, và PDF chỉ chứa những bức ảnh đó, nên không có văn bản để đọc: bạn nhìn thấy chữ, nhưng tệp không hề chứa chúng. Biến những bức ảnh trở lại thành văn bản là một công việc khác, gọi là nhận dạng ký tự quang học, và OCR PDF làm việc đó. Những trang không có văn bản được đánh dấu trong danh sách bên dưới ô văn bản, để bạn phân biệt trang scan với trang bình thường trong một tệp hỗn hợp.

Kết quả là văn bản thuần, không có định dạng. Mỗi dòng kết thúc ở đúng chỗ như trong PDF, và một dòng trống được thêm vào nơi khoảng cách giữa hai dòng lớn hơn rõ rệt so với khoảng cách thông thường trên trang đó; nhờ vậy các đoạn văn và tiêu đề được tách riêng. Các chữ ghép mà một số phông dùng cho những cặp như fi và fl được tách lại thành từng chữ cái riêng, và các dấu gạch nối mềm vô hình bị loại bỏ.

Mẹo

  • Các trang scan hiện ra là trang không có văn bản. Hãy cho chúng chạy qua OCR PDF rồi đọc kết quả.
  • Dán văn bản vào Xóa dấu xuống dòng để biến các dòng xếp chồng thành những đoạn văn liền mạch.
  • Chỉ cần một số trang dưới dạng PDF? Trích xuất trang PDF cắt chúng ra, còn Đếm từ đếm phần bạn đã sao chép.

Câu hỏi thường gặp

PDF của tôi có được tải lên không?

Không. Trình duyệt của bạn đọc văn bản bằng thư viện mã nguồn mở pdf.js, ngay trên thiết bị của bạn. Không có gì được gửi đến máy chủ, và văn bản sẽ biến mất khi bạn đóng thẻ.

Vì sao tôi không nhận được văn bản, hoặc chỉ có văn bản của một số trang?

Công cụ đọc phần văn bản được lưu sẵn trong PDF. PDF scan lưu mỗi trang dưới dạng một bức ảnh, phía sau không có văn bản nào, nên không có gì để đọc. Các trang scan được chèn vào một tài liệu vốn bình thường cũng vậy. Hãy dùng OCR PDF để nhận dạng các chữ cái trong ảnh. Những trang không có văn bản được đánh dấu trong danh sách theo từng trang.

Định dạng có được giữ lại không?

Không. Bạn nhận được văn bản thuần: chữ cái, chữ số và dấu xuống dòng. Phông chữ, màu sắc, ảnh và bố cục trang đều bị bỏ đi. Dòng được ngắt ở đúng chỗ như trong PDF, và một dòng trống được thêm vào nơi khoảng cách giữa hai dòng lớn hơn bình thường, chẳng hạn giữa các đoạn văn.

Làm sao để nối các dòng bị ngắt thành đoạn văn?

Hãy dán văn bản vào Xóa dấu xuống dòng. Công cụ đó nối các dòng bên trong mỗi đoạn, giữ nguyên các dòng trống giữa các đoạn và có thể sửa những từ bị ngắt bằng dấu gạch nối ở cuối dòng.

Vì sao một số đoạn chữ bị sai thứ tự hoặc bị tách thành những mảnh lạ?

Văn bản được xuất ra theo thứ tự PDF lưu nó, thường là thứ tự đọc nhưng không phải lúc nào cũng vậy. Bảng, trang có nhiều cột và PDF xuất từ phần mềm thiết kế có thể ra lộn xộn, và một số PDF lưu chữ thành từng mảnh không khớp với các từ bạn nhìn thấy.

Công cụ có dùng được với các ngôn ngữ khác ngoài tiếng Anh không?

Có. Văn bản được đọc ở dạng Unicode, nên chữ cái có dấu, chữ Kirin, chữ Hy Lạp, chữ Hindi, chữ Hán và các hệ chữ khác đều xuất ra được, miễn là PDF có lớp văn bản chuẩn. Nếu PDF dùng cách thiết lập phông chữ khác thường, việc sao chép sẽ cho ra ký tự lỗi trong bất kỳ chương trình nào; chạy OCR trên tệp đó thường là cách khắc phục.