Trích văn bản từ PDF
Lấy toàn bộ chữ trong file PDF ra dạng văn bản thuần, sao chép hoặc tải về file txt.
Kéo thả tệp PDF vào đây, hoặc bấm để chọn
Tệp được xử lý ngay trong trình duyệt, không tải lên máy chủ nào
Trích văn bản từ PDF là gì?
Lấy chữ ra khỏi PDF hay cần khi bạn muốn trích một đoạn để đưa vào tài liệu khác, đếm số từ, hay đơn giản là tìm kiếm cho nhanh trong một tập tài liệu dài. Bôi đen rồi sao chép trong phần mềm đọc PDF thường ra kết quả lộn xộn vì bố cục nhiều cột; công cụ này đọc thẳng lớp chữ trong file nên giữ đúng trình tự.
Có một điều phải hiểu trước khi dùng: PDF có hai loại rất khác nhau. Loại thứ nhất do phần mềm xuất ra và có sẵn lớp chữ bên trong — loại này lấy được toàn bộ. Loại thứ hai là bản quét, tức mỗi trang chỉ là một tấm ảnh chụp giấy, bên trong không hề có chữ nào. Với loại thứ hai, mọi công cụ trích văn bản đều trả về rỗng, và công cụ này sẽ nói rõ điều đó thay vì để bạn tưởng mình làm sai.
Hai tuỳ chọn nhỏ nhưng đáng để ý. Giữ xuống dòng phù hợp với thơ, hợp đồng, bảng biểu — những thứ mà vị trí ngắt dòng có ý nghĩa. Bỏ nó đi thì mỗi trang thành đoạn văn liền mạch, dễ đọc hơn với văn xuôi và tiện hơn khi đưa sang phần mềm khác.
Nhãn số trang chèn một dòng đánh dấu giữa các trang, rất tiện khi bạn cần đối chiếu ngược lại tài liệu gốc.
Cách sử dụng
- Chọn file PDF.
- Bật hoặc tắt giữ xuống dòng tuỳ loại tài liệu.
- Bật nhãn số trang nếu cần đối chiếu ngược lại bản gốc.
- Bấm trích văn bản.
- Sao chép trực tiếp, hoặc tải về dạng file txt.
Câu hỏi thường gặp
Vì sao kết quả trống trơn?
Gần như chắc chắn đây là bản quét: mỗi trang chỉ là một tấm ảnh, bên trong không có chữ nào để lấy. Muốn có chữ phải qua bước nhận dạng ký tự từ ảnh, việc đó cần mô hình nặng hàng chục MB nên không làm trong trình duyệt ở đây.
Vì sao thứ tự chữ bị lộn ở tài liệu nhiều cột?
Vì bên trong PDF không lưu khái niệm cột, chỉ lưu vị trí từng cụm chữ trên trang. Công cụ đọc theo trình tự ghi trong file, mà trình tự đó do phần mềm tạo file quyết định. Với bố cục phức tạp, đôi khi phải sắp lại tay.
Chữ tiếng Việt có ra đúng dấu không?
Có, nếu file dùng phông chuẩn và mã Unicode, tức hầu hết file hiện nay. Một số file rất cũ dùng bảng mã riêng thì có thể ra sai dấu — đó là vấn đề của chính file, không phải của công cụ.
File của tôi có bị gửi lên mạng không?
Không. Việc đọc chữ diễn ra bằng chính bộ hiển thị PDF của trình duyệt, ngay trên máy bạn. Có thể kiểm chứng bằng cách ngắt mạng sau khi trang đã tải xong — công cụ vẫn chạy.