Kế hoạch miễn phí: 1 chuyển đổi/ giờ, 1 tập tin mỗi lần
Không giới hạn →

PDF OCR

Trích xuất văn bản từ các tệp PDF đã quét

Chọn tập tin của bạn

*Các tệp bị xóa sau 24 giờ

Chuyển đổi miễn phí các tập tin có dung lượng lên đến 1 GB, người dùng Pro có thể chuyển đổi các tập tin lên đến 100 GB; Đăng ký ngay!

Đang tải lên

0%

Cách OCR PDF

1 Tải lên PDF documents đã quét; một bản quét màu xám 300 DPI sạch sẽ cho phép người nhận diện làm việc nhiều nhất.
2 Nói cho nó biết ngôn ngữ nào để mong đợi — đặt tên ngôn ngữ đánh bại để nó đoán trước một khoảng cách rộng.
3 Chạy quá trình nhận dạng; các từ được viết lại như một lớp vô hình nằm trên hình ảnh trang gốc.
4 Tải về tập tin PDF có thể tìm kiếm — nó trông giống nhau, nhưng bây giờ bạn có thể tìm kiếm và chọn văn bản trong nó.

PDF OCR Câu hỏi thường gặp

Định dạng nguồn có ảnh hưởng đến việc nhận dạng không?
+
Nó có. PDF sửa trang: phông chữ, vector, hình ảnh raster và tọa độ văn bản được đóng băng để mọi người đọc thấy bảng bố trí giống nhau. Cách trang được lưu giữ quyết định độ phân giải và thông tin màu nào mà bộ nhận diện phải làm việc với.
Đúng — PDF là đồ thị đối tượng, không phải là hình ảnh trang, vì vậy văn bản vẫn có thể chọn và vector vẫn sắc nét dù có gì xảy ra với nội dung raster bên trong nó. Nó ảnh hưởng đến những gì người nhận dạng có thể thấy.
Concretely, mỗi trang được hiển thị, chạy qua một Tesseract văn bản nhận dạng đi qua hơn 100 ngôn ngữ, và các từ được nhận ra được viết lại như một lớp văn bản vô hình đặt trên hình ảnh gốc — vì vậy trang trông không thay đổi nhưng có thể tìm kiếm và chọn. The page still looks exactly as it did — the recognised text sits invisibly behind the image so search and selection work without changing the appearance.
Hơn 100, bao gồm Latin, Cyrillic, Greek, Arabic, Hebrew, Chinese, Japanese, Korean và Indian scripts. Nói cho nó biết ngôn ngữ nào để mong đợi sẽ cải thiện chính xác hơn là để nó đoán.
Các đường nét, liên kết nội bộ và ghi chú được giữ lại bất cứ khi nào thao tác cho phép. Chữ ký số là ngoại lệ: bất kỳ thay đổi nào vào tập tin đều làm hỏng chữ ký, vì đó chính xác là mục đích của chữ ký.
Mọi PDF tiêu chuẩn, bao gồm những tập tin được tạo bởi máy quét, trình xử lý văn bản hay trình điều khiển in. Tập tin có mật khẩu chủ chỉ hạn chế sửa đổi sẽ được xử lý; tập tin cần mật khẩu người dùng để mở không được xử lý, và chúng tôi không cố gắng phá mã hóa.
Có: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. PDF quét là thứ thường xuyên vượt quá nó, và nén tài liệu trước thường là đủ để mang nó trở lại dưới.
Văn bản và tranh vectơ là các đối tượng chứ không phải điểm ảnh, vì vậy chúng vẫn giữ được độ sắc nét hoàn hảo khi phóng to bất kỳ dù có chuyện gì xảy ra. Chỉ có hình ảnh raster nhúng có thể bị giảm chất lượng, và chỉ khi thao tác bạn chọn lấy mẫu lại chúng.
WEBP.to được xây dựng xung quanh sự thay thế hiện đại cho cả hai mặc định cũ: một định dạng làm mất, không mất, alpha và hoạt hình, và đáng tin cậy đất nhỏ hơn JPEG hoặc PNG nó đến từ. Người ta đến đây sau khi quyết định rằng các mặc định cũ đang tốn băng thông, và quyết định đó ngay lập tức làm tăng phần còn lại: kích thước, chất lượng, điều gì xảy ra với độ trong suốt. OCR PDF là trên cùng một tải lên và cùng một tài khoản để những câu hỏi đó được trả lời ở một nơi.
Phần mềm chuyển đổi trên trang web này chuyển ảnh từ và sang WebP, PNG, JPG và AVIF, nơi bạn quyết định liệu một tập tin nhỏ hơn có đáng để mất các trình duyệt cũ. Làm theo thứ tự đó là quan trọng: chọn pixel trước và container sau đó, vì container là quyết định rẻ và pixel là quyết định đắt.
Các động cơ là giống nhau — cùng thư viện, cùng người làm việc, cùng chữ cái. Điều khác biệt là ý kiến gắn liền, và ý kiến ở đây dựa trên một tính chất của định dạng này được đặt tên sau: cùng một phần mở rộng.webp có thể chứa một khung VP8 mất, một khung không mất, hoặc một hoạt hình, vì vậy đường dẫn xử lý hợp lý được quyết định theo tập tin thay vì theo phần mở rộng.
Không có tài khoản, và không gì được giữ lại: các tập tin tải lên sẽ bị xóa khỏi các máy làm việc ngay sau khi công việc kết thúc, và không có gì được kiểm tra, liệt kê hay chỉ mục. Các tài khoản chỉ tồn tại cho lịch sử và kích thước gói.

Đánh giá công cụ này
5.0/5 - 0 phiếu bầu
Nhà xuất bản NXB.com. - 800+ tên miền. Tìm tên hoàn hảo của bạn.
Hoặc tải tệp của bạn lên đây