1Tải lên PDF documents đã quét; một bản quét màu xám 300 DPI sạch sẽ cho phép người nhận diện làm việc nhiều nhất.
2Nói cho nó biết ngôn ngữ nào để mong đợi — đặt tên ngôn ngữ đánh bại để nó đoán trước một khoảng cách rộng.
3Chạy quá trình nhận dạng; các từ được viết lại như một lớp vô hình nằm trên hình ảnh trang gốc.
4Tải về tập tin PDF có thể tìm kiếm — nó trông giống nhau, nhưng bây giờ bạn có thể tìm kiếm và chọn văn bản trong nó.
PDF OCR Câu hỏi thường gặp
Định dạng nguồn có ảnh hưởng đến việc nhận dạng không?
+
Nó có. PDF sửa trang: phông chữ, vector, hình ảnh raster và tọa độ văn bản được đóng băng để mọi người đọc thấy bảng bố trí giống nhau. Cách trang được lưu giữ quyết định độ phân giải và thông tin màu nào mà bộ nhận diện phải làm việc với.
Có gì đặc biệt về PDF ở đây không?
+
Đúng — PDF là đồ thị đối tượng, không phải là hình ảnh trang, vì vậy văn bản vẫn có thể chọn và vector vẫn sắc nét dù có gì xảy ra với nội dung raster bên trong nó. Nó ảnh hưởng đến những gì người nhận dạng có thể thấy.
Làm thế nào OCR PDF chuyển đổi một bản scan thành văn bản?
+
Concretely, mỗi trang được hiển thị, chạy qua một Tesseract văn bản nhận dạng đi qua hơn 100 ngôn ngữ, và các từ được nhận ra được viết lại như một lớp văn bản vô hình đặt trên hình ảnh gốc — vì vậy trang trông không thay đổi nhưng có thể tìm kiếm và chọn. The page still looks exactly as it did — the recognised text sits invisibly behind the image so search and selection work without changing the appearance.
Nó có thể nhận ra ngôn ngữ nào?
+
Hơn 100, bao gồm Latin, Cyrillic, Greek, Arabic, Hebrew, Chinese, Japanese, Korean và Indian scripts. Nói cho nó biết ngôn ngữ nào để mong đợi sẽ cải thiện chính xác hơn là để nó đoán.
Đánh dấu, liên kết và các ô biểu mẫu có còn tồn tại không?
+
Các đường nét, liên kết nội bộ và ghi chú được giữ lại bất cứ khi nào thao tác cho phép. Chữ ký số là ngoại lệ: bất kỳ thay đổi nào vào tập tin đều làm hỏng chữ ký, vì đó chính xác là mục đích của chữ ký.
Tôi có thể tải lên OCR PDF những gì?
+
Mọi PDF tiêu chuẩn, bao gồm những tập tin được tạo bởi máy quét, trình xử lý văn bản hay trình điều khiển in. Tập tin có mật khẩu chủ chỉ hạn chế sửa đổi sẽ được xử lý; tập tin cần mật khẩu người dùng để mở không được xử lý, và chúng tôi không cố gắng phá mã hóa.
Có giới hạn kích thước tập tin trên OCR PDF không?
+
Có: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the work. PDF quét là thứ thường xuyên vượt quá nó, và nén tài liệu trước thường là đủ để mang nó trở lại dưới.
OCR PDF sẽ làm giảm chất lượng PDF documents của tôi không?
+
Văn bản và tranh vectơ là các đối tượng chứ không phải điểm ảnh, vì vậy chúng vẫn giữ được độ sắc nét hoàn hảo khi phóng to bất kỳ dù có chuyện gì xảy ra. Chỉ có hình ảnh raster nhúng có thể bị giảm chất lượng, và chỉ khi thao tác bạn chọn lấy mẫu lại chúng.
Tại sao một trang web hiện đại lại chạy OCR PDF?
+
WEBP.to được xây dựng xung quanh sự thay thế hiện đại cho cả hai mặc định cũ: một định dạng làm mất, không mất, alpha và hoạt hình, và đáng tin cậy đất nhỏ hơn JPEG hoặc PNG nó đến từ. Người ta đến đây sau khi quyết định rằng các mặc định cũ đang tốn băng thông, và quyết định đó ngay lập tức làm tăng phần còn lại: kích thước, chất lượng, điều gì xảy ra với độ trong suốt. OCR PDF là trên cùng một tải lên và cùng một tài khoản để những câu hỏi đó được trả lời ở một nơi.
Sau khi OCR PDF chạy xong, điều gì đáng làm tiếp theo?
+
Phần mềm chuyển đổi trên trang web này chuyển ảnh từ và sang WebP, PNG, JPG và AVIF, nơi bạn quyết định liệu một tập tin nhỏ hơn có đáng để mất các trình duyệt cũ. Làm theo thứ tự đó là quan trọng: chọn pixel trước và container sau đó, vì container là quyết định rẻ và pixel là quyết định đắt.
Các trang web anh em có khác nhau không?
+
Các động cơ là giống nhau — cùng thư viện, cùng người làm việc, cùng chữ cái. Điều khác biệt là ý kiến gắn liền, và ý kiến ở đây dựa trên một tính chất của định dạng này được đặt tên sau: cùng một phần mở rộng.webp có thể chứa một khung VP8 mất, một khung không mất, hoặc một hoạt hình, vì vậy đường dẫn xử lý hợp lý được quyết định theo tập tin thay vì theo phần mở rộng.
Thế chuyện gì xảy ra với hồ sơ của tôi, và có cần phải có tài khoản không?
+
Không có tài khoản, và không gì được giữ lại: các tập tin tải lên sẽ bị xóa khỏi các máy làm việc ngay sau khi công việc kết thúc, và không có gì được kiểm tra, liệt kê hay chỉ mục. Các tài khoản chỉ tồn tại cho lịch sử và kích thước gói.