Tất cả hướng dẫn

Hướng dẫn sử dụng

OCR PDF

Mở công cụ

Về công cụ OCR — nhận dạng chữ trong PDF

OCR (Optical Character Recognition) là kỹ thuật nhận dạng chữ từ hình ảnh. Công cụ này đọc các trang PDF dạng ảnh scan và trích ra nội dung chữ, giúp bạn sao chép, tìm kiếm và chỉnh sửa thay vì phải gõ lại thủ công.

Tình huống quen thuộc: bạn được gửi một giáo trình scan 200 trang, cần trích vài đoạn để trích dẫn trong tiểu luận. Không có OCR thì chỉ còn cách gõ tay. Hoặc bạn có một tập tài liệu scan và cần tìm xem thuật ngữ nào đó xuất hiện ở trang nào — không có lớp văn bản thì chức năng tìm kiếm hoàn toàn vô dụng.

Công cụ dùng tesseract.js chạy trực tiếp trong trình duyệt, hỗ trợ tiếng Việt có dấu. Cũng như các công cụ PDF khác, tài liệu của bạn không được tải lên máy chủ nào.

Cách sử dụng

  1. 1Nạp tài liệu scan. Chọn file PDF dạng ảnh hoặc ảnh chụp trang tài liệu cần trích chữ.
  2. 2Chọn ngôn ngữ. Chọn đúng ngôn ngữ của tài liệu. Nhận dạng tiếng Việt cần bộ dữ liệu riêng để đọc đúng dấu thanh và dấu mũ.
  3. 3Chờ xử lý. Lần chạy đầu tiên cần tải bộ dữ liệu nhận dạng nên hơi lâu; các lần sau nhanh hơn nhờ trình duyệt đã lưu sẵn.
  4. 4Kiểm tra và sửa. Đọc lại kết quả và sửa các chỗ nhận nhầm. OCR không bao giờ chính xác tuyệt đối, đặc biệt với tài liệu chụp bằng điện thoại.

Kiến thức nền

Chất lượng ảnh quyết định kết quả

OCR hoạt động bằng cách so khớp hình dạng ký tự, nên đầu vào mờ, nghiêng hoặc thiếu sáng sẽ cho kết quả kém. Bản scan phẳng ở 300 DPI với nền trắng chữ đen cho độ chính xác cao nhất. Ảnh chụp điện thoại bị cong giấy, đổ bóng hoặc chụp chéo có thể sai nhiều.

Nếu kết quả tệ, cải thiện đầu vào thường hiệu quả hơn mọi thao tác khác: chụp lại thẳng góc dưới ánh sáng đều, hoặc scan lại ở độ phân giải cao hơn. Tăng độ tương phản trước khi chạy OCR cũng giúp ích rõ rệt với tài liệu ngả vàng.

Vì sao tiếng Việt khó hơn tiếng Anh

Tiếng Việt dùng dấu thanh và dấu phụ chồng lên nhau, tạo ra nhiều tổ hợp ký tự gần giống nhau về hình dạng. Khi ảnh mờ, hệ thống dễ nhầm giữa các chữ chỉ khác nhau ở một dấu nhỏ — nhầm dấu hỏi với dấu ngã là lỗi phổ biến nhất.

Vì vậy, chọn đúng ngôn ngữ tiếng Việt trước khi chạy là bắt buộc. Chạy với bộ dữ liệu tiếng Anh trên tài liệu tiếng Việt sẽ cho ra văn bản mất dấu hoàn toàn hoặc thay dấu bằng ký tự lạ.

Những nội dung OCR xử lý kém

Bảng biểu phức tạp thường bị mất cấu trúc: chữ vẫn ra đúng nhưng thứ tự đọc bị trộn giữa các cột. Công thức toán học, ký hiệu hóa học và chữ viết tay gần như không nhận dạng được bằng OCR thông thường.

Tài liệu nhiều cột như báo hoặc tạp chí cũng dễ bị đọc sai thứ tự, vì hệ thống có thể đọc ngang qua cả hai cột thay vì đọc hết cột trái rồi sang cột phải. Với những tài liệu này, hãy cắt riêng từng vùng rồi chạy OCR lần lượt.

Câu hỏi thường gặp

OCR có nhận dạng được tiếng Việt có dấu không?
Có. Bạn cần chọn ngôn ngữ tiếng Việt trước khi chạy để hệ thống dùng đúng bộ dữ liệu nhận dạng dấu.
Vì sao lần chạy đầu tiên lâu?
Trình duyệt cần tải bộ dữ liệu nhận dạng cho ngôn ngữ bạn chọn. Các lần sau sẽ nhanh hơn vì dữ liệu đã được lưu lại.
Độ chính xác của OCR là bao nhiêu?
Với bản scan rõ nét ở 300 DPI, độ chính xác thường rất cao. Với ảnh chụp điện thoại bị nghiêng hoặc thiếu sáng, tỷ lệ sai tăng đáng kể. Luôn nên đọc soát lại kết quả.
OCR có đọc được chữ viết tay không?
Gần như không. Công cụ được huấn luyện cho chữ in; chữ viết tay cần công nghệ khác và cho kết quả không đáng tin cậy.
Tài liệu của tôi có bị gửi lên máy chủ khi chạy OCR không?
Không. tesseract.js chạy hoàn toàn trong trình duyệt. Chỉ bộ dữ liệu nhận dạng được tải về máy bạn, còn tài liệu thì không đi đâu cả.

Sẵn sàng dùng thử?

Mọi công cụ của Stunexa đều miễn phí và dùng được ngay không cần đăng nhập.

Mở OCR PDF