Diễn Đàn » Hỏi Ðáp Tin Học

Nói rõ hơn về việc dùng VnDOCR

3 trả lời, 3.300 lượt xem — Trang 1 / 1
<Bài viết đã được chỉnh sửa lúc 2007-03-19 13:33:35ran_oo>
  Hiện tôi đang dùng bản VnDOCR 2.0 Demo, khả năng nhận dạng cũng tương đương so với các bản Demo 3.0 hoặc 4.0 hiện nay (đã dùng thử và so sánh). Điểm khác biệt là bản này cho phép copy văn bản đã nhận dạng và chỉ xuất ra văn bản với bảng mã TCVN-3 hoặc VNI-Windows (có thể chuyển sang mã Unicode dễ dàng).
Để thao tác cho nhanh, tôi dùng Clipboard của MS Word (12 hoặc 24 mục tùy phiên bản) để lưu các phần văn bản đã nhận dạng và copy rồi paste một lần (Paste All) vào Word để chỉnh sửa.
Bạn nào quan tâm có thể liên hệ với tôi để trao đổi thêm.

Link download và cách sử dụng xin xem ở cuối chủ đề này.

Bài viết về cách dùng macro ghép dòng trong MS Word:

http://vnthuquan.net/diendan/tm.aspx?m=255012
Đăng nhập để trả lời
0
Có thể share cho mình 1 bản xài thử được ko?
Cám ơn trước
Sách với ta là bạn, là thầy
Đăng nhập để trả lời
0
Links để download:
http://ultrashare.net/hosting/fl/f618d017ad
http://www.savefile.com/files/550213
Dung lượng file .ZIP: 3.18 MB.
Giải nén và chạy file Demo2.exe để cài đặt. Click OK khi chương trình đòi Disk 2.

Hướng dẫn cách dùng:
- Chạy chương trình, chọn Quét ảnh tại listbox Quét ảnh/Đọc ảnh. Click nút lệnh ngay bên trái để bắt đầu quét.
- Chọn máy scan tại hộp thoại tiếp theo.
- Tại trình quản lý scan, lưu ý thiết lập hai thông số (ở đây tôi dùng máy scan HP 4750C):
   + Độ sâu màu (Out Type): Black & White (1 bit);
   + Độ phân giải (Resolution): Tối ưu là 300 cho bản in/photo rõ và 400 cho bản tệ hơn.
- Chiều scan không quan trọng, có thể xoay ảnh +, - 90 độ hoặc 180 độ trong VnDOCR.
- Ta có thể scan nhiều trang vào một workspace (một file lưu trữ) bằng cách thực hiện liên tiếp lệnh Quét ảnh. Nếu dùng menu thì dãy phím là Alt+T+Q+Q. Tuy nhiên nên scan không quá 15 trang/file để đề phòng chương trình bị tràn bộ nhớ khi nhận dạng.
- Nên phân vùng nhận dạng "bằng tay", vì nếu để chương trình tự động phân vùng thì sẽ lung lung lên hết, sẽ khó copy văn bản.
- Nên xoay ảnh (nếu cần) rồi phân vùng một lượt và lưu workspace trước khi nhận dạng, nhằm đề phòng VnDOCR treo bất tử.
- Sau khi nhận dạng thì mỗi vùng được phân sẽ tương ứng với một textbox tại khu vực chứa văn bản. Ta có thể dùng Cilpboard của MS Word để copy theo thứ tự cho đến khi đầy Clipboard rồi sang Word để Paste All, xong lại Clear All để làm tiếp.
- Sau khi chuyển hết văn bản sang Word, ta sẽ dùng lệnh Find and Repalce để "dọn rác" và trước khi bắt đầu sửa lỗi sẽ nhanh hơn. Trong quá trình sửa lỗi, cũng nên sử dụng lệnh Find and Repalce để sửa nhanh các lỗi hay gặp.
Lưu ý 1: Theo mặc định, VnDOCR sẽ nhận dạng ra văn bản theo bảng mã TCVN-3, sẽ bị mất chữ ư khi copy vào Word. Do đó ta phải chỉnh lại bảng mã VNI trước khi nhận dạng. Cách làm: Vào menu Công cụ/Tuỳ chọn, chọn tab Ngôn ngữ. Tại mục Bảng mã kí tự Việt nam, chọn VNI. Click Đồng ý để đóng lại.
Lưu ý 2: Sau khi nhận dạng văn bản, VnDOCR sẽ xóa các phân vùng trên trang ảnh. Theo kinh nghiệm của tôi, nên lưu file sau khi phân vùng nhận dạng và không lưu sau khi nhận dạng xong. Lý do là việc phân vùng chính xác rất cực và lâu, còn chuyện nhận dạng thì không phải là chuyện của chúng ta, [:D].

Tạm thời bi nhiêu đi nghe, chúc các bạn thành công. Có vướng mắc gì cứ post lên, tôi sẽ cố gắng hết sức đễ giúp đỡ.
Thân ái.

Đính kèm: Giao diện VnDOCR 2.0


📎 VnDOCR
Đăng nhập để trả lời
0
Bạn viết: Sau khi nhận dạng thì mỗi vùng được phân sẽ tương ứng với một textbox tại khu vực chứa văn bản. Ta có thể dùng Cilpboard của MS Word để copy theo thứ tự cho đến khi đầy Clipboard rồi sang Word để Paste All, xong lại Clear All để làm tiếp
Xin bạn chỉ dẫn cách dùng này. Theo tôi hiểu, mỗi khi copy vào clipboard  (CTRL+C) thì những thứ lưu trứ trước đó bị thay thế bằng những số liệu mới, vậy thì làm sao mà copy liên tục được?
Xin chỉ bảo cho tôi thủ thuật này về địa chỉ [email=ngao@vnn.vn]ngao@vnn.vn[/email]
Cám ơn bạn!
Đăng nhập để trả lời
0