Top 5 xu hướng OCR và xử lý tài liệu năm 2026 mà đội ngũ chúng tôi thấy đáng theo dõi gồm: OCR Việt-hoá bảng biểu, mô hình thị giác ngôn ngữ, trích xuất theo trường, xử lý ngay trên thiết bị và quy trình người-trong-vòng-lặp. Nhưng trước khi chọn xu hướng nào, bạn cần một bộ tiêu chí lọc riêng. Ba tuần vừa rồi chúng tôi nhận liền bốn cuộc gọi tương tự nhau: phòng kế toán hỏi OCR nào đọc hoá đơn tốt, bên nhân sự hỏi đưa hồ sơ lên cloud có an toàn không, còn đội vận hành thì cần số hoá hàng trăm tờ form giấy mỗi tuần. Cả bốn cuộc gọi đều bắt đầu bằng câu “bên em thấy quảng cáo bảo chính xác 99%”. Đó là lý do chúng tôi viết bài này.
Đừng chọn OCR theo quảng cáo — chọn theo 4 tiêu chí cụ thể
OCR (nói dễ hiểu là phần mềm “đọc” chữ trong ảnh hoặc bản scan rồi biến thành văn bản gõ được) là thứ mà hầu hết nhà cung cấp đều quảng cáo là chính xác gần như tuyệt đối. Con số đó thường được đo trên tài liệu in sạch, phông chuẩn, quét thẳng. Tài liệu thật của bạn hiếm khi như vậy.
Chúng tôi phân loại khách hàng thành ba nhóm hay hỏi nhất. Nhóm kế toán và mua hàng xử lý hoá đơn, phiếu chi, bảng kê ngân hàng. Nhóm nhân sự xử lý hồ sơ ứng viên, hợp đồng lao động, bảng chấm công chụp bằng điện thoại. Nhóm vận hành thì nhận form giấy đã scan ra PDF từ chi nhánh gửi về. Ba nhóm này cần ba thứ khác nhau, không dùng chung một tiêu chí chọn được.
Bốn tiêu chí lọc trước khi xem bảng giá
Thứ nhất là độ chính xác theo loại tài liệu. Một công cụ đọc hoá đơn tốt chưa chắc đọc được hợp đồng nhiều trang có đóng dấu chồng lên chữ. Bạn phải hỏi thẳng nhà cung cấp: kết quả 97% của anh đo trên loại giấy tờ nào.
Thứ hai là khả năng nhận dấu tiếng Việt. Đây là chỗ nhiều sản phẩm ngoại nhập yếu nhất. Chữ “ế”, “ộ”, “ẫ” khi bị mờ thường mất dấu hoàn toàn. Sai một dấu trong tên người trên hợp đồng là sai cả văn bản pháp lý.
Thứ ba là chi phí tính trên mỗi 1.000 trang. Cách tính này giúp bạn so sánh công bằng, vì có bên tính theo số trang, có bên tính theo số người dùng, có bên tính theo API call. Quy hết về 1.000 trang là ra con số thật.
Thứ tư là mức độ tự triển khai được. Nếu phải gọi kỹ sư nhà cung cấp mỗi lần đổi mẫu hoá đơn, chi phí ẩn sẽ lớn hơn phí thuê bao. Một công cụ cấu hình được bằng giao diện kéo thả thường đáng tiền hơn.
Cái gì chưa chắc thì phải test trên file của mình
Hai thứ gần như không có bảng thông số nào nói thật: độ chính xác trên bản scan mờ và chữ viết tay. Bản scan nghiêng 3-5 độ, có vệt mực, hoặc chụp qua kính bị loá — tỷ lệ đúng có thể tụt từ 95% xuống 60-70%. Chữ viết tay người Việt thì còn tệ hơn, nhất là khi viết tắt.
Nguyên tắc của chúng tôi rất đơn giản: đừng bao giờ ký hợp đồng dựa trên bản demo. Lấy 50 trang tệ nhất trong kho tài liệu của bạn, đưa cho nhà cung cấp chạy thử, rồi ngồi đếm lỗi bằng tay. Khoảng thời gian đó rẻ hơn nhiều so với một năm trả phí cho công cụ không dùng được.
Xu hướng 1: OCR đa ngôn ngữ “Việt-hoá” bảng biểu và hoá đơn
Đây là xu hướng có nhu cầu lớn nhất ở thị trường Việt Nam, và cũng là thứ chúng tôi thấy tiến bộ rõ rệt nhất trong hai năm qua. Lý do rất thực tế: hoá đơn Việt Nam nhiều cột, có dấu, đóng dấu đỏ, và thường bị scan nghiêng vì đặt lệch trên máy photocopy.
Các mô hình mới không còn đọc từng ký tự rồi ghép lại. Chúng nhận diện cả cấu trúc bảng: đâu là dòng tiêu đề, đâu là cột thành tiền, đâu là ô gộp. Với người dùng cuối, kết quả khác biệt rõ nhất là file Excel xuất ra giữ đúng số cột thay vì đổ thành một khối chữ.
Nhóm phù hợp nhất với xu hướng này là kế toán, mua hàng và đội nhập liệu khối lượng lớn — những người mỗi ngày phải gõ lại vài trăm dòng từ hoá đơn giấy.
Nhưng hạn chế thật thì phải nói thẳng. Bảng có ô gộp phức tạp, hoặc chữ có dấu bị mất nét khi scan ảnh mờ, vẫn cho ra kết quả sai. Bước kiểm tra của người chưa bỏ được. Chúng tôi từng thấy một lô 40 hoá đơn xuất ra Excel đúng cấu trúc nhưng lệch cột VAT ở bảy tờ — nếu không có người dò lại thì sai cả bảng kê thuế.
Một mẹo nhỏ từ kinh nghiệm: trước khi đưa vào OCR, hãy để phần mềm tự xoay ảnh về phương thẳng đứng. Chỉ riêng bước tiền xử lý này đã cải thiện tỷ lệ đúng đáng kể với hoá đơn chụp bằng điện thoại.
Xu hướng 2: Mô hình thị giác ngôn ngữ (VLM) đọc cả trang thay vì từng ký tự
VLM — viết đầy đủ là mô hình thị giác ngôn ngữ, hiểu ngắn gọn là AI vừa “nhìn” ảnh vừa “hiểu” chữ, giống cách con người nhìn một tờ giấy và nắm được ý nghĩa chứ không chỉ từng con chữ. Cách tiếp cận này khác hẳn OCR truyền thống ở chỗ nó xử lý được layout lộn xộn.
Hình dung thế này: một phiếu thu chụp bằng điện thoại, đặt trên bàn có lót tờ giấy khác lộ ra một góc, chữ viết tay chồng lên chữ in, ảnh hơi nghiêng. OCR truyền thống thường lúng túng vì nó cần biết vùng nào là vùng chữ. VLM đọc cả trang và tự suy ra đâu là nội dung chính, đâu là nền.
Nhóm phù hợp nhất là đội vận hành nhận ảnh chụp từ Zalo hoặc email thay vì bản scan chuẩn. Đây là tình huống rất phổ biến ở các chuỗi cửa hàng, nơi nhân viên chi nhánh chụp bill rồi gửi vào nhóm chat.
Hạn chế thật cần cân nhắc trước khi đầu tư. Chi phí suy luận của VLM cao hơn OCR truyền thống nhiều lần, vì mỗi trang phải đưa qua một mô hình lớn. Nó cũng khó kiểm soát khi bạn cần trích đúng một trường cụ thể — ví dụ chỉ lấy mã số thuế trên hoá đơn — vì mô hình có xu hướng “diễn giải” thay vì trích nguyên văn.
Chúng tôi thường khuyên khách đặt VLM ở vai trò bước “đọc hiểu” phía trước, không thay hoàn toàn OCR. Cách làm hiệu quả là dùng VLM phân loại và bóc tách thô, rồi để OCR hoặc rule trích xuất chuẩn hoá lại các trường quan trọng.
Xu hướng 3: Trích xuất theo trường (field extraction) thay vì đổ cả khối text
Đây là xu hướng mà chúng tôi đánh giá là đáng tiền nhất cho doanh nghiệp đã có sẵn hệ thống nhập liệu. Mục tiêu cuối cùng của xử lý tài liệu không phải là giữ một file text cho đẹp, mà là đẩy dữ liệu vào phần mềm kế toán, phần mềm quản lý bán hàng hoặc hệ thống ERP.
Trích xuất theo trường nghĩa là thay vì đổ ra một khối chữ, công cụ trả về đúng từng ô: số hoá đơn, ngày phát hành, tên đơn vị, mã số thuế, tiền hàng, tiền thuế, tổng cộng. Mỗi trường có một điểm tin cậy riêng, để bạn biết trường nào nên tin và trường nào cần người kiểm.
Với doanh nghiệp đã có hệ thống, đây là bước quyết định. Dữ liệu khớp trường sẵn thì đẩy thẳng vào hệ thống qua API; không khớp thì nhân viên phải copy tay, coi như công OCR bỏ đi.
Hạn chế thật nằm ở công setup ban đầu. Mỗi loại chứng từ phải cấu hình riêng: hoá đơn điện tử một kiểu, phiếu thu một kiểu, hợp đồng một kiểu. Khi nhà cung cấp đổi mẫu hoá đơn, bạn phải chỉnh lại cấu hình trường.
Chúng tôi thường tính khoảng 3-5 ngày công để cấu hình trọn vẹn cho một loại chứng từ chủ lực, và khoảng nửa ngày mỗi lần mẫu chứng từ thay đổi. Khoản này cần đưa vào ngân sách ngay từ đầu, đừng để phát sinh rồi mới tính.
Xu hướng 4: Xử lý ngay trên thiết bị (on-device) cho dữ liệu nhạy cảm
Số hoá tài liệu nhân sự và hợp đồng có một rào cản không nằm ở kỹ thuật: nhiều doanh nghiệp không được phép đưa dữ liệu ra cloud nước ngoài. Đó là lý do xu hướng xử lý ngay trên thiết bị ngày càng được hỏi nhiều.
On-device hiểu đơn giản là mô hình OCR chạy ngay trên máy tính hoặc điện thoại của bạn, không gửi ảnh lên server nào. Ảnh không rời khỏi máy, nghĩa là không có khả năng rò rỉ qua đường truyền.
Nhóm phù hợp nhất rõ ràng là nhân sự, pháp chế và y tế. Đây là nơi hồ sơ cá nhân, hợp đồng lao động, bệnh án không nên rời khỏi máy dù chỉ để xử lý tạm.
Hạn chế thật thì khá rõ. Máy yếu sẽ chạy chậm, nhất là với laptop văn phòng cấu hình thấp. Dung lượng mô hình bị giới hạn nên độ chính xác thấp hơn bản cloud — chấp nhận đánh đổi. Xu hướng này cũng không phù hợp khi bạn cần đổ hàng nghìn trang một lúc; nó sinh ra cho tài liệu nhỏ, chậm mà kín.
Kinh nghiệm của chúng tôi khi thử nghiệm: với tài liệu nhân sự cá nhân, xử lý trên máy thường chậm hơn cloud khoảng 3-5 lần, nhưng bù lại bạn không phải lo câu hỏi “dữ liệu này đi đâu”.
Xu hướng 5: Quy trình người-trong-vòng-lặp (human-in-the-loop) có ngưỡng tin cậy
Xu hướng cuối cùng là thứ ít được quảng cáo nhất nhưng lại là điều kiện để đưa OCR vào vận hành thật. Người-trong-vòng-lặp nghĩa là máy làm phần lớn, người kiểm phần còn lại, và có ngưỡng tin cậy để quyết định cái gì được tự động duyệt.
Ví dụ dễ hiểu: nếu trường “số tiền” có điểm tin cậy 0,98, hệ thống cho qua luôn. Nếu điểm tin cậy 0,72, nó đẩy vào hàng chờ để nhân viên xem lại. Ngưỡng này bạn tự đặt, tùy mức rủi ro chấp nhận được của từng loại chứng từ.
Nhóm phù hợp nhất là mọi đội đang chuẩn bị thay công nhập liệu thủ công bằng bán tự động. Không có ngưỡng tin cậy, bạn sẽ rơi vào hai thái cực: hoặc kiểm tra lại hết (không tiết kiệm được gì), hoặc tin máy hoàn toàn (lỗi âm thầm, nguy hiểm hơn).
Hạn chế thật: nếu không đặt ngưỡng rõ, người kiểm tra lại thành nút thắt mới. Chúng tôi từng chứng kiến một phòng kế toán dựng quy trình OCR nhưng vẫn phải kiểm 100% tài liệu, cuối cùng tốn công hơn cả gõ tay vì phải mở thêm một cửa sổ để đối chiếu. Chỉnh ngưỡng theo loại chứng từ là việc phải làm định kỳ, không phải làm một lần rồi bỏ.
Bảng so sánh nhanh: 5 xu hướng theo chi phí, độ chính xác kỳ vọng và độ khó triển khai
Danh sách dưới đây tổng hợp lại để bạn dễ hình dung. Mức chi phí chỉ mang tính tham chiếu — bạn phải tự đo bằng chính bộ tài liệu của mình, vì độ phức tạp tài liệu ảnh hưởng lớn tới số cuối cùng.
- OCR Việt-hoá bảng biểu: chi phí thấp, phổ biến nhất, dễ tìm nhà cung cấp trong nước. Độ khó triển khai thấp, gần như cắm là chạy. Thời gian ra kết quả đầu tiên: vài giờ tới một ngày. Phù hợp cá nhân, shop nhỏ, phòng ban đơn lẻ.
- VLM đọc cả trang: chi phí cao, có thể gấp 5-10 lần OCR thường tùy mô hình. Độ khó trung bình, cần hiểu cách gọi API. Thời gian ra kết quả đầu tiên: một tới ba ngày. Phù hợp doanh nghiệp có khối lượng tài liệu “bẩn” lớn và ngân sách rộng.
- Trích xuất theo trường: chi phí trung bình, cộng thêm chi phí setup ban đầu. Độ khó cao vì phải cấu hình từng mẫu chứng từ. Thời gian ra kết quả đầu tiên: một tới hai tuần cho một loại chứng từ. Phù hợp doanh nghiệp đã có hệ thống kế toán, ERP cần khớp trường.
- Xử lý trên thiết bị: chi phí thấp về phí dịch vụ, cao về yêu cầu cấu hình máy. Độ khó trung bình tới cao. Thời gian ra kết quả đầu tiên: vài ngày nếu có kỹ thuật nội bộ. Phù hợp nhân sự, pháp chế, y tế — nơi dữ liệu không được rời máy.
- Người-trong-vòng-lặp có ngưỡng: không tốn thêm phí công cụ, tốn giờ công người kiểm. Độ khó thấp về kỹ thuật, cao về thiết kế quy trình. Thời gian ra kết quả đầu tiên: có thể chạy ngay trong tuần đầu. Phù hợp mọi đội muốn tiết kiệm nhập liệu mà không mất kiểm soát.
Cách đọc danh sách khá đơn giản. Nếu bạn chỉ cần số hoá để lưu trữ, tra cứu lại khi cần, hãy chọn hướng rẻ — OCR Việt-hoá là đủ. Nếu bạn cần dữ liệu có cấu trúc để đẩy vào phần mềm, bắt buộc phải đi qua trích xuất theo trường, và phải chấp nhận chi phí setup.
Những sai lầm phổ biến khiến dự án OCR đội chi phí
Sai lầm đầu tiên và nặng nhất là kỳ vọng OCR tự động 100% rồi bỏ luôn bước kiểm tra. Không có công cụ nào đạt mức đó trên tài liệu thật. Bỏ bước kiểm tra nghĩa là bạn chuyển từ lỗi nhìn thấy được sang lỗi âm thầm, và loại lỗi này chỉ lộ ra khi cơ quan thuế hoặc kiểm toán hỏi.
Sai lầm thứ hai là không tách “số hoá để lưu” và “trích xuất để nhập liệu” thành hai bài toán riêng. Hai bài toán này có tiêu chí chọn công cụ khác nhau, ngân sách khác nhau, và độ chính xác yêu cầu khác nhau. Gộp lại thường dẫn tới chọn công cụ thừa tính năng nhưng thiếu độ chính xác ở chỗ cần.
Sai lầm thứ ba là chỉ test trên mẫu đẹp. Bản demo lúc nào cũng đẹp. Đến lúc gặp bản scan nghiêng hoặc mờ, tỷ lệ đúng tụt mạnh và đội vận hành mất niềm tin vào cả dự án.
Sai lầm thứ tư là đo bằng “cảm giác nhanh” thay vì đo bằng số. Cách đo đúng là đếm số trang xử lý mỗi phút và tỷ lệ lỗi trên một mẫu 100 trang cố định. Có số rồi mới so sánh được giữa các phương án, và mới biết cải tiến nào thật sự có tác dụng.
Cách tự đánh giá trong một tuần trước khi cam kết với nhà cung cấp
Chúng tôi luôn đề nghị khách làm bước này trước khi ký bất cứ hợp đồng nào. Một tuần đánh giá đủ để tránh một năm trả phí sai.
Ngày đầu, lấy 100-200 trang đại diện cho toàn bộ kho tài liệu. Phải đủ loại chứng từ và đủ kiểu scan, đặc biệt phải cố tình nhét vào vài bản mờ hoặc nghiêng. Mẫu toàn giấy đẹp thì không nói lên điều gì.
Ngày thứ hai và thứ ba, cho từng nhà cung cấp chạy trên đúng bộ mẫu đó. Chấm hai chỉ số: tỷ lệ trường trích đúng và thời gian người sửa lại mỗi trang. Chỉ số thứ hai quan trọng không kém chỉ số thứ nhất, vì một công cụ chính xác 90% nhưng sửa nhanh sẽ tốt hơn công cụ 95% nhưng giao diện sửa rối rắm.
Ngày thứ tư và thứ năm, quy đổi ra tiền. Tổng chi phí bằng phí dịch vụ cộng giờ công sửa lỗi. Nhiều bên báo giá rẻ nhưng tốn giờ sửa lại thì tính ra đắt hơn hẳn. Ngày cuối cùng, đối chiếu với tiêu chí đánh giá chung cho nhóm phần mềm xử lý tài liệu trước khi chốt — bạn có thể xem qua các tiêu chí đánh giá phần mềm quan trọng để có khung so sánh nhất quán.
Nếu trong đội có người làm kỹ thuật, hãy đưa bộ mẫu đó chạy thử thêm một phương án mã nguồn mở tự triển khai, rồi so với phương án thuê dịch vụ. Chi phí thời gian ban đầu của phương án tự làm thường bị đánh giá thấp, nhưng về dài hạn nó cho bạn quyền kiểm soát dữ liệu và không phụ thuộc nhà cung cấp.
Việc chuyển từ nhập liệu tay sang bán tự động cũng là một dạng chuyển đổi số quy mô nhỏ. Đội ngũ từng làm lộ trình chuyển đổi số ứng dụng AI để cắt chi phí vận hành cho vài khách hàng, và bài học chung vẫn là: đo trước, làm sau. Nếu bạn muốn hình dung một quy trình tương tự nhưng ở mảng khác, bài về AI agent tự động hoá tác vụ cho doanh nghiệp cũng đi theo nguyên tắc người-trong-vòng-lặp như ở đây.
Một đơn vị làm về đào tạo công nghệ mà chúng tôi từng giới thiệu cho khách, Khoa Phạm, có các khoá lập trình cho người mới — hữu ích nếu đội bạn muốn tự đọc hiểu API và viết script xử lý tài liệu sau này. Còn nếu bạn đang cân nhắc phương án thuê ngoài để tự động hoá những việc lặp lại quanh khâu nhập liệu, kể cả việc ghép nối với lập trình phần mềm theo yêu cầu, thì đừng quên tính cả chi phí bảo trì hằng năm vào bài toán tổng. Nhiều nơi chỉ tính chi phí làm lần đầu rồi bị động khi phải sửa mẫu chứng từ.
Câu hỏi thường gặp
OCR tiếng Việt năm 2026 đã đọc đúng hoá đơn có dấu chưa?
Đã tốt hơn nhiều so với vài năm trước, đặc biệt với hoá đơn điện tử in sạch. Nhưng với hoá đơn giấy bị scan mờ hoặc chụp nghiêng, tỷ lệ đúng vẫn có thể giảm mạnh ở các chữ có dấu như “ế”, “ộ”, “ẫ”. Bạn vẫn nên giữ bước kiểm tra người cho những trường quan trọng như mã số thuế và số tiền.
Nên chọn OCR trên cloud hay trên thiết bị cho hồ sơ nhân sự?
Nếu có điều kiện quy định về bảo mật dữ liệu cá nhân, hãy chọn on-device cho hồ sơ nhân sự. Nếu khối lượng hồ sơ lớn và yêu cầu bảo mật không gắt, cloud cho tốc độ nhanh hơn đáng kể. Một số đơn vị chọn cách dung hoà: tài liệu thường xử lý trên cloud, tài liệu nhạy cảm đẩy sang máy nội bộ.
Chi phí xử lý tài liệu bằng OCR tính theo trang khoảng bao nhiêu?
Không có một con số chung, vì phụ thuộc loại tài liệu, ngôn ngữ và mức độ cần trích xuất. Cách tính đúng là quy hết về 1.000 trang và cộng thêm giờ công sửa lỗi. Nhiều bên báo giá theo người dùng hoặc theo gói tháng, phải quy đổi cẩn thận mới so sánh được.
OCR có thay thế được nhân viên nhập liệu hoàn toàn không?
Chưa, và chúng tôi cho rằng trong vài năm tới vẫn vậy. Nó thay được phần lớn thao tác gõ lại, nhưng cần người kiểm ở những chỗ rủi ro cao. Mục tiêu thực tế là giảm số nhân sự cần thiết cho mỗi lô tài liệu, không phải xoá bỏ hoàn toàn vai trò nhập liệu.
Tự làm OCR bằng công cụ mã nguồn mở có đủ dùng cho doanh nghiệp nhỏ không?
Đủ dùng nếu nhu cầu chủ yếu là số hoá để lưu trữ và tài liệu khá chuẩn. Với hoá đơn phức tạp hoặc cần trích xuất trường chuẩn để đẩy vào phần mềm, bạn sẽ tốn kha khá thời gian để tinh chỉnh. Hãy tính chi phí thời gian đó trước khi so sánh với phương án thuê dịch vụ.
Nếu bạn chỉ đọc được một điều từ bài này, hãy là điều này: đừng chọn công cụ theo con số quảng cáo, hãy chọn theo 100 trang tài liệu tệ nhất của chính bạn. Bỏ ra một tuần đo lường ngay bây giờ sẽ rẻ hơn rất nhiều so với việc cả năm sau phải ngồi sửa lỗi lặng lẽ. Bắt đầu bằng việc gom mẫu, chấm điểm hai chỉ số, rồi mới gọi nhà cung cấp. Khi đã có số trong tay, mọi cuộc đàm phán của bạn sẽ khác hẳn.
