Make in Vietnam

Công bố nghiên cứu nhận diện thông minh của Việt Nam tại Hội nghị IDCAR

PV 19:59 25/09/2023

Trung tâm Không gian mạng Viettel (Viettel Cyberspace) đã công bố kết quả nghiên cứu khoa học tại IDCAR lần thứ 17, hội nghị hàng đầu thế giới về phân tích và nhận dạng tài liệu tại Hoa Kỳ.

screenshot-2023-09-25-at-19.13.30(1).png
Anh Trần Tuấn Anh, Kỹ sư chính AI, Trưởng nhóm nghiên cứu công nghệ OCR, Viettel Cyberspace đại diện nhóm tác giả tham gia hội nghị (thứ ba từ trái sang).

Năm 2023, hội nghị ICDAR (International Conference on Document Analysis and Recognition) lần thứ 17 được tổ chức tại California, Hoa Kỳ với sự tham dự của nhiều chuyên gia cấp cao đến từ các tổ chức hàng đầu về nghiên cứu AI trong lĩnh vực xử lý ảnh tài liệu như Google Research, Microsoft Research, Adobe, Naver, CASIA, Wacom, Goodnote… Viettel là đơn vị duy nhất của Việt Nam với đội ngũ nghiên cứu hoàn toàn trong nước có thành viên tham dự và trình bày nghiên cứu tại hội nghị này.

Nghiên cứu của Viettel Cyberspace tập trung cải thiện hiệu suất nhận diện cấu trúc bảng trong ảnh tài liệu, đặc biệt là với những bảng có cấu trúc phức tạp.

Trích xuất thông tin trong bảng biểu thuộc ảnh tài liệu đang là bài toán rất thách thức do cấu trúc đọc khác biệt với dữ liệu đoạn văn thông thường, trong khi thông tin của bảng lại mang nhiều ý nghĩa quan trọng, nhất là trong các lĩnh vực tài chính, ngân hàng, bảo hiểm.

Công nghệ này hiện đang được ứng dụng trong Viettel Intelligent Document Processing (Viettel IDP), thuộc hệ sinh thái sản phẩm Viettel AI, cho phép chuyển đổi không chỉ chữ mà cả bảng biểu từ dạng hình ảnh sang định dạng có thể chỉnh sửa được như Excel, Word với độ chính xác cao.

Điểm khác biệt của Viettel IDP là xem bảng biểu là một thực thể quan trọng trong ảnh tài liệu để trích xuất toàn bộ thông tin, thay vì chỉ coi là một đối tượng ảnh thông thường. Công nghệ này được coi là một trong những thành phần cốt lõi trong xây dựng công cụ chuyển đổi số (CĐS) và tìm kiếm thông tin thông minh.

screenshot-2023-09-25-at-19.13.05.png
Các sản phẩm thuộc hệ sinh thái Viettel AI liên tục được nâng cấp, ứng dụng công nghệ mới.

Ông Nguyễn Mạnh Quý, Giám đốc Viettel Cyberspace chia sẻ, đơn vị này luôn đề cao nghiên cứu công nghệ gắn liền với ứng dụng thực tiễn. Với các công nghệ lõi trong lĩnh vực trí tuệ nhân tạo (AI), chúng tôi xác định mục tiêu không ngừng nghiên cứu, tìm tòi và phát triển các phương pháp, thuật toán mới.

Từ đó, liên tục ứng dụng nâng cấp chất lượng của các sản phẩm, dịch vụ trong hệ sinh thái Viettel AI, hỗ trợ hiệu quả cho quá trình chuyển đổi số của các tổ chức, doanh nghiệp và chính phủ.

ICDAR thuộc top 14,55% hội nghị uy tín nhất thế giới về AI trong số các hội nghị được xếp hạng. Đây là sự kiện quốc tế hàng đầu dành cho các nhà khoa học, kỹ sư về phân tích và nhận dạng tài liệu, một lĩnh vực ngày càng quan trọng trong thời đại chuyển đổi số hiện nay.

Các nghiên cứu khoa học sẽ phải vượt qua nhiều vòng thẩm định vô danh khắt khe từ hội đồng chuyên gia đến từ nhiều quốc gia trên thế giới. Hội nghị được tổ chức 2 năm một lần, trung bình có khoảng 30% nghiên cứu được chấp nhận mỗi năm.

Viettel Cyberspace hiện cung cấp hệ sinh thái sản phẩm Viettel AI gồm 5 dòng sản phẩm: Nền tảng AI, Nền tảng quản trị và phân tích dữ liệu, nền tảng trợ lý ảo, nền tảng Robot thông minh và nền tảng Bản sao số.

Thông thường, việc nhận diện các ô gộp trong bảng (spanning cells) dễ bị bỏ sót nội dung, sai định dạng khiến thông tin không còn chính xác. Để khắc phục điều này, thay vì chỉ lấy thông tin từ một số ô lân cận ô gộp để xử lý như các phương pháp cũ, Viettel Cyberspace đề xuất sử dụng mạng nơ-ron dựa trên cấu trúc Transformer, nhận diện đặc trưng từ tất cả các ô trong bảng, giúp nhận diện đúng và không bỏ sót nội dung. Phương pháp này đặc biệt hiệu quả với các ô trong bảng, không chỉ áp dụng với ô tiêu đề.

Thử nghiệm trên các bộ dữ liệu chuẩn, phương pháp này cho kết quả cao hơn hẳn về độ chính xác so với các phương pháp đã được công bố trước đó. Cụ thể, cao hơn 0,3% F1-score trên tập dữ liệu SciTSR-COMP và cao hơn 1,2% WAvgF1 trên tập ICDAR19-cTDaR so với kết quả đứng thứ hai./.

Bài liên quan
Nổi bật Tạp chí Thông tin & Truyền thông
Đừng bỏ lỡ
  • Bốn giải pháp trọng tâm để giải bài toán an toàn dữ liệu quốc gia
    Theo Thứ trưởng Bộ TT&TT Bùi Hoàng Phương, năm 2024 đánh dấu bước tiến vượt bậc của Việt Nam trong lĩnh vực an toàn thông tin. Tuy nhiên, còn rất nhiều thách thức cần vượt qua để đảm bảo an toàn dữ liệu quốc gia.
  • Việt Nam tăng cường hợp tác phát triển công nghệ số với Burundi và NIPA
    Trong khuôn khổ sự kiện Tuần lễ Số quốc tế 2024, Bộ trưởng Bộ Thông tin và Truyền thông Nguyễn Mạnh Hùng đã tiếp và làm việc với Bộ trưởng Bộ Truyền thông, Công nghệ Thông tin và Đa phương tiện Burundi Léocadie Ndacayisaba và ông Hur Sung Wook, Chủ tịch Cục Xúc tiến Công nghiệp CNTT quốc gia Hàn Quốc (NIPA).
  • Chính thức ra mắt Nền tảng hỗ trợ diễn tập thực chiến an toàn thông tin
    Nền tảng hướng tới nâng cao chất lượng và điều phối hiệu quả các hoạt động diễn tập trên toàn quốc thông qua nền tảng hỗ trợ diễn tập thực chiến an toàn thông tin.
  • Việt Nam - Hàn Quốc đồng hành trong kỷ nguyên AI
    Thứ trưởng Bộ TT&TT Phan Tâm hy vọng, Việt Nam có thể học tập nhiều hơn từ Hàn Quốc về các bài học kinh nghiệm, cách làm hay để phát huy tối đa vai trò công nghệ số nói chung và trợ lý ảo nói riêng trong hoạt động của cơ quan nhà nước, thúc đẩy phát triển kinh tế, tạo lập xã hội số nhân văn và thu hẹp khoảng cách số.
  • Robot Delta hữu dụng trong nhiều ngành
    Nhờ vào thiết kế độc đáo và khả năng hoạt động với tốc độ và độ chính xác cao, robot Delta là một giải pháp tối ưu trong nhiều ngành công nghiệp hiện đại.
  • Cà Mau ứng dụng các phần mềm chuyển đổi số trong ngành nông nghiệp
    Ngành nông nghiệp tỉnh Cà Mau đã không ngừng triển khai các giải pháp chuyển đổi số thông qua việc sử dụng các phần mềm, xây dựng cơ sở dữ liệu chuyên ngành phục vụ quản lý, điều hành. Trong tương lai không xa, các phần mềm này sẽ hoàn thiện và bắt kịp xu hướng công nghệ để hỗ trợ người nông dân nhiều hơn trong việc tăng gia sản xuất.
  • Bảo vệ các hệ thống mạng trọng yếu là cấp thiết
    Song song với tiến trình chuyển đổi số, các chiến dịch tấn công mạng, gián điệp và khủng bố mạng nhằm vào hệ thống công nghệ thông tin (IT) và công nghệ vận hành (OT) trọng yếu ngày càng gia tăng, việc đảm bảo an ninh mạng trở thành ưu tiên hàng đầu của các quốc gia.
  • ‏OPPO Find X8 Series sẽ chính thức lên kệ ngày 7/12‏
    Ngày 21/11, OPPO chính thức ra mắt Find X8 Series‏‏ tại Việt Nam và sẽ lên kệ ngày 7/12 tới. Đây là lần đầu tiên người dùng Việt Nam được trải nghiệm dòng flagship cao cấp nhất của OPPO cùng lúc với toàn cầu. ‏
  • Chuyển đổi số từ thực tiễn Báo Hải Dương
    Báo Hải Dương có nhiều thuận lợi khi thực hiện chuyển đổi số. Đó là Ban Biên tập có quyết tâm cao. Đội ngũ cán bộ, phóng viên, nhân viên của báo nhanh nhạy với cái mới, ham học hỏi...
  • Đưa siêu ứng dụng "Công dân Thủ đô số - iHanoi" vào cuộc sống
    “Công dân Thủ đô số” - iHaNoi là kênh tương tác trực tuyến trên môi trường số giữa người dân, doanh nghiệp với các cấp chính quyền thành phố Hà Nội. Qua ứng dụng này, người dân và doanh nghiệp có thể phản ánh các vấn đề đời sống, từ đó giúp chính quyền tiếp nhận và giải quyết kịp thời.
Công bố nghiên cứu nhận diện thông minh của Việt Nam tại Hội nghị IDCAR
POWERED BY ONECMS - A PRODUCT OF NEKO