AI đa phương thức là gì và dùng vào việc gì

AI đa phương thức là mô hình có thể nhận và xử lý nhiều loại dữ liệu cùng lúc: chữ, hình ảnh, âm thanh, video, bảng biểu, thay vì chỉ đọc và viết chữ. Khác biệt không nằm ở chỗ nó làm được nhiều thứ hơn, mà ở chỗ nó hiểu được mối liên hệ giữa các loại dữ liệu trong cùng một lần hỏi. Đưa vào một tấm ảnh chụp bảng giá viết tay kèm câu hỏi bằng chữ, mô hình đọc cả hai rồi trả lời như một thể thống nhất.

Đa phương thức khác gì với việc ghép nhiều công cụ lại

Trước đây, muốn xử lý một tấm ảnh chứa chữ, người ta ghép ba công cụ: một công cụ nhận dạng chữ trong ảnh, một công cụ dịch, một mô hình ngôn ngữ để tóm tắt. Mỗi lần chuyển tay là một lần mất thông tin, vì công cụ sau chỉ nhận được đầu ra dạng chữ của công cụ trước.

Mô hình đa phương thức thật sự thì không cắt khúc như vậy. Ảnh và chữ được đưa về cùng một không gian biểu diễn bên trong mô hình, nên nó giữ được những thứ mà bản chuyển thành chữ sẽ làm mất: bố cục trang, chữ nào được tô đậm, mũi tên trong sơ đồ nối ô nào với ô nào, giọng điệu trong đoạn ghi âm.

Đây là lý do một mô hình đa phương thức có thể trả lời được câu hỏi kiểu như biểu đồ này cho thấy xu hướng gì, trong khi chuỗi công cụ ghép nối chỉ đọc được các con số rời rạc.

Các loại dữ liệu và việc mà mô hình làm được

Loại dữ liệuViệc làm tốtViệc còn yếu
Ảnh chụp tài liệuĐọc chữ, hiểu bố cục, trích xuất thành bảngChữ viết tay xấu, tài liệu mờ hoặc chụp nghiêng nhiều
Biểu đồ và sơ đồMô tả xu hướng, giải thích quan hệ giữa các khốiĐọc chính xác giá trị từng điểm trên trục
Ảnh sản phẩmMô tả, gợi ý nội dung bán hàng, phát hiện lỗi rõ ràngĐo kích thước, phân biệt sắc độ màu gần nhau
Giao diện phần mềmChỉ ra nút nào làm gì, viết hướng dẫn sử dụngThao tác thay người dùng nếu không có công cụ điều khiển
Âm thanh và ghi âmBóc băng, tóm tắt, tách người nóiBản ghi nhiều tạp âm, nhiều người nói chồng nhau
VideoTóm tắt nội dung, tìm đoạn chứa chủ đề cụ thểĐếm chính xác số lần một hành động xảy ra

Quy luật chung rút ra từ bảng này: mô hình đa phương thức mạnh ở việc hiểu và mô tả, yếu ở việc đo đếm chính xác. Bất cứ khi nào bạn cần con số tuyệt đối, hãy lấy con số từ nguồn dữ liệu gốc chứ đừng bắt mô hình đọc từ ảnh.

Bảy tình huống công việc dùng được ngay

  • Chuyển hóa đơn và chứng từ giấy thành bảng. Chụp ảnh, yêu cầu trả về đúng các cột bạn cần. Luôn để một người rà lại phần số tiền.
  • Đọc ảnh chụp màn hình lỗi. Thay vì gõ lại thông báo lỗi, đưa thẳng ảnh và hỏi nguyên nhân có thể là gì.
  • Bóc băng cuộc họp và rút hành động. Đưa file ghi âm, yêu cầu tóm tắt theo ba mục: quyết định đã chốt, việc cần làm kèm người phụ trách, điểm còn tranh luận.
  • Viết mô tả sản phẩm từ ảnh. Hữu ích cho đội thương mại điện tử có hàng trăm mã hàng.
  • Kiểm tra bản thiết kế trước khi in. Đưa ảnh thiết kế kèm bộ quy tắc thương hiệu, yêu cầu chỉ ra chỗ sai.
  • Soạn hướng dẫn sử dụng từ ảnh giao diện. Chụp từng bước rồi yêu cầu viết thành quy trình có đánh số.
  • Đọc biểu đồ trong báo cáo ngành. Yêu cầu mô tả xu hướng và nêu điều cần kiểm chứng lại, thay vì tin ngay các con số nó đọc ra.

Cách viết prompt cho dữ liệu không phải chữ

Prompt cho ảnh và âm thanh có một khác biệt quan trọng so với prompt cho chữ: bạn phải nói rõ mô hình cần nhìn vào đâu và bỏ qua cái gì. Không nói rõ thì nó mô tả toàn bộ, và phần bạn cần bị chìm trong phần bạn không cần.

Một khung dùng được cho hầu hết trường hợp gồm bốn phần: mô tả loại tài liệu đang đưa vào, chỉ rõ vùng hoặc thông tin cần lấy, nêu định dạng đầu ra mong muốn, và thêm một câu yêu cầu ghi rõ chỗ nào nó không đọc được thay vì đoán. Câu cuối cùng này quan trọng hơn người ta tưởng, vì nó biến một bản trích xuất đáng ngờ thành một bản có đánh dấu chỗ cần kiểm tra.

Nếu bạn chưa quen với cách dựng khung prompt, phần nền tảng nằm trong bài prompt engineering là gì.

Chi phí và giới hạn cần biết trước

Ảnh, âm thanh và video tốn nhiều token hơn chữ rất nhiều. Một trang tài liệu chụp ảnh có thể ngốn lượng token bằng vài nghìn chữ, còn một phút video thì bằng cả chục trang. Điều này dẫn tới hai hệ quả thực tế.

Thứ nhất, đừng đưa vào mười lăm tấm ảnh khi năm tấm là đủ. Thứ hai, hãy cắt gọn trước khi đưa vào: cắt đúng vùng cần đọc trong ảnh, cắt đúng đoạn cần nghe trong bản ghi. Cơ chế tính tiền theo token được giải thích kỹ trong bài token là gì và cách token quyết định chi phí dùng AI.

Giới hạn thứ hai là cửa sổ ngữ cảnh. Vì dữ liệu hình ảnh chiếm chỗ lớn, một cuộc hội thoại có nhiều ảnh sẽ chạm trần nhanh hơn nhiều so với hội thoại thuần chữ, và mô hình bắt đầu quên phần đầu. Cơ chế này nằm ở bài context window là gì.

Ba rủi ro nên đặt hàng rào từ đầu

Rủi ro thứ nhất, đọc sai số. Mô hình có thể đọc nhầm một chữ số trong hóa đơn mà vẫn trình bày rất tự tin. Nguyên tắc: mọi con số ảnh hưởng tới tiền đều phải có người đối chiếu.

Rủi ro thứ hai, dữ liệu nhạy cảm nằm trong ảnh. Một tấm ảnh chụp màn hình có thể vô tình chứa tên khách hàng, số điện thoại, thông tin hợp đồng ở góc màn hình. Che vùng không liên quan trước khi tải lên là thói quen nên rèn. Xem thêm bảo mật dữ liệu khi dùng AI trong công việc.

Rủi ro thứ ba, chỉ dẫn ẩn trong hình. Một tấm ảnh có thể chứa dòng chữ nhỏ ra lệnh cho mô hình làm việc khác. Khi xử lý tài liệu từ bên ngoài, hãy coi nội dung trong ảnh là dữ liệu cần đọc, không phải mệnh lệnh cần tuân theo, và nói rõ điều đó trong prompt.

Câu hỏi thường gặp

AI đa phương thức có nhìn được ảnh giống như con người không?

Không giống. Mô hình chia ảnh thành các mảng nhỏ rồi chuyển thành dãy số để xử lý, nên nó nắm tổng thể và ngữ cảnh rất tốt nhưng lại có thể bỏ sót chi tiết nhỏ mà mắt người bắt được ngay, chẳng hạn một dấu chấm sai vị trí. Ngược lại, nó đọc được chữ trong ảnh nhanh hơn người ở quy mô hàng trăm trang.

Có nên dùng AI đa phương thức để nhập liệu hóa đơn không?

Dùng được và tiết kiệm đáng kể, nhưng phải thiết kế thành quy trình hai lớp. Lớp một là mô hình trích xuất và tự đánh dấu những trường nó không chắc. Lớp hai là người kiểm tra, chỉ tập trung vào các trường được đánh dấu cộng với tổng tiền. Bỏ lớp hai là chấp nhận sai sót lọt vào sổ sách.

Mô hình đọc biểu đồ có chính xác không?

Chính xác ở mức mô tả xu hướng và so sánh tương đối, không chính xác ở mức đọc giá trị tuyệt đối của từng điểm. Nếu bạn cần con số, hãy tìm bảng dữ liệu gốc đứng sau biểu đồ. Cách hỏi an toàn là yêu cầu mô hình mô tả hình dạng xu hướng và nói rõ nó không đảm bảo giá trị cụ thể.

Đưa video dài vào được không?

Về mặt kỹ thuật thì nhiều công cụ đã nhận video dài, nhưng chi phí và độ chính xác đều giảm theo độ dài. Cách làm hiệu quả là cắt video thành các đoạn theo chủ đề rồi xử lý từng đoạn, hoặc bóc băng trước rồi làm việc trên bản chữ, chỉ quay lại xem hình ở những đoạn thật sự cần.

Ảnh tôi tải lên có được dùng để huấn luyện mô hình không?

Tùy công cụ và tùy gói dịch vụ. Gói dành cho doanh nghiệp thường cam kết không dùng dữ liệu người dùng để huấn luyện, gói miễn phí thì thường ngược lại. Đây là thứ phải kiểm tra trong phần cài đặt quyền riêng tư trước khi đưa bất cứ tài liệu nội bộ nào lên, chứ không nên giả định.

Cần chuẩn bị ảnh thế nào để mô hình đọc tốt nhất?

Bốn việc đơn giản cải thiện kết quả rõ rệt: chụp thẳng góc thay vì nghiêng, đủ sáng và không bị bóng, cắt sát vùng cần đọc để bỏ phần thừa, và tách mỗi trang thành một ảnh riêng thay vì ghép nhiều trang vào một hình. Với tài liệu nhiều trang, tải lên dạng tệp gốc luôn cho kết quả tốt hơn ảnh chụp lại.

AI đa phương thức có thay thế được phần mềm nhận dạng chữ chuyên dụng không?

Thay thế được trong phần lớn công việc văn phòng, nhất là khi tài liệu có bố cục phức tạp hoặc lẫn nhiều ngôn ngữ, vì mô hình hiểu được ngữ cảnh chứ không chỉ nhận mặt chữ. Nhưng với dây chuyền xử lý hàng chục nghìn trang mỗi ngày và yêu cầu độ chính xác từng ký tự, phần mềm chuyên dụng vẫn rẻ hơn và ổn định hơn.

Có cần công cụ trả phí mới dùng được đa phương thức không?

Các bản miễn phí hiện nay đều đã cho phép đưa ảnh vào ở mức giới hạn, đủ để thử và để xử lý việc lẻ. Ràng buộc của bản miễn phí thường nằm ở số lượt mỗi ngày, kích thước tệp và khả năng xử lý âm thanh hoặc video. Hãy thử ở bản miễn phí trước để xác định công việc nào thật sự có ích, rồi mới quyết định trả phí.

Bài liên quan trong cùng chủ đề

Đưa dữ liệu ảnh và âm thanh vào quy trình làm việc thật

Biết mô hình làm được gì mới là một nửa. Nửa còn lại là dựng quy trình có hàng rào kiểm tra để đội ngũ dùng hằng ngày mà không sinh ra sai sót âm thầm.

Về người viết

Nguyễn Văn Tân (Tân AI, Tân MKT) là chuyên gia đào tạo ứng dụng AI và Marketing, Founder kiêm CEO Drabuff Academy & Agency, tác giả ba cuốn sách. Anh đi lên từ nền tảng kỹ sư công nghệ thông tin với các chứng chỉ CCNA, CCNP và CEH, từng làm tại FPT và Vietsovpetro, sau đó hơn 10 năm làm Marketing. Anh đã trực tiếp đứng lớp hơn 200 khóa đào tạo cho trên 100 doanh nghiệp, trong đó có Viettel, Honda, Mercedes-Benz, Novaland, Heineken, Toyota và EVN. Nguyên tắc của anh là thực chiến: quy trình nào không chạy được trong công việc hằng ngày thì không đưa vào bài giảng.

Đánh Giá Bài Viết

Chia sẻ bài viết

Nguyễn Văn Tân – Jackcy Tân Trainer, chuyên gia đào tạo Marketing và cố vấn doanh nghiệp

Tân Nguyễn Marketing (hay Jackcy Tân Trainer) là nhà đào tạo về Marketing Online, chuyên tư vấn cố vấn doanh nghiệp và triển khai các dịch vụ marketing liên quan.
Kết nối với Tân quan Facebook Hoặc Zalo: 0934041114