Bộ tiêu chí đánh giá chất lượng đầu ra của AI

Đánh giá chất lượng đầu ra của AI cần một bảng tiêu chí cố định, chấm bằng thang điểm giống nhau cho mọi bản, bất kể bản đó do người hay do máy tạo ra. Không có bảng tiêu chí, việc duyệt bài trở thành cảm tính và mỗi người duyệt một kiểu. Hậu quả là đội ngũ không biết thế nào là đạt, còn người quản lý không có cơ sở để nói chất lượng đang tăng hay giảm.

Vì sao đọc thấy hay không phải là tiêu chí

Mô hình ngôn ngữ được tối ưu để tạo ra văn bản trôi chảy và thuyết phục. Đó chính là cái bẫy: một bản viết mượt, bố cục cân đối, giọng điệu tự tin vẫn có thể chứa số liệu bịa, thiếu mất một yêu cầu quan trọng, và không giống giọng của tổ chức bạn chút nào.

Người duyệt dựa vào cảm giác đọc thấy hay sẽ bỏ lọt đúng những lỗi nguy hiểm nhất, vì chúng không gây khó chịu khi đọc. Ngược lại, người duyệt có bảng tiêu chí sẽ hỏi đúng những câu mà cảm giác không hỏi: số này lấy ở đâu, yêu cầu thứ ba trong đề bài đã được xử lý chưa, câu khẳng định này có kiểm chứng được không.

Bảng sáu tiêu chí dùng được cho hầu hết đầu việc

Tiêu chíCâu hỏi kiểm traMức 1 là gìMức 5 là gì
Chính xácCó khẳng định nào sai hoặc không kiểm chứng được khôngCó số liệu hoặc sự kiện saiMọi khẳng định đều truy được nguồn
Đầy đủĐã xử lý hết các yêu cầu trong đề bài chưaBỏ sót yêu cầu bắt buộcĐủ mọi yêu cầu, có cả phần phụ
Đúng đối tượngNgười đọc mục tiêu có hiểu và thấy liên quan khôngViết cho người khác, sai mức độ chuyên mônĐúng mức chuyên môn và đúng mối quan tâm
Đúng giọngCó đọc ra là của tổ chức mình khôngGiọng chung chung, ai viết cũng đượcNhận ra ngay là giọng thương hiệu
Mức phải sửaDùng được ngay hay phải làm lạiPhải viết lại từ đầuDùng được ngay không sửa
Tuân thủCó vi phạm quy định, dữ liệu nhạy cảm, bản quyền khôngCó vi phạm rõ ràngSạch hoàn toàn, có ghi rõ nguồn dùng lại

Sáu tiêu chí này đủ dùng cho nội dung, báo cáo, thư từ, tài liệu đào tạo và phần lớn đầu việc văn phòng. Với những đầu việc đặc thù như mã nguồn hay phân tích số liệu, bạn thay tiêu chí đúng giọng bằng tiêu chí riêng của lĩnh vực.

Ba tiêu chí không được phép thỏa hiệp

Không phải tiêu chí nào cũng ngang nhau. Ba trong số sáu tiêu chí trên hoạt động theo kiểu đạt hoặc không đạt, không có điểm trung gian.

Tính chính xác. Một con số sai trong báo cáo gửi khách hàng không được bù lại bằng văn phong hay. Quy tắc thực dụng: mọi con số, mọi tên riêng, mọi trích dẫn, mọi mốc thời gian đều phải có người đối chiếu với nguồn. Cơ chế vì sao mô hình bịa và cách kiểm chứng nằm ở bài ảo giác AI là gì và cách kiểm chứng thông tin.

Tính tuân thủ. Dữ liệu nhạy cảm lọt ra ngoài hoặc nội dung vi phạm bản quyền là loại lỗi không sửa được sau khi đã phát hành. Xem thêm bản quyền nội dung do AI tạo ra.

Tính đầy đủ. Thiếu một yêu cầu bắt buộc nghĩa là sản phẩm chưa hoàn thành, dù phần đã làm có tốt đến đâu.

Cách chấm để con số có ý nghĩa

Bảng tiêu chí chỉ hữu ích khi cách chấm được chuẩn hóa. Bốn nguyên tắc dưới đây làm nên khác biệt giữa một bảng điểm dùng được và một bảng điểm trang trí.

  • Người chấm không biết bản nào do AI tạo. Biết rồi thì điểm lệch ngay, theo cả hai hướng tùy định kiến của người chấm.
  • Chấm trên mẫu ngẫu nhiên, không chấm trên bản đẹp nhất. Mỗi tuần rút ngẫu nhiên năm tới mười bản.
  • Hai người chấm độc lập ở giai đoạn đầu. Nếu hai người lệch nhau quá một điểm thì bảng tiêu chí đang mơ hồ, phải viết lại phần mô tả mức.
  • Ghi lại lý do trừ điểm, không chỉ ghi điểm. Lý do mới là thứ dùng được để sửa prompt, còn điểm chỉ dùng để theo dõi xu hướng.

Cột lý do trừ điểm sau vài tuần sẽ trở thành danh sách lỗi lặp lại. Mỗi lỗi lặp lại là một dòng cần thêm vào prompt chuẩn, và đó chính là vòng cải tiến thật sự.

Từ điểm số tới hành động

Điểm trung bìnhÝ nghĩaHành động
Dưới 2,5Đầu việc này chưa phù hợp hoặc prompt sai hướngXem lại cách đặt bài toán, đừng vội đổ cho mô hình
Từ 2,5 tới 3,5Dùng được làm bản nháp, cần người biên tậpBổ sung ví dụ mẫu vào prompt, giữ khâu duyệt
Từ 3,5 tới 4,5Ổn định, chỉ cần sửa nhẹChuẩn hóa thành prompt dùng chung cho cả phòng
Trên 4,5Rất tốt nhưng cần kiểm tra lại cách chấmĐối chiếu chéo, đề phòng người chấm dễ dãi

Hàng cuối cùng không phải nói đùa. Điểm quá cao đều đặn thường là dấu hiệu bảng tiêu chí quá dễ hoặc người chấm không đọc kỹ, chứ hiếm khi là dấu hiệu mọi thứ hoàn hảo.

Bộ kiểm tra nhanh trước khi bấm gửi

Với người làm trực tiếp, cần một bản rút gọn dùng được trong một phút. Bảy câu dưới đây bao phủ phần lớn rủi ro.

  • Mọi con số và tên riêng đã được đối chiếu với nguồn gốc chưa.
  • Có khẳng định nào mình không tự bảo vệ được nếu bị hỏi lại không.
  • Đã kiểm tra đủ từng yêu cầu trong đề bài chưa.
  • Có thông tin nội bộ hoặc dữ liệu khách hàng nào không nên xuất hiện không.
  • Có đoạn nào giống nguyên văn một nguồn bên ngoài không.
  • Đọc to lên có giống giọng của tổ chức mình không.
  • Nếu bản này bị trích dẫn lại sau một năm, nó có còn đúng không.

Câu cuối cùng đặc biệt hữu ích với nội dung đăng công khai, vì nó loại bỏ những khẳng định gắn chặt vào thời điểm mà sáu tháng sau đọc lại sẽ sai.

Câu hỏi thường gặp

Có cần dùng bảng tiêu chí khác nhau cho từng loại đầu việc không?

Nên giữ chung bốn tiêu chí lõi là chính xác, đầy đủ, mức phải sửa và tuân thủ, rồi thay hai tiêu chí còn lại theo đặc thù. Với mã nguồn, hai tiêu chí thay thế thường là chạy đúng và dễ bảo trì. Với phân tích số liệu là đúng phương pháp và nêu rõ giả định. Giữ phần lõi chung giúp so sánh được giữa các phòng ban.

Dùng chính AI để chấm đầu ra của AI có được không?

Dùng được cho vòng sàng lọc đầu tiên, nhất là để bắt lỗi thiếu yêu cầu và lỗi định dạng ở quy mô lớn. Nhưng không được dùng làm phán quyết cuối cùng cho tính chính xác, vì mô hình chấm cũng mắc đúng loại lỗi mà mô hình viết mắc phải. Cách dùng an toàn là để AI sàng rồi người duyệt tập trung vào phần nó đánh dấu nghi ngờ.

Bao lâu nên rà soát lại bảng tiêu chí?

Ba tháng một lần là hợp lý, và rà sớm hơn nếu điểm số dồn hết về một mức. Khi mọi bản đều được bốn điểm thì bảng tiêu chí đã mất khả năng phân biệt và cần viết lại phần mô tả các mức cho chặt hơn.

Có nên cho người viết biết điểm của mình không?

Nên cho biết lý do trừ điểm, đó là thứ giúp họ cải thiện. Nhưng không nên biến điểm thành chỉ số đánh giá nhân sự, vì khi đó người ta sẽ chọn đầu việc dễ được điểm cao và tránh việc khó. Điểm nên gắn với đầu việc và với prompt, không gắn với cá nhân.

Làm sao chấm tiêu chí đúng giọng khi chưa có bộ quy tắc giọng?

Cách nhanh nhất là chọn năm bản do người trong tổ chức viết mà ai cũng đồng ý là chuẩn, rồi rút ra năm đặc điểm chung về cách xưng hô, độ dài câu, mức độ dùng thuật ngữ, cách mở bài và cách kết. Năm đặc điểm đó vừa là tiêu chí chấm vừa là phần đưa vào prompt. Cách làm chi tiết nằm ở bài biên tập nội dung AI để giữ giọng thương hiệu.

Bản do AI tạo có nên bị chấm khắt khe hơn bản do người viết không?

Không, và đây là nguyên tắc quan trọng. Dùng hai thước đo khác nhau sẽ làm dữ liệu mất giá trị so sánh và tạo tranh cãi không cần thiết. Thước đo là chất lượng đầu ra phục vụ mục đích công việc, không phải cách nó được tạo ra. Điều khác biệt duy nhất nằm ở khâu kiểm chứng sự thật, vốn cần chặt hơn với mọi bản có sự tham gia của AI.

Có cần lưu lại bản gốc do AI tạo trước khi biên tập không?

Nên lưu trong giai đoạn đầu, vì so sánh bản gốc với bản đã biên tập là cách chính xác nhất để đo mức phải sửa và để tìm ra lỗi lặp lại cần đưa vào prompt. Sau khi quy trình đã ổn định thì có thể chỉ lưu theo mẫu ngẫu nhiên hằng tuần thay vì lưu toàn bộ.

Chấm bao nhiêu bản mỗi tuần là đủ?

Năm tới mười bản rút ngẫu nhiên là đủ để thấy xu hướng với một phòng ban vài chục người. Điều quan trọng hơn số lượng là tính ngẫu nhiên và tính đều đặn. Chấm hai mươi bản một lần rồi ba tháng sau mới chấm lại sẽ kém hữu ích hơn nhiều so với chấm năm bản mỗi tuần liên tục.

Bài liên quan trong cùng chủ đề

Biến việc duyệt bài từ cảm tính thành một quy trình đo được

Một bảng tiêu chí tốt chỉ phát huy tác dụng khi cả đội cùng dùng một thước và biết cách sửa prompt từ lỗi lặp lại. Hai chương trình dưới đây đi vào đúng phần vận hành đó.

Về người viết

Nguyễn Văn Tân (Tân AI, Tân MKT) là chuyên gia đào tạo ứng dụng AI và Marketing, Founder kiêm CEO Drabuff Academy & Agency, tác giả ba cuốn sách. Anh đi lên từ nền tảng kỹ sư công nghệ thông tin với các chứng chỉ CCNA, CCNP và CEH, từng làm tại FPT và Vietsovpetro, sau đó hơn 10 năm làm Marketing. Anh đã trực tiếp đứng lớp hơn 200 khóa đào tạo cho trên 100 doanh nghiệp, trong đó có Viettel, Honda, Mercedes-Benz, Novaland, Heineken, Toyota và EVN. Nguyên tắc của anh là thực chiến: quy trình nào không chạy được trong công việc hằng ngày thì không đưa vào bài giảng.

Đánh Giá Bài Viết

Chia sẻ bài viết

Nguyễn Văn Tân – Jackcy Tân Trainer, chuyên gia đào tạo Marketing và cố vấn doanh nghiệp

Tân Nguyễn Marketing (hay Jackcy Tân Trainer) là nhà đào tạo về Marketing Online, chuyên tư vấn cố vấn doanh nghiệp và triển khai các dịch vụ marketing liên quan.
Kết nối với Tân quan Facebook Hoặc Zalo: 0934041114