Token là gì và cách nó quyết định chi phí dùng AI

Token là đơn vị nhỏ nhất mà mô hình AI dùng để đọc và viết, thường là một từ ngắn hoặc một mảnh của từ dài, và đó cũng chính là đơn vị nhà cung cấp dùng để tính tiền. Mọi chữ bạn gửi đi và mọi chữ AI viết ra đều được quy thành token trước khi tính phí.

Nắm được cách đếm token là nắm được hai thứ thực tế: dự toán được chi phí trước khi triển khai, và biết chỗ nào đang lãng phí tiền mà không đem lại chất lượng.

Token không phải là chữ cái, cũng không hẳn là từ

Mô hình không đọc theo chữ cái vì như vậy quá chậm, cũng không đọc theo từ vì số lượng từ trong mọi ngôn ngữ là quá lớn. Nó cắt văn bản thành các mảnh có tần suất xuất hiện cao, gọi là token.

Với tiếng Anh, một token trung bình tương đương khoảng ba phần tư của một từ. Với tiếng Việt có dấu, mỗi từ thường bị cắt thành nhiều token hơn, nên cùng một nội dung viết bằng tiếng Việt thường tốn nhiều token hơn viết bằng tiếng Anh. Đây là điều đáng lưu ý khi dự toán cho khối lượng lớn.

Bạn trả tiền cho những gì

Thành phầnCó tính phí khôngGhi chú
Câu hỏi bạn gõCó, tính là token đầu vàoThường rẻ hơn token đầu ra
Tài liệu bạn dán hoặc tải lênCó, tính là token đầu vàoĐây là nơi chi phí phình to nhanh nhất
Toàn bộ lịch sử cuộc trò chuyệnCó, gửi lại ở mỗi lượtCuộc càng dài, mỗi câu hỏi càng đắt
Hướng dẫn hệ thống của nhà cung cấpCó, dù bạn không nhìn thấyThường nhỏ, nhưng luôn có
Câu trả lời AI viết raCó, tính là token đầu raThường đắt hơn đầu vào vài lần
Phần lập luận nội bộ của mô hình suy luậnCó ở các mô hình có bước suy nghĩKhông hiện ra màn hình nhưng vẫn tính tiền

Năm cách cắt chi phí mà không giảm chất lượng

  • Cắt tài liệu trước khi gửi. Chỉ gửi phần liên quan tới câu hỏi. Đây là khoản tiết kiệm lớn nhất và hầu như không ảnh hưởng chất lượng.
  • Mở cuộc mới khi đổi chủ đề. Kéo dài một cuộc trò chuyện sang việc khác nghĩa là bạn trả tiền lại cho toàn bộ lịch sử cũ ở mỗi lượt.
  • Giới hạn độ dài đầu ra. Nói rõ cần bao nhiêu gạch đầu dòng, bao nhiêu chữ. Token đầu ra đắt hơn đầu vào, nên đây là chỗ tiết kiệm hiệu quả.
  • Chọn đúng mô hình cho đúng việc. Việc phân loại, trích xuất, viết lại câu không cần mô hình mạnh nhất. Dùng mô hình nhỏ cho việc nhỏ thường rẻ hơn nhiều lần.
  • Đừng lặp lại hướng dẫn dài ở mỗi lượt. Nếu dùng qua API, đặt hướng dẫn cố định vào phần hệ thống thay vì dán lại trong từng câu hỏi.

Cách ước lượng nhanh trước khi triển khai

Công thức thô nhưng đủ dùng để dự toán: lấy số chữ của một lượt làm việc điển hình, nhân với hệ số quy đổi ra token, nhân với số lượt mỗi ngày, nhân với số ngày, rồi nhân với đơn giá của nhà cung cấp. Luôn cộng thêm biên an toàn vì token đầu ra và lịch sử trò chuyện thường bị ước thiếu.

Quan trọng hơn con số là thói quen: chạy thử một tuần với khối lượng thật, đo chi phí thực tế, rồi mới nhân lên. Dự toán trên giấy gần như luôn lệch so với thực tế vận hành.

Câu hỏi thường gặp

Một nghìn token tương đương bao nhiêu chữ tiếng Việt?

Không có con số cố định vì phụ thuộc vào cách mỗi mô hình cắt token và vào nội dung cụ thể. Tiếng Việt có dấu thường tốn nhiều token hơn tiếng Anh cho cùng một nội dung. Cách chính xác duy nhất là dùng công cụ đếm token của chính nhà cung cấp bạn đang dùng.

Vì sao token đầu ra đắt hơn token đầu vào?

Vì sinh ra chữ mới tốn nhiều tính toán hơn là đọc chữ có sẵn. Khi đọc, mô hình xử lý cả đoạn cùng lúc. Khi viết, nó phải chạy lại toàn bộ mô hình cho từng token một.

Dùng bản web trả phí theo tháng thì có cần quan tâm token không?

Ít quan trọng hơn về tiền, nhưng vẫn quan trọng về giới hạn. Gói thuê bao thường có hạn mức sử dụng, và hạn mức đó tính theo lượng token. Hiểu cách tiết kiệm token đồng nghĩa với việc dùng được nhiều hơn trong cùng một gói.

Vì sao hóa đơn tăng vọt dù số người dùng không đổi?

Ba nguyên nhân phổ biến: có người bắt đầu dán tài liệu dài vào, các cuộc trò chuyện kéo dài không ai mở cuộc mới, hoặc một luồng tự động bị lặp mà không ai để ý. Cách phát hiện là xem báo cáo sử dụng theo ngày chứ không chỉ xem tổng cuối tháng.

Mô hình có bước suy luận thì tốn kém hơn bao nhiêu?

Tùy độ phức tạp của câu hỏi, phần suy luận nội bộ có thể dài gấp nhiều lần câu trả lời hiển thị ra. Vì vậy chỉ nên dùng mô hình suy luận cho việc thật sự cần lập luận nhiều bước, còn việc viết lại câu hay phân loại thì dùng mô hình thường.

Có nên đặt hạn mức chi tiêu không?

Nên, và nên đặt ngay từ ngày đầu. Mọi nhà cung cấp lớn đều cho đặt hạn mức và cảnh báo theo ngưỡng. Đây là biện pháp rẻ nhất để tránh một vòng lặp lỗi âm thầm đốt tiền suốt cuối tuần.

Bài liên quan trong cùng chủ đề

Dự toán và kiểm soát chi phí AI cho doanh nghiệp

Chi phí AI mất kiểm soát thường không do giá cao mà do không ai biết mình đang tiêu vào đâu. Em nhận tư vấn cách đo, đặt hạn mức và tối ưu cho từng luồng công việc.

Về người viết

Nguyễn Văn Tân (Tân AI, Tân MKT) là chuyên gia đào tạo ứng dụng AI và Marketing, Founder kiêm CEO Drabuff Academy & Agency, tác giả ba cuốn sách. Anh đi lên từ nền tảng kỹ sư công nghệ thông tin với các chứng chỉ CCNA, CCNP và CEH, từng làm tại FPT và Vietsovpetro, sau đó hơn 10 năm làm Marketing. Anh đã trực tiếp đứng lớp hơn 200 khóa đào tạo cho trên 100 doanh nghiệp, trong đó có Viettel, Honda, Mercedes-Benz, Novaland, Heineken, Toyota và EVN. Nguyên tắc của anh là thực chiến: quy trình nào không chạy được trong công việc hằng ngày thì không đưa vào bài giảng.

Đánh Giá Bài Viết

Chia sẻ bài viết

Nguyễn Văn Tân – Jackcy Tân Trainer, chuyên gia đào tạo Marketing và cố vấn doanh nghiệp

Tân Nguyễn Marketing (hay Jackcy Tân Trainer) là nhà đào tạo về Marketing Online, chuyên tư vấn cố vấn doanh nghiệp và triển khai các dịch vụ marketing liên quan.
Kết nối với Tân quan Facebook Hoặc Zalo: 0934041114