Bạn dán một tài liệu dài vào ChatGPT và nhận thông báo "vượt quá giới hạn ngữ cảnh"? Gọi API thấy hóa đơn cao hơn dự kiến mà không hiểu vì sao? Hay đơn giản là muốn biết một prompt dài bao nhiêu trước khi gửi? Tất cả đều cần một con số: số token. Đây là đơn vị mà mọi mô hình AI — ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google) — dùng để tính giới hạn và tính tiền.
Điều dễ gây nhầm là token không phải số từ, cũng không phải số ký tự. Bài viết này sẽ giải thích token là gì, vì sao tiếng Việt thường tốn token hơn, và cách đếm token để ước tính chi phí cùng giới hạn ngữ cảnh ngay trước khi gửi.
Đếm token nhanh: dán đoạn văn bản hoặc prompt vào công cụ đếm token, bạn sẽ thấy ngay số token ước lượng. Không cần cài đặt, cũng không cần đăng nhập.
Token là gì? Token vs từ vs ký tự
Mô hình AI không đọc theo "từ" như con người. Nó cắt văn bản thành những mảnh nhỏ gọi là token — có thể là một từ ngắn, một phần của từ, một dấu câu hay một khoảng trắng. Toàn bộ việc tính giới hạn và tính tiền đều dựa trên token, không phải từ.
Đơn vịLà gìVí dụ "Xin chào BKNS"Ký tựMỗi chữ cái, dấu, khoảng trắng13 ký tựTừCụm chữ ngăn cách bởi khoảng trắng3 từTokenMảnh nhỏ mô hình cắt ra để xử lý~5–8 token (ước lượng)
Quy ước nhanh thường dùng cho tiếng Anh: trung bình 1 token ≈ 4 ký tự ≈ 0,75 từ (tức ~1.000 token cho khoảng 750 từ tiếng Anh).
Nhưng tiếng Việt có dấu lại tốn token nhiều hơn. Do các ký tự có dấu (à, ể, ợ…) thường bị tách thành nhiều mảnh, cùng một nội dung tiếng Việt có thể "ăn" gấp 1,5–2 lần số token so với tiếng Anh. Vì vậy, đừng vội áp quy ước của tiếng Anh cho văn bản tiếng Việt — cứ đếm thật bằng công cụ cho chắc.
4 bước đếm token và ước tính chi phí
Bước 1 — Đếm token của prompt
Trước khi gửi cho mô hình, bạn chỉ cần dán prompt hoặc đoạn văn bản vào công cụ là biết ngay số token ước lượng.
👉 Đếm token: công cụ đếm token (dán văn bản, xem số token tức thì).
Ví dụ: một đoạn prompt tiếng Việt khoảng 300 từ có thể tương đương 600–800 token — gấp rưỡi đến gấp đôi so với cùng số từ tiếng Anh.
Lưu ý và lỗi hay gặp:
Đừng dán API key, mật khẩu hay dữ liệu nhạy cảm vào để "đếm cho tiện" — chỉ đếm phần nội dung văn bản.
Số token là ước lượng theo quy tắc tách phổ biến; mỗi nhà cung cấp dùng bộ tách (tokenizer) hơi khác nhau, nên con số chính xác tuyệt đối chỉ có khi đo bằng công cụ chính thức của từng hãng. Dùng kết quả này để ước tính và canh giới hạn là đủ.
Nhớ cộng cả token đầu ra: giới hạn ngữ cảnh tính tổng token đầu vào (prompt) cộng token trả lời.
Bước 2 — Đối chiếu bằng thống kê văn bản
Muốn hiểu vì sao một đoạn lại dài hay ngắn, bạn có thể xem song song số câu, số đoạn và số từ. Văn bản càng nhiều ký hiệu, mã hay bảng biểu thì càng tốn token.
👉 Thống kê: công cụ thống kê văn bản (số câu, số đoạn, thời gian đọc).
Bước 3 — Đếm từ để quy đổi nhanh
Khi không có sẵn công cụ đếm token, bạn có thể ước lượng thô từ số từ: đếm số từ rồi nhân theo quy ước (tiếng Anh ~1,3 token/từ; tiếng Việt có dấu cao hơn).
👉 Đếm từ: công cụ đếm từ.
Bước 4 — Làm gọn tài liệu trước khi đưa vào prompt
Khi bạn dán cả một trang web hay tài liệu vào mô hình, phần định dạng HTML/CSS thừa sẽ "ngốn" rất nhiều token vô ích. Chuyển tài liệu sang Markdown sạch là cách giảm đáng kể số token mà vẫn giữ trọn nội dung.
👉 Chuyển sang Markdown: công cụ chuyển tài liệu sang Markdown (gỡ định dạng thừa, giữ nội dung gọn cho prompt).
Cửa sổ ngữ cảnh và chi phí: cần biết gì?
Cửa sổ ngữ cảnh (context window) là tổng số token tối đa mà một lần trò chuyện chứa được — gồm cả prompt lẫn câu trả lời. Vượt mức này, mô hình báo lỗi hoặc "quên" phần đầu. Vài mốc tham khảo:
Claude (Anthropic): các bản thế hệ mới như Claude Opus và Claude Sonnet hỗ trợ cửa sổ ngữ cảnh tới 1 triệu token; bản nhỏ gọn như Claude Haiku là 200 nghìn token.
ChatGPT / GPT-4 (OpenAI): các bản GPT-4 gần đây thường quanh mức 128 nghìn token.
Lưu ý: các con số này thay đổi theo phiên bản — luôn kiểm tra trang tài liệu chính thức của nhà cung cấp.
Chi phí khi dùng API được tính theo token, và đơn giá token đầu vào thường rẻ hơn token đầu ra. Công thức:
Chi phí = (token đầu vào × đơn giá vào) + (token đầu ra × đơn giá ra)Giá thường niêm yết "trên 1 triệu token". Ví dụ minh họa (giả sử một mô hình có giá 3 USD/1 triệu token vào và 15 USD/1 triệu token ra):
Prompt 2.000 token → 2.000 / 1.000.000 × 3 = 0,006 USD
Trả lời 500 token → 500 / 1.000.000 × 15 = 0,0075 USD
Tổng ≈ 0,0135 USD — tức chưa tới 400 đồng cho một lượt hỏi (tỷ giá tham khảo)
Nghe rất nhỏ, nhưng nếu bạn xử lý hàng nghìn yêu cầu mỗi ngày, hoặc nhồi cả tài liệu dài vào mỗi prompt, chi phí cộng dồn rất nhanh. Vì vậy thói quen đếm token và làm gọn prompt (Bước 4) chính là cách tiết kiệm trực tiếp.
Câu hỏi thường gặp (FAQ)
Token GPT là gì, có khác token của Claude không? Về bản chất đều là mảnh văn bản mô hình cắt ra để xử lý. Mỗi hãng dùng bộ tách hơi khác nhau nên cùng một câu có thể ra số token chênh nhau đôi chút, nhưng cách ước tính và tính tiền theo token là giống nhau.
Vì sao tiếng Việt tốn nhiều token hơn tiếng Anh? Vì ký tự có dấu thường bị tách thành nhiều mảnh hơn. Cùng một độ dài nội dung, tiếng Việt có dấu có thể tốn gấp 1,5–2 lần token so với tiếng Anh.
Đếm token online có chính xác 100% không? Đây là con số ước lượng theo quy tắc phổ biến, đủ để canh giới hạn và ước tính chi phí. Muốn con số chính xác tuyệt đối cho một mô hình cụ thể, hãy dùng công cụ đếm token chính thức của nhà cung cấp đó.
Làm sao giảm số token để tiết kiệm chi phí? Bạn hãy cắt bớt phần thừa trong prompt, bỏ định dạng HTML/CSS không cần thiết (dùng công cụ chuyển sang Markdown), và chỉ đưa vào ngữ cảnh phần thật sự liên quan thay vì dán cả tài liệu.
BKNS Tools — bộ công cụ AI & tiện ích miễn phí cho người Việt. Đếm token · Thống kê văn bản · Đếm từ · Chuyển sang Markdown — không cần đăng nhập.




