Chắc bạn cũng từng gặp cảnh này: kéo file PDF quy chế 40 trang của công ty noithat.vn vào ChatGPT rồi hỏi "điều 5 nói gì về chế độ nghỉ phép", AI trả lời chung chung, thậm chí bịa ra nội dung không có trong file. Hoặc dán một bảng Excel giá cả vào Claude để hỏi tổng hợp, kết quả các cột số bị xáo trộn lộn xộn vì bảng đã vỡ layout ngay từ lúc dán. Tệ hơn nữa là dán một tài liệu quá dài — AI vẫn trả lời bình thường, nhưng thực ra đã âm thầm cắt bớt phần cuối mà không hề báo cho bạn biết.

Vấn đề không nằm ở AI "kém", mà ở cách tài liệu được đưa vào. PDF và Word vốn được thiết kế để in ra giấy đẹp, không phải để AI đọc — vì vậy header/footer lặp lại mỗi trang, số trang chen ngang, bảng biểu bị "phẳng hoá" thành chữ rời rạc là chuyện bình thường khi dán trực tiếp. Bài này sẽ chỉ bạn cách chuẩn bị tài liệu đúng trước khi đưa vào ChatGPT, Claude hay NotebookLM, để câu trả lời chính xác và đáng tin hơn hẳn.

Chuyển tài liệu ngay: mở công cụ chuyển tài liệu sang Markdown, kéo–thả file PDF/Word/Excel/PowerPoint vào, lấy bản Markdown sạch rồi dán vào AI. Không cần cài phần mềm, không cần đăng nhập.

Vì sao dán thẳng tài liệu vào AI hay bị sai?

Khi bạn dán trực tiếp một PDF hay file Word, AI phải tự "đoán" lại cấu trúc tài liệu từ một mớ ký tự đã mất trật tự gốc. Ba lỗi phổ biến nhất:

Vấn đềVì sao xảy raHệ quảBảng vỡ thành chữ lộn xộnTrình đọc PDF không hiểu bố cục cột/hàngAI đọc nhầm số liệu, gộp sai cộtHeader/footer, số trang lặp lạiMỗi trang PDF đều in lại các phần nàyNhiễu văn bản, AI dễ lạc hướngFile dài bị cắt giữa chừngVượt giới hạn xử lý của model, nhưng không luôn báo lỗi rõ ràngTrả lời thiếu phần cuối tài liệu mà bạn không biết

Cách xử lý gốc rễ là chuyển tài liệu sang Markdown trước khi dán — đây là định dạng văn bản thuần, có cấu trúc rõ (tiêu đề, danh sách, bảng) mà hầu hết mô hình AI hiện nay đọc rất tốt, vì nó chính là kiểu dữ liệu các model được huấn luyện nhiều nhất.

Quy trình 4 bước đưa tài liệu vào AI đúng cách

Bước 1 — Chuyển tài liệu sang Markdown

Nếu tài liệu của bạn là file (PDF, Word, PowerPoint, Excel), hãy chuyển sang Markdown trước khi dán vào AI. Nếu nguồn là một trang web, dùng công cụ tương ứng cho web thay vì copy trực tiếp từ trình duyệt (dễ dính menu, quảng cáo, thanh điều hướng).

👉 File tài liệu: công cụ chuyển tài liệu sang Markdown — kéo–thả PDF, DOCX, PPTX, XLSX, XLS, DOC tối đa 50 MB, có bản xem trước, sửa trực tiếp trên trang rồi copy hoặc tải file .md. File bạn tải lên được xoá khỏi máy chủ ngay sau khi chuyển đổi xong.

👉 Trang web: công cụ chuyển trang web sang Markdown — dán URL, công cụ tự bỏ menu/quảng cáo, giữ lại nội dung chính, tuỳ chọn giữ nguyên link trong bài.

Ví dụ thực tế: đội ngũ BKNS đã thử với một tài liệu kỹ thuật PDF dày khoảng 1.700 trang — công cụ xử lý xong và cho ra bản Markdown chỉ trong khoảng 3,5 phút, kể cả tài liệu dày cỡ đó vẫn xử lý được chứ không bị treo hay báo lỗi.

Lỗi hay gặp:

  • File PDF là bản scan (ảnh chụp trang giấy), không có lớp chữ thật → công cụ chuyển Markdown cần văn bản có chữ để đọc, nên với dạng scan thuần ảnh bạn cần có bản đã nhận dạng chữ (OCR) trước, chứ không thể chuyển thẳng từ ảnh.

Bước 2 — Rà soát và dọn bản Markdown

Sau khi có bản Markdown, đừng vội dán nguyên si vào AI. Lướt nhanh qua để cắt bỏ những phần không cần cho câu hỏi bạn sắp đặt: mục lục lặp lại, phụ lục dài không liên quan, phần chữ ký/đóng dấu quét từ file gốc.

Lỗi hay gặp:

  • Quên xoá phần header/footer bị lặp lại nếu chúng vẫn còn sót trong bản Markdown (ví dụ tên công ty và số trang lặp ở mỗi mục) → làm nhiễu ngữ cảnh, khiến AI đôi khi trích dẫn nhầm các dòng lặp này thay vì nội dung thật.

Bước 3 — Đếm token trước khi dán

Mỗi model AI có một giới hạn ngữ cảnh (context) riêng, và giới hạn này thay đổi liên tục theo từng phiên bản — nên thay vì đoán, hãy đếm trước. Văn bản tiếng Việt có dấu thường tốn token hơn tiếng Anh cho cùng một lượng chữ, nên tài liệu tiếng Việt dễ chạm giới hạn hơn bạn tưởng.

👉 Công cụ đếm token — dán văn bản vào để ước lượng số token trước khi đưa vào AI. Cần đếm nhanh số từ/ký tự thì dùng thêm công cụ đếm từ.

Nếu bản Markdown quá dài so với model bạn đang dùng, đừng cố nhét nguyên khối — hãy chia theo chương/mục và hỏi từng phần một, hoặc tóm tắt từng phần trước rồi mới hỏi tổng hợp trên các bản tóm tắt đó.

Lỗi hay gặp:

  • Dán nguyên tài liệu dài mà không đếm token trước → nhiều AI sẽ vẫn trả lời bình thường như không có gì xảy ra, nhưng thực chất đã cắt bớt phần cuối tài liệu trong im lặng, khiến câu trả lời thiếu sót mà bạn không biết để nghi ngờ.

Bước 4 — Dán vào AI kèm chỉ dẫn rõ ràng

Bản Markdown sạch mới là một nửa câu chuyện — nửa còn lại nằm ở cách bạn hỏi. Thay vì hỏi chung chung, hãy kèm một câu chỉ dẫn phạm vi ngay đầu prompt, ví dụ: "Chỉ trả lời dựa trên tài liệu dưới đây, không suy diễn thêm" hoặc "Trong tài liệu dưới đây, hãy tóm tắt riêng phần Chương 3".

Lỗi hay gặp:

  • Hỏi mơ hồ trên một tài liệu dài (kiểu "tóm tắt file này giúp tôi" cho một hợp đồng 50 trang) → AI phải tự chọn phần nào là quan trọng, dễ bỏ sót đúng phần bạn cần. Chỉ rõ chương/mục hoặc chủ đề cần tập trung sẽ cho câu trả lời sát hơn hẳn.

Kỳ vọng: mất bao lâu, chính xác hơn thế nào?

  • Thời gian chuyển đổi: tài liệu vài chục trang thường xong trong vài giây đến vài chục giây; tài liệu rất dày (hàng nghìn trang) vẫn xử lý được, chỉ mất thêm vài phút thay vì bị treo hay từ chối.

  • Độ chính xác: với tài liệu có bảng biểu hoặc cấu trúc nhiều mục, chuyển qua Markdown trước giúp AI giữ đúng cột/hàng và thứ tự mục — thay vì đọc một mớ chữ dính liền không rõ đâu là đâu.

  • Khi nào cần làm đủ cả 4 bước: tài liệu ngắn vài trang, không bảng phức tạp thì dán thẳng cũng thường ổn; còn tài liệu dài, nhiều bảng, hoặc bạn cần trích dẫn chính xác từng điều khoản thì nên làm đủ quy trình trên.

Câu hỏi thường gặp (FAQ)

Dán trực tiếp PDF/Word vào ChatGPT hay Claude có được không? Được, và với file ngắn, ít bảng thì thường ổn. Nhưng với file dài, nhiều bảng hoặc nhiều trang lặp header/footer, chuyển sang Markdown trước sẽ cho kết quả chính xác hơn rõ rệt.

NotebookLM có cần làm bước này không? NotebookLM đọc PDF/Word khá tốt cho việc tóm tắt tổng quát, nhưng khi tài liệu có nhiều bảng số liệu hoặc bạn cần AI trích dẫn đúng câu chữ, một bản Markdown sạch vẫn giúp câu trả lời sát tài liệu gốc hơn.

Làm sao biết tài liệu của tôi có vượt giới hạn của AI không? Dùng công cụ đếm token để ước lượng trước khi dán. Mỗi model có giới hạn khác nhau và hay thay đổi, nên cứ đếm trước cho chắc thay vì đoán.

Tôi cần hỏi đáp trên một trang web chứ không phải file, thì sao? Dùng công cụ chuyển trang web sang Markdown, dán URL vào là có ngay bản Markdown sạch, bỏ hết menu và quảng cáo, sẵn sàng đưa vào AI.


BKNS Tools — bộ công cụ chuẩn bị dữ liệu cho AI miễn phí của người Việt. Chuyển tài liệu sang Markdown · Chuyển trang web sang Markdown · Đếm token · Đếm từ — không cần đăng nhập.