Bạn có biết rằng hàng chục ngàn token của mình đang bị "đốt" mỗi giây bởi những tiến trình ngầm mà bạn thậm chí còn chưa bắt đầu gõ lệnh? Trong kỷ nguyên phát triển phần mềm bằng AI, "ngữ cảnh" (context window) chính là hơi thở, nhưng cũng là cái bẫy chết người. Khi cửa sổ ngữ cảnh bị lấp đầy, hiện tượng "thối rữa ngữ cảnh" (context rot) xuất hiện, biến một trợ lý thông minh thành một thực thể lú lẫn, quên trước quên sau, đồng thời "đục khoét" túi tiền của bạn thông qua hóa đơn API chóng mặt. Đã đến lúc ngừng việc ném tiền qua cửa sổ và bắt đầu làm chủ nghệ thuật "hack" token chuyên nghiệp.
claude.md cồng kềnh sang hệ thống Skills thông minh giúp tối ưu hóa tải trọng ngữ cảnh./status và /cost để kiểm soát chi phí như một kỹ sư AI thực thụ.Nhiều lập trình viên lầm tưởng rằng chỉ khi đặt câu hỏi, token mới bắt đầu được tính. Thực tế đau lòng hơn nhiều. Ngay khi bạn khởi chạy một phiên làm việc, Claude đã bắt đầu "ăn" tài nguyên. Nếu bạn tò mò, hãy thử gõ lệnh /context vào Terminal. Những gì hiện ra trên màn hình chính là "hóa đơn ngầm" đang đè nặng lên phiên làm việc của bạn.
claude.md toàn cục và cục bộ, hay memory.md, luôn được nạp vào đầu mỗi phiên. Nếu tệp này quá dài, nó trở thành một gánh nặng thường trực.
| Thành phần | Mức độ chiếm dụng Token | Giải pháp |
|---|---|---|
| MCP Tools | Cao (20k - 30k) | Cài đặt có chọn lọc, chỉ giữ lại các server thiết yếu |
| System Tools | Trung bình (~17k) | Chấp nhận là chi phí cố định, đừng lạm dụng thêm plugin |
| System Prompts | Thấp (Tùy tệp) | Giới hạn 200-500 dòng, loại bỏ các chỉ dẫn thừa |
Khi cuộc hội thoại kéo dài, bộ nhớ của AI sẽ bị nhiễu bởi các thông tin cũ. Hệ thống có cơ chế tự động "auto-compact" khi chạm ngưỡng buffer, nhưng việc chờ đợi hệ thống tự làm việc thường dẫn đến sai sót hoặc mất mát thông tin quan trọng.
Thay vì thụ động, hãy chủ động gõ /compact. Đây là lệnh cho phép bạn ép toàn bộ lịch sử trò chuyện dài dòng—vốn có thể lên tới 15.000 token—thành một bản tóm tắt tinh gọn.
Tại sao nó hiệu quả?
Lệnh này sử dụng các mô hình nén ngữ cảnh với mật độ thông tin cực cao. Nó không xóa đi dữ liệu của bạn, mà nó "biên tập" lại quá khứ thành những ý chính (key takeaways) mà AI có thể truy xuất nhanh chóng sau này. Bạn thậm chí có thể gõ /compact --keep "logic của hàm xử lý thanh toán" để yêu cầu Claude giữ lại những chi tiết cốt lõi nhất, tránh việc AI quên mất các cấu trúc logic quan trọng trong dự án.
Để không phải "khóc ròng" khi nhìn hóa đơn API cuối tháng, các kỹ sư Claude Code chuyên nghiệp luôn áp dụng những nguyên tắc vàng dưới đây:
Đừng đoán mò về số token còn lại. Hãy gõ /status line để kích hoạt thanh tiến trình hiển thị trực tiếp ngay dưới dòng lệnh. Khi kết hợp với lệnh /cost, bạn sẽ thấy chi phí của từng hành động nhảy số theo thời gian thực. Nhìn thấy con số 0.05$ hay 0.20$ cho mỗi prompt sẽ rèn luyện cho bạn thói quen tư duy "tiết kiệm token" cực tốt.

Tệp claude.md nên là "bí kíp" ngắn gọn, không phải một cuốn tiểu thuyết. Hãy giới hạn nó ở mức 200-500 dòng. Đối với những kiến thức chuyên sâu hoặc hướng dẫn dự án phức tạp, hãy sử dụng Skills.
Lập trình với AI dễ rơi vào vòng lặp "thử sai" (trial and error), mỗi bước sai đều tốn token. Chế độ Plan Mode giúp Claude nghiên cứu thư mục, phác thảo giải pháp trước khi thực thi. Việc dành 1.000 token để lập kế hoạch giúp bạn tiết kiệm 10.000 token cho việc debug lỗi do code ẩu gây ra.
Khi bạn chuyển từ công việc này sang công việc khác (ví dụ: đang code UI chuyển sang cấu hình Database), hãy gõ /clear. Lệnh này xóa sạch ngữ cảnh phiên cũ, đưa bộ nhớ về con số 0. Một môi trường "sạch" giúp AI tránh được sự nhiễu loạn từ những yêu cầu cũ, vốn là nguyên nhân chính dẫn đến các lỗi lú lẫn ngữ cảnh.
Opus là mô hình mạnh nhất, nhưng dùng Opus để đọc tài liệu dài 50 trang thì chẳng khác nào dùng dao mổ trâu để cắt giấy.
Chiến thuật phân cấp mô hình:

| Tác vụ | Mô hình khuyến nghị | Lý do |
|---|---|---|
| Viết Code logic phức tạp | Claude 3.5 Sonnet / Opus | Cần tư duy sâu |
| Đọc tài liệu dài/Duyệt web | Claude 3.5 Sonnet | Chi phí thấp, ngữ cảnh rộng |
| Refactor/Refine code | Claude 3.5 Sonnet | Hiệu năng/chi phí tối ưu |
Quản lý token không chỉ là câu chuyện về tiền bạc, đó là câu chuyện về việc làm chủ công cụ. Một lập trình viên biết quản lý token là người biết cách "dọn dẹp bộ não" cho AI, giúp nó luôn giữ được sự minh mẫn và hiệu quả. Bằng cách áp dụng kỷ luật trong cấu hình và sử dụng các lệnh tối ưu, bạn không chỉ tiết kiệm hàng trăm đô la mỗi tháng mà còn tăng tốc độ phát triển sản phẩm một cách đáng kinh ngạc.
Trong bài viết tiếp theo, chúng ta sẽ bước sâu hơn vào thế giới ẩn giấu của thư mục .claude, nơi bạn có thể tùy biến các quy tắc và "memory" để biến Claude thành một cộng sự hiểu ý bạn đến từng chi tiết nhỏ nhất. Đừng bỏ lỡ!
claude.md là phần cứng trong ngữ cảnh, nó luôn tồn tại ở đó. Skills giống như một "thư viện rời" mà bạn chỉ mở ra khi cần, giúp tiết kiệm không gian đáng kể cho các tác vụ hàng ngày.