TL;DR
- Giới hạn hằng tuần của Claude Code đi từ mức cơ sở 100 lên mức khuyến mãi 150, rồi chốt ở mức cố định 125 vào ngày 14 tháng 9 năm 2026. So với mức khuyến mãi, đó là cắt giảm 17%; so với mức cơ sở cũ, đó là tăng 25%. Cả hai cách nói đều đúng cùng lúc.
- Trong một tháng log cục bộ, subagent chiếm 48,1% tổng số token và 55,3% chi phí có trọng số. Đòn bẩy lớn nhất là chạy ít subagent hơn và gán một model nhỏ cho những subagent bạn giữ lại.
- Subagent ghi cache 5 phút, còn phiên chính ghi cache 1 giờ. Một request tiếp theo sau khoảng nghỉ nguội phải ghi lại cache nhiều gấp khoảng 19 lần so với request còn nóng.
- Một lần nghỉ dài hơn 60 phút trong phiên chính tốn trung vị 130.332 token ghi lại cache ở request kế tiếp, so với 1.176 khi khoảng nghỉ dưới 5 phút.
- Hạ effort không làm giảm output mỗi request trong các log này (trung bình 778 token ở high so với 837 ở medium trên phiên chính), nên hãy coi đó là đánh đổi chất lượng, không phải khoản tiết kiệm miễn phí.
- Tắt gợi ý prompt và lọc output của shell là những đòn bẩy có thật nhưng nhỏ. Tính chúng sau cùng.
Số liệu đo cho thấy gì
Phép tính đằng sau tiêu đề: mức cơ sở 100, mức khuyến mãi 150, mức cố định 125. 125 / 150 = 0,8333, nên mức cắt là 16,67%, làm tròn thành 17%. Cách hiểu sai là trừ các mức tăng (50% xuống 25%) rồi gọi đó là cắt 25%. s2
Đợt khuyến mãi chạy từ 13 tháng 5 năm 2026 đến 13 tháng 9 năm 2026, tăng giới hạn hằng tuần thêm 50% chỉ trong Claude Code, và không đụng đến giới hạn 5 giờ. Nó áp dụng cho các gói Pro, Max, Team và Enterprise tính theo seat. s1
Các số đo dưới đây lấy từ log Claude Code của một máy: 455 phiên chính, 2.631 lượt chạy subagent, 63.398 request đã khử trùng lặp trong khoảng 2026-09-03 đến 2026-10-03. Phát hiện đầu tiên nằm ở chính việc đếm: mỗi request xuất hiện trung bình trên 1,96 dòng log, nên cộng mọi dòng sẽ làm tổng token cao hơn thực tế 99,3%. Mọi script đọc các log này phải khử trùng lặp theo (message.id, requestId) trước. s11
Subagent là khoản lớn nhất. Sau khi khử trùng lặp, chúng chiếm 48,1% tổng token, 63,9% token output và 55,3% chi phí có trọng số. Request đầu tiên của một lượt chạy subagent mang prompt trung vị 47.117 token trước khi làm bất cứ việc gì; p90 là 52.681 và max là 126.769. Các agent có bộ tool bị hạn chế khởi đầu thấp hơn nhiều (min 5.295). s8
Việc chọn model làm mọi thứ nặng thêm. Subagent kế thừa model của cuộc hội thoại chính trừ khi frontmatter model, tham số model theo từng lần gọi, hoặc CLAUDE_CODE_SUBAGENT_MODEL chỉ định khác, và kể từ v2.1.251 riêng biến môi trường không còn ghi đè frontmatter: bạn cần CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Trong log, riêng claude-opus-5 chiếm 31,5% tổng token và 35,8% chi phí có trọng số, trong đó 63,2% được dùng bên trong subagent. s3
Tầng cache do nơi request chạy quyết định. Trong dữ liệu này, 100,0% lượt ghi cache của subagent là 5 phút và 100,0% lượt ghi cache của phiên chính là 1 giờ; không có request nào chia lẫn. Bên trong các lượt chạy subagent, chỉ 95 trên 41.790 request tiếp theo (0,2%) đến sau khoảng nghỉ trên 5 phút, nhưng chúng ghi trung bình 74.582 token cache_creation so với 3.886 của request còn nóng. Cài đặt subagentPromptCacheTtl và biến môi trường CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL nhận 5m hoặc 1h và yêu cầu Claude Code v2.1.242 trở lên. s4
Một lần chạy độc lập cũng thấy cùng kiểu chia: mọi request của subagent được ghi dưới ephemeral_5m_input_tokens trong khi phiên cha dùng ephemeral_1h_input_tokens, và một agent ghi lại toàn bộ 20.971 token của prefix ở một request đến sau cửa sổ năm phút. s6
Tương đương ở phiên chính là lần nghỉ dài. Các request đến dưới 5 phút sau request trước ghi trung vị 1.176 token cache_creation (n = 18.029). Từ 5 đến 60 phút là 1.327 (n = 414). Trên 60 phút là 130.332 (n = 79), với prompt trung vị 175.523 token và p90 là 674.348. Tài liệu xác nhận rằng khi bị tính phí vượt mức, cuộc hội thoại chính cũng rơi xuống tầng năm phút. s3
Lúc khởi động phiên là chi phí cố định: request đầu tiên của phiên chính mang trung vị 55.989 token (p90 72.000), dao động theo từng dự án từ 15.764 đến 105.020 tùy kích thước CLAUDE.md và bộ nhớ. Một phép đo công khai trước đó đặt mức sàn ở khoảng 29k trên thư mục trống, 30,4k với 3 MCP server và 38,8k trong một repo thật. s9
Effort là đòn bẩy mà tài liệu khuyến khích còn log thì không thưởng cho nó. Trên phiên chính, request ở high tạo trung bình 778 token output so với 837 ở medium; subagent ở high tạo 323 so với 642. Phép so sánh này bị nhiễu (khác task, model, dự án), nên nó là lý do để hoài nghi, không phải bằng chứng. Hướng dẫn của chính nhóm Claude Code coi effort là nơi chi tiêu suy luận, không phải núm vặn ngân sách. s10
Hai mẹo phổ biến hóa ra nhỏ. Gợi ý prompt tốn thêm request, và con số "tiết kiệm ~10%" được chia sẻ rộng rãi là mức trần, không phải mức tiết kiệm thông thường; cài đặt là promptSuggestionEnabled: false hoặc CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Lọc output của shell trong hai mươi ngày đã cắt 66,7 triệu token output xuống 24,1 triệu, nhưng 66,7 triệu đó chỉ bằng 7,4% số token mới tiêu thụ trong cùng khoảng thời gian. s11
Số đo
Chi phí khởi chạy subagent, prompt của request đầu tiên tính bằng token, theo model:
| Model | n | min | median | p90 | max |
|---|---|---|---|---|---|
| Tất cả | 2,631 | 5,295 | 47,117 | 52,681 | 126,769 |
| claude-opus-5 | 1,262 | 36,864 | 43,905 | 48,032 | 50,398 |
| claude-sonnet-5 | 633 | 5,916 | 52,409 | 53,961 | 126,769 |
| claude-opus-5-5 | 426 | 39,408 | 47,189 | 48,362 | 48,883 |
| claude-sonnet-5-5 | 165 | 44,471 | 47,348 | 50,197 | 50,863 |
| claude-fable-5-1 | 102 | 36,551 | 42,593 | 44,286 | 47,385 |
| claude-haiku-4-5 | 42 | 5,295 | 29,636 | 36,714 | 79,190 |
Ghi lại cache khi tiếp tục, phiên chính, theo khoảng nghỉ trước request:
| Khoảng nghỉ | n | cache_creation median | mean | cache_read median | prompt median |
|---|---|---|---|---|---|
| < 5 min | 18,029 | 1,176 | 2,391 | 184,169 | 186,412 |
| 5 đến 60 min | 414 | 1,327 | 5,575 | 221,857 | 225,168 |
| > 60 min | 79 | 130,332 | 241,499 | 25,264 | 175,523 |
Quy trình: đọc mọi phiên chính ~/.claude/projects/*/<uuid>.jsonl và mọi lượt chạy */<uuid>/subagents/agent-*.jsonl, các request từ 2026-09-01. Khử trùng lặp các dòng assistant theo (message.id, requestId) và giữ một bản ghi usage cho mỗi request. Tổng token = input + output + cache_read + cache_creation; kích thước prompt = input + cache_read + cache_creation. Khoảng nghỉ = thời gian từ dòng log cuối của request trước đến dòng đầu của request này, trong cùng một phiên hoặc lượt chạy. Chi phí có trọng số dùng các trọng số tương đối input 1, ghi cache 5m 1,25, ghi cache 1h 2, đọc cache 0,1, output 5; các trọng số này là giả định, không phải giá công bố.
Làm vào thứ Hai
- Chạy
/usagetrên gói của bạn và đọc phần phân tích theo skill, subagent, plugin và MCP, cùng các cờ hành vi được nêu ở mức 10% hoặc hơn của mức dùng gần đây. - Liệt kê các định nghĩa subagent của bạn và thêm frontmatter
model: haikuhoặcmodel: sonnetcho mọi subagent chỉ tìm kiếm, kiểm tra hoặc tóm tắt. - Nếu muốn một model duy nhất cho mọi subagent bất kể frontmatter, đặt
CLAUDE_CODE_SUBAGENT_MODELvàCLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. - Kiểm tra phiên bản Claude Code của bạn là 2.1.242 trở lên, rồi quyết định theo từng workflow xem
subagentPromptCacheTtl: "1h"có đáng không: nó giúp subagent nghỉ giữa các lần gọi tool, không giúp subagent ngắn. - Trước một lần nghỉ dài hơn một giờ, hoàn tất task trong phiên hiện tại và viết một file bàn giao; khi quay lại hãy mở phiên mới thay vì tiếp tục một prompt 175k token.
- Viết một script chỉ đọc trên log của chính bạn, khử trùng lặp theo (message.id, requestId), và so sánh tỷ trọng phiên chính với subagent trước khi đổi bất cứ thứ gì khác.
- Đặt
promptSuggestionEnabled: falsenếu bạn không bao giờ dùng các gợi ý, và coi khoản tiết kiệm là tối đa vài phần trăm.
Đọc thêm
- Max 5x so với Max 20x: tỷ lệ dung lượng mà người dùng đo được sau đợt cắt là câu hỏi chọn gói mà video đã bỏ qua. s7
- Toàn bộ chuỗi ưu tiên của cache TTL (env force, env theo bucket, cài đặt theo bucket,
experimental.cacheTtlcủa subagent) và điều gì thay đổi khi bị tính phí vượt mức. s4 - Vì sao đổi effort giữa phiên có thể đọc toàn bộ lịch sử mà không trúng cache trên hầu hết model, và model nào được miễn. s3
- Cách đọc các trường
usagevà tầng cache trong log phiên của chính bạn, và cách ccboard dựng góc nhìn ngân sách theo ngày. s11 - Ba file subagent với ba model và mỗi lần khởi chạy thực sự ghi gì vào cache, kèm các chỉnh sửa của chính tác giả. s8
- Định nghĩa tool MCP trì hoãn và
ENABLE_TOOL_SEARCH=auto:Nđể kiểm soát lúc nào schema của tool được nạp vào context. s3
Nguồn
- Claude Code May to August 2026 weekly limits promotion, Anthropic help center. Vì sao nên đọc: ngày tháng, gói và phạm vi chính xác của đợt khuyến mãi 50%, bằng lời của Anthropic.
- Anthropic is cutting Claude Code's current weekly limits by 17 percent, BleepingComputer. Vì sao nên đọc: mức tăng 25% và mức cắt 17% đặt cạnh nhau, kèm trích dẫn thông báo.
- Manage costs effectively, Claude Code docs. Vì sao nên đọc: phần phân tích
/usage, việc subagent kế thừa model, và các quy tắc cache về effort và MCP. - How Claude Code uses prompt caching, Claude Code docs. Vì sao nên đọc: mô tả chính thức duy nhất về các tầng 5m và 1h và các cài đặt TTL.
- Sub-agents burning your Claude Code 5-hour window? Check the cache TTL, Reddit r/ClaudeAI. Vì sao nên đọc: thread đã làm lộ cache 5 phút của subagent, kèm cài đặt để đổi nó.
- Max20x is now just 1.5 times better than Max5x, Reddit r/ClaudeCode. Vì sao nên đọc: so sánh dung lượng từ phía người dùng giữa hai tầng Max sau đợt cắt.
- Three Claude Code subagent files, three models in frontmatter, dev.to. Vì sao nên đọc: một thí nghiệm chi phí khởi chạy có thể tái lập, với các trường usage thô và những chỉnh sửa trung thực.
- Claude Code token overhead: what 33k actually costs, devaireviews.com. Vì sao nên đọc: phép đo chi phí khởi động trên thư mục trống, với MCP server và trong một repo thật.
- Using Claude Code: Spending your effort, X, Claude Code team. Vì sao nên đọc: cách nhóm nghĩ về các mức effort; bài không có con số token nào, và đó chính là điểm đáng chú ý.
- The real cost of AI, part 9: measure your own usage, florian.bruniaux.com. Vì sao nên đọc: một nghiên cứu log hai mươi ngày đặt việc lọc output shell đúng tỷ lệ so với tổng mức tiêu thụ.
- PSA: Turn off Prompt Suggestions, save ~10% of your limits/spend, Reddit r/ClaudeAI. Vì sao nên đọc: tuyên bố gốc và thread thu hẹp con số 10% thành mức trần.
FAQ
Đây là cắt 17% hay tăng 25%?
Cả hai, đo từ các mốc khác nhau. So với mức cơ sở 100 trước khuyến mãi, mức cố định 125 là tăng 25%. So với mức khuyến mãi 150 mà người dùng có từ 13 tháng 5 đến 13 tháng 9 năm 2026, đó là cắt 17%.
Có nên đặt subagentPromptCacheTtl thành 1h ở mọi nơi không?
Chỉ khi subagent của bạn nghỉ hơn năm phút giữa các request. Trong log, 0,2% request tiếp theo rơi vào trường hợp đó, nên tầng 1h áp dụng đại trà chủ yếu chỉ trả giá ghi cao hơn mà chẳng được gì. Hãy đo phân bố khoảng nghỉ của chính bạn trước.
Hạ effort có tiết kiệm token không?
Không thấy rõ trong các log này: request phiên chính ở high tạo trung bình 778 token output so với 837 ở medium. Dữ liệu bị nhiễu, nên câu trả lời trung thực là effort là núm chỉnh chất lượng mà khoản tiết kiệm bạn phải tự đo trên task của mình.
Vì sao prompt đầu tiên sau bữa trưa tốn nhiều vậy?
Phiên chính ghi cache 1 giờ. Sau khoảng nghỉ trên 60 phút, request kế tiếp ghi lại prefix: trung vị 130.332 token cache_creation trong log, so với 1.176 cho request còn nóng. Hãy hoàn tất task trước những lần nghỉ dài và bắt đầu mới sau đó.
AIDive