AIDive

Gói video

Giới hạn tuần Claude Code bị cắt: đòn bẩy đã đo, bảng cache và checklist thứ Hai

10 phút đọc

TL;DR

  • Giới hạn hằng tuần của Claude Code đi từ mức cơ sở 100 lên mức khuyến mãi 150, rồi chốt ở mức cố định 125 vào ngày 14 tháng 9 năm 2026. So với mức khuyến mãi, đó là cắt giảm 17%; so với mức cơ sở cũ, đó là tăng 25%. Cả hai cách nói đều đúng cùng lúc.
  • Trong một tháng log cục bộ, subagent chiếm 48,1% tổng số token và 55,3% chi phí có trọng số. Đòn bẩy lớn nhất là chạy ít subagent hơn và gán một model nhỏ cho những subagent bạn giữ lại.
  • Subagent ghi cache 5 phút, còn phiên chính ghi cache 1 giờ. Một request tiếp theo sau khoảng nghỉ nguội phải ghi lại cache nhiều gấp khoảng 19 lần so với request còn nóng.
  • Một lần nghỉ dài hơn 60 phút trong phiên chính tốn trung vị 130.332 token ghi lại cache ở request kế tiếp, so với 1.176 khi khoảng nghỉ dưới 5 phút.
  • Hạ effort không làm giảm output mỗi request trong các log này (trung bình 778 token ở high so với 837 ở medium trên phiên chính), nên hãy coi đó là đánh đổi chất lượng, không phải khoản tiết kiệm miễn phí.
  • Tắt gợi ý prompt và lọc output của shell là những đòn bẩy có thật nhưng nhỏ. Tính chúng sau cùng.

Số liệu đo cho thấy gì

Phép tính đằng sau tiêu đề: mức cơ sở 100, mức khuyến mãi 150, mức cố định 125. 125 / 150 = 0,8333, nên mức cắt là 16,67%, làm tròn thành 17%. Cách hiểu sai là trừ các mức tăng (50% xuống 25%) rồi gọi đó là cắt 25%. s2

Đợt khuyến mãi chạy từ 13 tháng 5 năm 2026 đến 13 tháng 9 năm 2026, tăng giới hạn hằng tuần thêm 50% chỉ trong Claude Code, và không đụng đến giới hạn 5 giờ. Nó áp dụng cho các gói Pro, Max, Team và Enterprise tính theo seat. s1

Các số đo dưới đây lấy từ log Claude Code của một máy: 455 phiên chính, 2.631 lượt chạy subagent, 63.398 request đã khử trùng lặp trong khoảng 2026-09-03 đến 2026-10-03. Phát hiện đầu tiên nằm ở chính việc đếm: mỗi request xuất hiện trung bình trên 1,96 dòng log, nên cộng mọi dòng sẽ làm tổng token cao hơn thực tế 99,3%. Mọi script đọc các log này phải khử trùng lặp theo (message.id, requestId) trước. s11

Subagent là khoản lớn nhất. Sau khi khử trùng lặp, chúng chiếm 48,1% tổng token, 63,9% token output và 55,3% chi phí có trọng số. Request đầu tiên của một lượt chạy subagent mang prompt trung vị 47.117 token trước khi làm bất cứ việc gì; p90 là 52.681 và max là 126.769. Các agent có bộ tool bị hạn chế khởi đầu thấp hơn nhiều (min 5.295). s8

Việc chọn model làm mọi thứ nặng thêm. Subagent kế thừa model của cuộc hội thoại chính trừ khi frontmatter model, tham số model theo từng lần gọi, hoặc CLAUDE_CODE_SUBAGENT_MODEL chỉ định khác, và kể từ v2.1.251 riêng biến môi trường không còn ghi đè frontmatter: bạn cần CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1. Trong log, riêng claude-opus-5 chiếm 31,5% tổng token và 35,8% chi phí có trọng số, trong đó 63,2% được dùng bên trong subagent. s3

Tầng cache do nơi request chạy quyết định. Trong dữ liệu này, 100,0% lượt ghi cache của subagent là 5 phút và 100,0% lượt ghi cache của phiên chính là 1 giờ; không có request nào chia lẫn. Bên trong các lượt chạy subagent, chỉ 95 trên 41.790 request tiếp theo (0,2%) đến sau khoảng nghỉ trên 5 phút, nhưng chúng ghi trung bình 74.582 token cache_creation so với 3.886 của request còn nóng. Cài đặt subagentPromptCacheTtl và biến môi trường CLAUDE_CODE_SUBAGENT_PROMPT_CACHE_TTL nhận 5m hoặc 1h và yêu cầu Claude Code v2.1.242 trở lên. s4

Một lần chạy độc lập cũng thấy cùng kiểu chia: mọi request của subagent được ghi dưới ephemeral_5m_input_tokens trong khi phiên cha dùng ephemeral_1h_input_tokens, và một agent ghi lại toàn bộ 20.971 token của prefix ở một request đến sau cửa sổ năm phút. s6

Tương đương ở phiên chính là lần nghỉ dài. Các request đến dưới 5 phút sau request trước ghi trung vị 1.176 token cache_creation (n = 18.029). Từ 5 đến 60 phút là 1.327 (n = 414). Trên 60 phút là 130.332 (n = 79), với prompt trung vị 175.523 token và p90 là 674.348. Tài liệu xác nhận rằng khi bị tính phí vượt mức, cuộc hội thoại chính cũng rơi xuống tầng năm phút. s3

Lúc khởi động phiên là chi phí cố định: request đầu tiên của phiên chính mang trung vị 55.989 token (p90 72.000), dao động theo từng dự án từ 15.764 đến 105.020 tùy kích thước CLAUDE.md và bộ nhớ. Một phép đo công khai trước đó đặt mức sàn ở khoảng 29k trên thư mục trống, 30,4k với 3 MCP server và 38,8k trong một repo thật. s9

Effort là đòn bẩy mà tài liệu khuyến khích còn log thì không thưởng cho nó. Trên phiên chính, request ở high tạo trung bình 778 token output so với 837 ở medium; subagent ở high tạo 323 so với 642. Phép so sánh này bị nhiễu (khác task, model, dự án), nên nó là lý do để hoài nghi, không phải bằng chứng. Hướng dẫn của chính nhóm Claude Code coi effort là nơi chi tiêu suy luận, không phải núm vặn ngân sách. s10

Hai mẹo phổ biến hóa ra nhỏ. Gợi ý prompt tốn thêm request, và con số "tiết kiệm ~10%" được chia sẻ rộng rãi là mức trần, không phải mức tiết kiệm thông thường; cài đặt là promptSuggestionEnabled: false hoặc CLAUDE_CODE_ENABLE_PROMPT_SUGGESTION=false. s12 Lọc output của shell trong hai mươi ngày đã cắt 66,7 triệu token output xuống 24,1 triệu, nhưng 66,7 triệu đó chỉ bằng 7,4% số token mới tiêu thụ trong cùng khoảng thời gian. s11

Số đo

Chi phí khởi chạy subagent, prompt của request đầu tiên tính bằng token, theo model:

Model n min median p90 max
Tất cả 2,631 5,295 47,117 52,681 126,769
claude-opus-5 1,262 36,864 43,905 48,032 50,398
claude-sonnet-5 633 5,916 52,409 53,961 126,769
claude-opus-5-5 426 39,408 47,189 48,362 48,883
claude-sonnet-5-5 165 44,471 47,348 50,197 50,863
claude-fable-5-1 102 36,551 42,593 44,286 47,385
claude-haiku-4-5 42 5,295 29,636 36,714 79,190

Ghi lại cache khi tiếp tục, phiên chính, theo khoảng nghỉ trước request:

Khoảng nghỉ n cache_creation median mean cache_read median prompt median
< 5 min 18,029 1,176 2,391 184,169 186,412
5 đến 60 min 414 1,327 5,575 221,857 225,168
> 60 min 79 130,332 241,499 25,264 175,523

Quy trình: đọc mọi phiên chính ~/.claude/projects/*/<uuid>.jsonl và mọi lượt chạy */<uuid>/subagents/agent-*.jsonl, các request từ 2026-09-01. Khử trùng lặp các dòng assistant theo (message.id, requestId) và giữ một bản ghi usage cho mỗi request. Tổng token = input + output + cache_read + cache_creation; kích thước prompt = input + cache_read + cache_creation. Khoảng nghỉ = thời gian từ dòng log cuối của request trước đến dòng đầu của request này, trong cùng một phiên hoặc lượt chạy. Chi phí có trọng số dùng các trọng số tương đối input 1, ghi cache 5m 1,25, ghi cache 1h 2, đọc cache 0,1, output 5; các trọng số này là giả định, không phải giá công bố.

Làm vào thứ Hai

  • Chạy /usage trên gói của bạn và đọc phần phân tích theo skill, subagent, plugin và MCP, cùng các cờ hành vi được nêu ở mức 10% hoặc hơn của mức dùng gần đây.
  • Liệt kê các định nghĩa subagent của bạn và thêm frontmatter model: haiku hoặc model: sonnet cho mọi subagent chỉ tìm kiếm, kiểm tra hoặc tóm tắt.
  • Nếu muốn một model duy nhất cho mọi subagent bất kể frontmatter, đặt CLAUDE_CODE_SUBAGENT_MODEL và CLAUDE_CODE_SUBAGENT_MODEL_FORCE=1.
  • Kiểm tra phiên bản Claude Code của bạn là 2.1.242 trở lên, rồi quyết định theo từng workflow xem subagentPromptCacheTtl: "1h" có đáng không: nó giúp subagent nghỉ giữa các lần gọi tool, không giúp subagent ngắn.
  • Trước một lần nghỉ dài hơn một giờ, hoàn tất task trong phiên hiện tại và viết một file bàn giao; khi quay lại hãy mở phiên mới thay vì tiếp tục một prompt 175k token.
  • Viết một script chỉ đọc trên log của chính bạn, khử trùng lặp theo (message.id, requestId), và so sánh tỷ trọng phiên chính với subagent trước khi đổi bất cứ thứ gì khác.
  • Đặt promptSuggestionEnabled: false nếu bạn không bao giờ dùng các gợi ý, và coi khoản tiết kiệm là tối đa vài phần trăm.

Đọc thêm

  • Max 5x so với Max 20x: tỷ lệ dung lượng mà người dùng đo được sau đợt cắt là câu hỏi chọn gói mà video đã bỏ qua. s7
  • Toàn bộ chuỗi ưu tiên của cache TTL (env force, env theo bucket, cài đặt theo bucket, experimental.cacheTtl của subagent) và điều gì thay đổi khi bị tính phí vượt mức. s4
  • Vì sao đổi effort giữa phiên có thể đọc toàn bộ lịch sử mà không trúng cache trên hầu hết model, và model nào được miễn. s3
  • Cách đọc các trường usage và tầng cache trong log phiên của chính bạn, và cách ccboard dựng góc nhìn ngân sách theo ngày. s11
  • Ba file subagent với ba model và mỗi lần khởi chạy thực sự ghi gì vào cache, kèm các chỉnh sửa của chính tác giả. s8
  • Định nghĩa tool MCP trì hoãn và ENABLE_TOOL_SEARCH=auto:N để kiểm soát lúc nào schema của tool được nạp vào context. s3

Nguồn

FAQ

Đây là cắt 17% hay tăng 25%?

Cả hai, đo từ các mốc khác nhau. So với mức cơ sở 100 trước khuyến mãi, mức cố định 125 là tăng 25%. So với mức khuyến mãi 150 mà người dùng có từ 13 tháng 5 đến 13 tháng 9 năm 2026, đó là cắt 17%.

Có nên đặt subagentPromptCacheTtl thành 1h ở mọi nơi không?

Chỉ khi subagent của bạn nghỉ hơn năm phút giữa các request. Trong log, 0,2% request tiếp theo rơi vào trường hợp đó, nên tầng 1h áp dụng đại trà chủ yếu chỉ trả giá ghi cao hơn mà chẳng được gì. Hãy đo phân bố khoảng nghỉ của chính bạn trước.

Hạ effort có tiết kiệm token không?

Không thấy rõ trong các log này: request phiên chính ở high tạo trung bình 778 token output so với 837 ở medium. Dữ liệu bị nhiễu, nên câu trả lời trung thực là effort là núm chỉnh chất lượng mà khoản tiết kiệm bạn phải tự đo trên task của mình.

Vì sao prompt đầu tiên sau bữa trưa tốn nhiều vậy?

Phiên chính ghi cache 1 giờ. Sau khoảng nghỉ trên 60 phút, request kế tiếp ghi lại prefix: trung vị 130.332 token cache_creation trong log, so với 1.176 cho request còn nóng. Hãy hoàn tất task trước những lần nghỉ dài và bắt đầu mới sau đó.