搞懂用量限制:额度为什么「突然就没了」
五小时会话限制、周限制、Opus 单独一档——三层限制叠在一起。附官方给的八条省额度做法,以及怎么判断自己该买哪个档位。
- 出处
- Usage limit best practices
- 来自
- Anthropic 帮助中心
- 查证日期
- 2026/08/04
用着用着突然被告知额度用完了,而你觉得自己也没用多少——这种情况几乎每个人都遇到过。
原因是限制不止一层,而大多数人只知道其中一层。
三层限制,同时生效
第一层:五小时会话限制。 这是最常被提到的那个。用满之后要等会话周期结束才能继续。
第二层:周限制。 和五小时窗口分开算。周额度用完,光等五小时刷新没用——得等周期重置。
第三层:Opus 单独一档。 Max 计划有两个周限制:一个是 Opus 专用的,另一个覆盖其余所有模型。也就是说,Opus 的额度用完了,你还能继续用 Sonnet。
这三层解释了那个最常见的困惑:「我明明刚等过一轮,怎么还是不让用?」——你等的是五小时窗口,卡住你的是周限制。
看清楚自己在哪一层:Settings → Usage。 那个页面会分别显示五小时会话用了多少、还剩多久,以及 Opus 和其他模型各自的周限制什么时候重置。遇到问题先看这里,比猜快得多。
用量不是按消息条数算的
这是第二个常见误解。官方的说法是,影响用量的因素包括:
对话的长度和复杂度、你使用的功能、你在跟哪个 Claude 模型对话,以及你选择的 effort level
所以:
- 一条消息可以很贵。 塞进去一份 200 页的报告,和问一句「今天天气怎么样」,不是一个量级
- 对话越长越贵。 每一轮都要把之前的上下文重新带一遍,一个 50 轮的长对话,后面几轮的成本远高于开头
- 模型和 effort 都算钱。 同一个问题用 Opus + xhigh 跑,和用 Sonnet + medium 跑,差距很大
最实用的一条推论:与其在一个超长对话里反复追问,不如开个新对话、把必要的背景重贴一遍。 长对话的尾部,你付的大部分是「重读前面 49 轮」的钱。
Pro、Max 5x、Max 20x 差在哪
官方的定义很直接:
- Max 5x:每个会话的用量是 Pro 的 5 倍
- Max 20x:每个会话的用量是 Pro 的 20 倍
注意这里说的是用量倍数,不是别的。具体来说:
能用的模型是一样的。 Pro 也能用 Opus 5。
上下文窗口是一样的。 Opus 5 和 Sonnet 5 在所有付费计划上都是 1M token。一份 300 页的报告,Pro 也能整个读进去。
差的只是「能跑多少次」。
所以选档位的判断标准其实很简单:你是「偶尔要读一份很长的东西」,还是「每天都要跑很多次」? 前者 Pro 就够;只有后者才需要往上加。
官方给的八条省额度做法
这些是 Anthropic 自己的建议,比任何技巧贴都靠谱:
- 提问前先想清楚——减少来回试探的轮次
- 具体、简洁——把指令和必要背景一次说清
- 善用搜索与记忆——付费计划可以搜索历史对话,不用把旧内容重贴一遍
- 把同类请求打包——一条消息里问五件相关的事,比分五条问省
- 发送前检查提示词——一次说对,省掉后面三轮澄清
- 用 Projects 做缓存——官方原话是,引用 Projects 里的内容时,只有新的、未缓存的部分计入限额
- 盯着 Settings → Usage——别等被拦下来才发现
- 策略性地用缓存——把核心文档传进 Project
第 6 条对研究咨询工作价值最大。 如果你有一批要反复引用的材料——项目背景、访谈提纲、客户的历史报告、你自己的编码框架——把它们放进一个 Project。之后每次提问,这部分不重复计费。
一份 80 页的客户背景资料,你这个月要引用三十次。放进 Project 和每次重传,成本完全不是一回事。
一个实际的工作节奏
结合上面这些,一个务实的做法:
重活集中做。 需要 Opus + 高 effort 的深度分析,尽量安排在同一段时间里连着做完,而不是零散撒在一天里。
轻活用轻配置。 格式整理、翻译、摘要这类任务,Sonnet 完全够,effort 也不用拉满。为这些活儿开 Opus + xhigh,是在拿深度分析的额度做体力活。
长对话及时换新。 感觉到「这个对话已经很长了」的时候,就是该开新对话的时候。把结论带过去,把过程留下。
背景材料进 Project。 一次上传,全月受益。
最后
限制这件事,理解它比绕开它有用得多。
大部分「额度不够用」的情况,不是买少了,是在用高配跑低配的活儿。把模型和 effort 跟任务难度对上,同样的订阅能多干出不少事。