搞懂用量限制:额度为什么「突然就没了」

五小时会话限制、周限制、Opus 单独一档——三层限制叠在一起。附官方给的八条省额度做法,以及怎么判断自己该买哪个档位。

2026/08/04约 6 分钟HiBridge 原创
方法来源本文由 HiBridge 撰写,方法来自下面的出处。
出处
Usage limit best practices
来自
Anthropic 帮助中心
查证日期
2026/08/04

用着用着突然被告知额度用完了,而你觉得自己也没用多少——这种情况几乎每个人都遇到过。

原因是限制不止一层,而大多数人只知道其中一层。

三层限制,同时生效

第一层:五小时会话限制。 这是最常被提到的那个。用满之后要等会话周期结束才能继续。

第二层:周限制。 和五小时窗口分开算。周额度用完,光等五小时刷新没用——得等周期重置。

第三层:Opus 单独一档。 Max 计划有两个周限制:一个是 Opus 专用的,另一个覆盖其余所有模型。也就是说,Opus 的额度用完了,你还能继续用 Sonnet。

这三层解释了那个最常见的困惑:「我明明刚等过一轮,怎么还是不让用?」——你等的是五小时窗口,卡住你的是周限制。

看清楚自己在哪一层:Settings → Usage。 那个页面会分别显示五小时会话用了多少、还剩多久,以及 Opus 和其他模型各自的周限制什么时候重置。遇到问题先看这里,比猜快得多。

用量不是按消息条数算的

这是第二个常见误解。官方的说法是,影响用量的因素包括:

对话的长度和复杂度、你使用的功能、你在跟哪个 Claude 模型对话,以及你选择的 effort level

所以:

  • 一条消息可以很贵。 塞进去一份 200 页的报告,和问一句「今天天气怎么样」,不是一个量级
  • 对话越长越贵。 每一轮都要把之前的上下文重新带一遍,一个 50 轮的长对话,后面几轮的成本远高于开头
  • 模型和 effort 都算钱。 同一个问题用 Opus + xhigh 跑,和用 Sonnet + medium 跑,差距很大

最实用的一条推论:与其在一个超长对话里反复追问,不如开个新对话、把必要的背景重贴一遍。 长对话的尾部,你付的大部分是「重读前面 49 轮」的钱。

Pro、Max 5x、Max 20x 差在哪

官方的定义很直接:

  • Max 5x:每个会话的用量是 Pro 的 5 倍
  • Max 20x:每个会话的用量是 Pro 的 20 倍

注意这里说的是用量倍数,不是别的。具体来说:

能用的模型是一样的。 Pro 也能用 Opus 5。

上下文窗口是一样的。 Opus 5 和 Sonnet 5 在所有付费计划上都是 1M token。一份 300 页的报告,Pro 也能整个读进去。

差的只是「能跑多少次」。

所以选档位的判断标准其实很简单:你是「偶尔要读一份很长的东西」,还是「每天都要跑很多次」? 前者 Pro 就够;只有后者才需要往上加。

官方给的八条省额度做法

这些是 Anthropic 自己的建议,比任何技巧贴都靠谱:

  1. 提问前先想清楚——减少来回试探的轮次
  2. 具体、简洁——把指令和必要背景一次说清
  3. 善用搜索与记忆——付费计划可以搜索历史对话,不用把旧内容重贴一遍
  4. 把同类请求打包——一条消息里问五件相关的事,比分五条问省
  5. 发送前检查提示词——一次说对,省掉后面三轮澄清
  6. 用 Projects 做缓存——官方原话是,引用 Projects 里的内容时,只有新的、未缓存的部分计入限额
  7. 盯着 Settings → Usage——别等被拦下来才发现
  8. 策略性地用缓存——把核心文档传进 Project

第 6 条对研究咨询工作价值最大。 如果你有一批要反复引用的材料——项目背景、访谈提纲、客户的历史报告、你自己的编码框架——把它们放进一个 Project。之后每次提问,这部分不重复计费。

一份 80 页的客户背景资料,你这个月要引用三十次。放进 Project 和每次重传,成本完全不是一回事。

一个实际的工作节奏

结合上面这些,一个务实的做法:

重活集中做。 需要 Opus + 高 effort 的深度分析,尽量安排在同一段时间里连着做完,而不是零散撒在一天里。

轻活用轻配置。 格式整理、翻译、摘要这类任务,Sonnet 完全够,effort 也不用拉满。为这些活儿开 Opus + xhigh,是在拿深度分析的额度做体力活。

长对话及时换新。 感觉到「这个对话已经很长了」的时候,就是该开新对话的时候。把结论带过去,把过程留下。

背景材料进 Project。 一次上传,全月受益。

最后

限制这件事,理解它比绕开它有用得多。

大部分「额度不够用」的情况,不是买少了,是在用高配跑低配的活儿。把模型和 effort 跟任务难度对上,同样的订阅能多干出不少事。