Claude Code 网关与用量

Claude Code 网关与用量

成本管理

3 分钟阅读

有效管理成本

跟踪 Token 用量、设置团队消费限额,并通过上下文管理、模型选择、扩展思考设置和预处理 Hook 降低 Claude Code 成本。

Claude Code 按 API Token 消耗计费。订阅方案(Pro、Max、Team、Enterprise)的价格请参阅 claude.com/pricing。每位开发者的成本会因模型选择、代码库大小和使用模式而有很大差异,例如是否运行多个实例或自动化任务。

在企业部署中,每位开发者每个活跃日的平均成本约为 $13,每月约为 $150–250;90% 用户的每个活跃日成本低于 $30。要估算团队自身的支出,请先从小规模试点组开始,使用下面的跟踪工具建立基线,再扩大推广范围。

本页面介绍如何跟踪成本管理团队成本以及减少 Token 用量

跟踪成本

使用 /usage 命令

/usage 中的 Session 块显示 API Token 用量,主要面向 API 用户。Claude Max 和 Pro 订阅已包含用量,因此,会话成本数字与账单无关。订阅用户会在同一界面看到方案用量条、活动统计和用量明细。

/usage 顶部的 Session 块会显示当前会话的详细 Token 用量统计。金额是在本地根据 Token 数量估算的,可能与实际账单不同。权威账单数据请查看 Claude Console 中的 Usage 页面。

Total cost:            $0.55
Total duration (API):  6m 19.7s
Total duration (wall): 6h 33m 10.2s
Total code changes:    0 lines added, 0 lines removed

在 Pro、Max、Team 或 Enterprise 方案中,/usage 还会显示计入方案限额的用量明细。它会将近期用量归因到 Skill、子智能体、插件和各个 MCP 服务器,并以占总量的百分比表示。按 dw 可在最近 24 小时和最近 7 天之间切换。这些数字根据本机的本地会话历史进行近似计算,不包括其他设备或 claude.ai 上的用量。

VS Code 扩展中,相同明细会显示在 Account & usage 对话框,并提供 Day 和 Week 切换选项。需要 Claude Code v2.1.174 或更高版本。

管理团队成本

使用 Claude API 时,可以针对 Claude Code workspace 的总支出设置 workspace 消费限额。管理员可以在 Console 中查看成本和用量报告

在 Pro 和 Max 方案中,可以使用 /usage-credits 命令为用量点数设置每月消费限额。如果达到限额但仍有可用的用量点数,Claude Code 会提示提高或移除限额,让你无需离开 CLI 即可继续。更改限额需要拥有账户的账单访问权限。

首次使用 Claude Console 账户验证 Claude Code 时,系统会自动创建名为“Claude Code”的 workspace。该 workspace 为组织的所有 Claude Code 用量提供集中式成本跟踪和管理。你无法为它创建 API key;它专门用于 Claude Code 身份验证和使用。

对于设有自定义速率限制的组织,此 workspace 中的 Claude Code 流量会计入组织总体 API 速率限制。可以在 Claude Console 的 Limits 页面为该 workspace 设置速率限制,限制 Claude Code 所占份额并保护其他生产工作负载。

在 Amazon Bedrock、Google Cloud's Agent Platform 和 Microsoft Foundry 上,Claude Code 不会从云端发送指标。自行托管的 Claude 应用网关可在这些提供商上提供按用户归因的用量、包含 Token 数量的 OTLP 指标及按用户设置的消费限额。通过其他 LLM 网关路由 Claude Code 的组织,也可以在网关上跟踪支出,因为网关能看到每个请求。

速率限制建议

为团队设置 Claude Code 时,可以根据组织规模参考以下每位用户的每分钟 Token 数 (TPM) 和每分钟请求数 (RPM):

团队规模每位用户的 TPM每位用户的 RPM
1-5 位用户200k-300k5-7
5-20 位用户100k-150k2.5-3.5
20-50 位用户50k-75k1.25-1.75
50-100 位用户25k-35k0.62-0.87
100-500 位用户15k-20k0.37-0.47
500+ 位用户10k-15k0.25-0.35

例如,如果有 200 位用户,可以为每位用户申请 20k TPM,即总共 400 万 TPM (200*20,000 = 4 million)。

随着团队扩大,每位用户所需的 TPM 会降低,因为大型组织中通常只有较少比例的用户会同时使用 Claude Code。这些速率限制在组织级别应用,而不是分别应用于每位用户,因此,其他人未使用服务时,单个用户可以暂时消耗超过其计算份额的容量。

如果预计会出现异常高的并发用量,例如面向大型群体的实时培训,可能需要为每位用户分配更高的 TPM。

智能体团队的 Token 成本

智能体团队会启动多个 Claude Code 实例,每个实例都有自己的上下文窗口。Token 用量会随活跃队友数量及各自运行时间而增长。

要控制智能体团队成本:

  • 为队友使用 Sonnet。它能在协调任务中兼顾能力和成本。
  • 保持较小的团队规模。每位队友都运行自己的上下文窗口,因此,Token 用量大致与团队规模成正比。
  • 让启动 Prompt 聚焦。队友会自动加载 CLAUDE.md、MCP 服务器和 Skill,但启动 Prompt 中的所有内容从一开始就会加入上下文。
  • 工作完成后关闭队友。每位活跃队友都会持续消耗 Token,直到退出或会话结束。
  • 智能体团队默认禁用。在 settings.json 或环境中设置 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 可启用。请参阅启用智能体团队

减少 Token 用量

Token 成本随上下文大小增长:Claude 处理的上下文越多,使用的 Token 就越多。Claude Code 会通过 Prompt 缓存自动优化成本,降低系统 Prompt 等重复内容的成本;还会在接近上下文限制时通过自动压缩总结对话历史。

以下策略可以缩小上下文,降低每条消息的成本。

主动管理上下文

使用 /usage 检查当前 Token 用量,或配置状态行持续显示。

  • 在任务之间清除上下文:切换到无关工作时,使用 /clear 重新开始。过时上下文会在之后的每条消息中浪费 Token。清除前使用 /rename,方便日后找到会话,再通过 /resume 返回。
  • 添加自定义压缩指令/compact Focus on code samples and API usage 会告诉 Claude 在总结期间保留什么。

也可以在项目根目录的 CLAUDE.md 文件中自定义压缩行为:

# 压缩指令

使用压缩时,请重点保留测试输出和代码更改

选择合适的模型

Sonnet 可以很好地处理大多数编码任务,成本也低于 Opus。将 Opus 留给复杂架构决策或多步推理。使用 /model 可以在会话中途切换模型,也可以在 /config 中设置默认值。对于简单的子智能体任务,请在子智能体配置中指定 model: haiku

减少 MCP 服务器开销

MCP 工具定义默认延迟加载,在 Claude 使用具体工具前,只有工具名称会进入上下文。运行 /context 可以查看哪些内容正在占用空间。

  • 有 CLI 工具时优先使用ghawsgcloudsentry-cli 等工具仍比 MCP 服务器更节省上下文,因为它们不会添加逐项工具清单。Claude 可以直接运行 CLI 命令。
  • 禁用未使用的服务器:运行 /mcp 查看已配置的服务器,并禁用当前未使用的服务器。

为强类型语言安装代码智能插件

代码智能插件可以提供精确的符号导航,避免依赖文本搜索,从而减少探索陌生代码时不必要的文件读取。一次“转到定义”调用可以取代 grep 后读取多个候选文件的过程。安装的语言服务器还会在编辑后自动报告类型错误,让 Claude 无需运行编译器也能发现问题。

将处理工作交给 Hook 和 Skill

自定义 Hook可以在 Claude 看到数据前进行预处理。与其让 Claude 读取 10,000 行日志来寻找错误,不如让 Hook grep ERROR 并只返回匹配行,将上下文从数万 Token 降至数百 Token。

Skill可以直接向 Claude 提供领域知识,避免探索。例如,“codebase-overview”Skill 可以说明项目架构、关键目录和命名约定。Claude 调用该 Skill 后会立即获得这些上下文,无需消耗 Token 读取多个文件来理解结构。

例如,以下 PreToolUse Hook 会筛选测试输出,只显示失败项:

将以下内容添加到 settings.json,在每条 Bash 命令前运行 Hook:

{
  "hooks": {
    "PreToolUse": [
      {
        "matcher": "Bash",
        "hooks": [
          {
            "type": "command",
            "command": "~/.claude/hooks/filter-test-output.sh"
          }
        ]
      }
    ]
  }
}

将指令从 CLAUDE.md 移到 Skill

CLAUDE.md 文件会在会话开始时加载到上下文。如果其中包含特定工作流的详细指令,例如 PR 评审或数据库迁移,那么即使执行无关工作,这些 Token 也始终存在。Skill只在调用时按需加载,因此,将专门指令移入 Skill 可以缩小基础上下文。CLAUDE.md 应尽量保持在 200 行以内,只包含必要内容。

调整扩展思考

扩展思考默认启用,因为它能显著提高复杂规划和推理任务的表现。思考 Token 按输出 Token 计费,默认预算可能达到每个请求数万 Token,具体取决于模型。对于不需要深度推理的简单任务,可以通过 /effort/model 降低 Effort 级别,在 /config 中禁用思考,或针对具有固定思考预算的模型,通过设置 MAX_THINKING_TOKENS 环境变量降低预算,例如 MAX_THINKING_TOKENS=8000。自适应推理模型会忽略非零预算,应改用 Effort 级别。Fable 5 始终使用扩展思考,因此无法禁用。

将输出冗长的操作委派给子智能体

运行测试、获取文档或处理日志文件会消耗大量上下文。将这些操作委派给子智能体,冗长输出便会保留在子智能体上下文中,只有摘要返回主对话。

管理智能体团队成本

队友在计划模式下运行时,智能体团队使用的 Token 大约是标准会话的 7 倍,因为每位队友都维护自己的上下文窗口,并作为单独的 Claude 实例运行。保持团队任务小而独立,以限制每位队友的 Token 用量。详情请参阅智能体团队

编写具体的 Prompt

“improve this codebase”之类的模糊请求会触发大范围扫描。“add input validation to the login function in auth.ts”之类的具体请求则能让 Claude 高效工作,并尽量减少文件读取。

高效处理复杂任务

对于耗时较长或更复杂的工作,以下习惯有助于避免因走错方向而浪费 Token:

  • 对复杂任务使用计划模式:实现前按 Shift+Tab 进入计划模式。Claude 会探索代码库并提出方案供你批准,避免最初方向错误带来代价高昂的返工。
  • 尽早纠正方向:如果 Claude 开始走错方向,立即按 Escape 停止。使用 /rewind 或连按两次 Escape,将对话和代码恢复到之前的检查点。
  • 提供验证目标:在 Prompt 中加入测试用例、粘贴截图或定义预期输出。Claude 能验证自己的工作时,可以在你要求修复前发现问题。
  • 增量测试:编写一个文件,测试后再继续。这样可以尽早发现问题,并以较低成本修复。

后台 Token 用量

即使处于空闲状态,Claude Code 的部分后台功能也会使用 Token:

  • 对话总结:为 claude --resume 功能总结之前对话的后台任务
  • 命令处理/usage 等部分命令可能发出请求以检查状态

即使没有主动交互,这些后台进程也会消耗少量 Token(通常每个会话低于 $0.04)。

了解 Claude Code 行为变化

Claude Code 会定期更新,功能行为(包括成本报告)可能随之变化。运行 claude --version 可以检查当前版本。有关具体账单问题,请通过 Console 账户联系 Anthropic 支持。