Claude Code 网关与用量
Claude Code 网关与用量
成本管理
3 分钟阅读
有效管理成本
跟踪 Token 用量、设置团队消费限额,并通过上下文管理、模型选择、扩展思考设置和预处理 Hook 降低 Claude Code 成本。
Claude Code 按 API Token 消耗计费。订阅方案(Pro、Max、Team、Enterprise)的价格请参阅 claude.com/pricing。每位开发者的成本会因模型选择、代码库大小和使用模式而有很大差异,例如是否运行多个实例或自动化任务。
在企业部署中,每位开发者每个活跃日的平均成本约为 $13,每月约为 $150–250;90% 用户的每个活跃日成本低于 $30。要估算团队自身的支出,请先从小规模试点组开始,使用下面的跟踪工具建立基线,再扩大推广范围。
本页面介绍如何跟踪成本、管理团队成本以及减少 Token 用量。
跟踪成本
使用 /usage 命令
/usage 中的 Session 块显示 API Token 用量,主要面向 API 用户。Claude Max 和 Pro 订阅已包含用量,因此,会话成本数字与账单无关。订阅用户会在同一界面看到方案用量条、活动统计和用量明细。
/usage 顶部的 Session 块会显示当前会话的详细 Token 用量统计。金额是在本地根据 Token 数量估算的,可能与实际账单不同。权威账单数据请查看 Claude Console 中的 Usage 页面。
在 Pro、Max、Team 或 Enterprise 方案中,/usage 还会显示计入方案限额的用量明细。它会将近期用量归因到 Skill、子智能体、插件和各个 MCP 服务器,并以占总量的百分比表示。按 d 或 w 可在最近 24 小时和最近 7 天之间切换。这些数字根据本机的本地会话历史进行近似计算,不包括其他设备或 claude.ai 上的用量。
在 VS Code 扩展中,相同明细会显示在 Account & usage 对话框,并提供 Day 和 Week 切换选项。需要 Claude Code v2.1.174 或更高版本。
管理团队成本
使用 Claude API 时,可以针对 Claude Code workspace 的总支出设置 workspace 消费限额。管理员可以在 Console 中查看成本和用量报告。
在 Pro 和 Max 方案中,可以使用 /usage-credits 命令为用量点数设置每月消费限额。如果达到限额但仍有可用的用量点数,Claude Code 会提示提高或移除限额,让你无需离开 CLI 即可继续。更改限额需要拥有账户的账单访问权限。
首次使用 Claude Console 账户验证 Claude Code 时,系统会自动创建名为“Claude Code”的 workspace。该 workspace 为组织的所有 Claude Code 用量提供集中式成本跟踪和管理。你无法为它创建 API key;它专门用于 Claude Code 身份验证和使用。
对于设有自定义速率限制的组织,此 workspace 中的 Claude Code 流量会计入组织总体 API 速率限制。可以在 Claude Console 的 Limits 页面为该 workspace 设置速率限制,限制 Claude Code 所占份额并保护其他生产工作负载。
在 Amazon Bedrock、Google Cloud's Agent Platform 和 Microsoft Foundry 上,Claude Code 不会从云端发送指标。自行托管的 Claude 应用网关可在这些提供商上提供按用户归因的用量、包含 Token 数量的 OTLP 指标及按用户设置的消费限额。通过其他 LLM 网关路由 Claude Code 的组织,也可以在网关上跟踪支出,因为网关能看到每个请求。
速率限制建议
为团队设置 Claude Code 时,可以根据组织规模参考以下每位用户的每分钟 Token 数 (TPM) 和每分钟请求数 (RPM):
| 团队规模 | 每位用户的 TPM | 每位用户的 RPM |
|---|---|---|
| 1-5 位用户 | 200k-300k | 5-7 |
| 5-20 位用户 | 100k-150k | 2.5-3.5 |
| 20-50 位用户 | 50k-75k | 1.25-1.75 |
| 50-100 位用户 | 25k-35k | 0.62-0.87 |
| 100-500 位用户 | 15k-20k | 0.37-0.47 |
| 500+ 位用户 | 10k-15k | 0.25-0.35 |
例如,如果有 200 位用户,可以为每位用户申请 20k TPM,即总共 400 万 TPM (200*20,000 = 4 million)。
随着团队扩大,每位用户所需的 TPM 会降低,因为大型组织中通常只有较少比例的用户会同时使用 Claude Code。这些速率限制在组织级别应用,而不是分别应用于每位用户,因此,其他人未使用服务时,单个用户可以暂时消耗超过其计算份额的容量。
如果预计会出现异常高的并发用量,例如面向大型群体的实时培训,可能需要为每位用户分配更高的 TPM。
智能体团队的 Token 成本
智能体团队会启动多个 Claude Code 实例,每个实例都有自己的上下文窗口。Token 用量会随活跃队友数量及各自运行时间而增长。
要控制智能体团队成本:
- 为队友使用 Sonnet。它能在协调任务中兼顾能力和成本。
- 保持较小的团队规模。每位队友都运行自己的上下文窗口,因此,Token 用量大致与团队规模成正比。
- 让启动 Prompt 聚焦。队友会自动加载 CLAUDE.md、MCP 服务器和 Skill,但启动 Prompt 中的所有内容从一开始就会加入上下文。
- 工作完成后关闭队友。每位活跃队友都会持续消耗 Token,直到退出或会话结束。
- 智能体团队默认禁用。在 settings.json 或环境中设置
CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1可启用。请参阅启用智能体团队。
减少 Token 用量
Token 成本随上下文大小增长:Claude 处理的上下文越多,使用的 Token 就越多。Claude Code 会通过 Prompt 缓存自动优化成本,降低系统 Prompt 等重复内容的成本;还会在接近上下文限制时通过自动压缩总结对话历史。
以下策略可以缩小上下文,降低每条消息的成本。
主动管理上下文
使用 /usage 检查当前 Token 用量,或配置状态行持续显示。
- 在任务之间清除上下文:切换到无关工作时,使用
/clear重新开始。过时上下文会在之后的每条消息中浪费 Token。清除前使用/rename,方便日后找到会话,再通过/resume返回。 - 添加自定义压缩指令:
/compact Focus on code samples and API usage会告诉 Claude 在总结期间保留什么。
也可以在项目根目录的 CLAUDE.md 文件中自定义压缩行为:
选择合适的模型
Sonnet 可以很好地处理大多数编码任务,成本也低于 Opus。将 Opus 留给复杂架构决策或多步推理。使用 /model 可以在会话中途切换模型,也可以在 /config 中设置默认值。对于简单的子智能体任务,请在子智能体配置中指定 model: haiku。
减少 MCP 服务器开销
MCP 工具定义默认延迟加载,在 Claude 使用具体工具前,只有工具名称会进入上下文。运行 /context 可以查看哪些内容正在占用空间。
- 有 CLI 工具时优先使用:
gh、aws、gcloud和sentry-cli等工具仍比 MCP 服务器更节省上下文,因为它们不会添加逐项工具清单。Claude 可以直接运行 CLI 命令。 - 禁用未使用的服务器:运行
/mcp查看已配置的服务器,并禁用当前未使用的服务器。
为强类型语言安装代码智能插件
代码智能插件可以提供精确的符号导航,避免依赖文本搜索,从而减少探索陌生代码时不必要的文件读取。一次“转到定义”调用可以取代 grep 后读取多个候选文件的过程。安装的语言服务器还会在编辑后自动报告类型错误,让 Claude 无需运行编译器也能发现问题。
将处理工作交给 Hook 和 Skill
自定义 Hook可以在 Claude 看到数据前进行预处理。与其让 Claude 读取 10,000 行日志来寻找错误,不如让 Hook grep ERROR 并只返回匹配行,将上下文从数万 Token 降至数百 Token。
Skill可以直接向 Claude 提供领域知识,避免探索。例如,“codebase-overview”Skill 可以说明项目架构、关键目录和命名约定。Claude 调用该 Skill 后会立即获得这些上下文,无需消耗 Token 读取多个文件来理解结构。
例如,以下 PreToolUse Hook 会筛选测试输出,只显示失败项:
- settings.json
- filter-test-output.sh
将以下内容添加到 settings.json,在每条 Bash 命令前运行 Hook:
将指令从 CLAUDE.md 移到 Skill
CLAUDE.md 文件会在会话开始时加载到上下文。如果其中包含特定工作流的详细指令,例如 PR 评审或数据库迁移,那么即使执行无关工作,这些 Token 也始终存在。Skill只在调用时按需加载,因此,将专门指令移入 Skill 可以缩小基础上下文。CLAUDE.md 应尽量保持在 200 行以内,只包含必要内容。
调整扩展思考
扩展思考默认启用,因为它能显著提高复杂规划和推理任务的表现。思考 Token 按输出 Token 计费,默认预算可能达到每个请求数万 Token,具体取决于模型。对于不需要深度推理的简单任务,可以通过 /effort 或 /model 降低 Effort 级别,在 /config 中禁用思考,或针对具有固定思考预算的模型,通过设置 MAX_THINKING_TOKENS 环境变量降低预算,例如 MAX_THINKING_TOKENS=8000。自适应推理模型会忽略非零预算,应改用 Effort 级别。Fable 5 始终使用扩展思考,因此无法禁用。
将输出冗长的操作委派给子智能体
运行测试、获取文档或处理日志文件会消耗大量上下文。将这些操作委派给子智能体,冗长输出便会保留在子智能体上下文中,只有摘要返回主对话。
管理智能体团队成本
队友在计划模式下运行时,智能体团队使用的 Token 大约是标准会话的 7 倍,因为每位队友都维护自己的上下文窗口,并作为单独的 Claude 实例运行。保持团队任务小而独立,以限制每位队友的 Token 用量。详情请参阅智能体团队。
编写具体的 Prompt
“improve this codebase”之类的模糊请求会触发大范围扫描。“add input validation to the login function in auth.ts”之类的具体请求则能让 Claude 高效工作,并尽量减少文件读取。
高效处理复杂任务
对于耗时较长或更复杂的工作,以下习惯有助于避免因走错方向而浪费 Token:
- 对复杂任务使用计划模式:实现前按 Shift+Tab 进入计划模式。Claude 会探索代码库并提出方案供你批准,避免最初方向错误带来代价高昂的返工。
- 尽早纠正方向:如果 Claude 开始走错方向,立即按 Escape 停止。使用
/rewind或连按两次 Escape,将对话和代码恢复到之前的检查点。 - 提供验证目标:在 Prompt 中加入测试用例、粘贴截图或定义预期输出。Claude 能验证自己的工作时,可以在你要求修复前发现问题。
- 增量测试:编写一个文件,测试后再继续。这样可以尽早发现问题,并以较低成本修复。
后台 Token 用量
即使处于空闲状态,Claude Code 的部分后台功能也会使用 Token:
- 对话总结:为
claude --resume功能总结之前对话的后台任务 - 命令处理:
/usage等部分命令可能发出请求以检查状态
即使没有主动交互,这些后台进程也会消耗少量 Token(通常每个会话低于 $0.04)。
了解 Claude Code 行为变化
Claude Code 会定期更新,功能行为(包括成本报告)可能随之变化。运行 claude --version 可以检查当前版本。有关具体账单问题,请通过 Console 账户联系 Anthropic 支持。