漫剧联盟 文档中心
控制台
Usage

Token 用量计算

Token 是模型处理文本的基本单位。漫剧联盟 会在响应和使用日志中记录输入 Token、输出 Token、消耗额度和请求耗时,最终账单以平台使用日志为准。

输入用量prompt_tokens
输出用量completion_tokens
总 Tokentotal_tokens
对账入口控制台使用日志

1. 响应里的 Token 字段

普通对话请求完成后,响应中通常会返回 usage 字段。

json
{
  "usage": {
    "prompt_tokens": 128,
    "completion_tokens": 256,
    "total_tokens": 384
  }
}
字段含义
prompt_tokens用户输入、系统提示词、历史上下文、工具定义等输入内容占用的 Token。
completion_tokens模型生成内容占用的 Token,推理模型的思考输出也可能计入输出侧成本。
total_tokens输入和输出合计,用于快速估算上下文规模。

2. 文本模型额度计算

文本对话的额度消耗会结合 Token 数和倍率计算,不是简单的 total_tokens。平台后端的核心计算方式如下:

formula
weighted_tokens = prompt_tokens + completion_tokens * completion_ratio
quota = ceil(weighted_tokens * model_ratio * group_ratio * 0.8)
display_amount = quota / quota_per_unit

其中 model_ratio 来自模型价格配置,group_ratio 来自用户分组,completion_ratio 是输出 Token 倍率,quota_per_unit 是系统额度展示单位。

3. 示例估算

假设一次请求输入 1,000 tokens,输出 500 tokens,输出倍率为 3,模型倍率为 2,用户组倍率为 1,则:

example
weighted_tokens = 1000 + 500 * 3 = 2500
quota = ceil(2500 * 2 * 1 * 0.8) = 4000

实际金额展示会继续按系统额度单位换算。不同模型、不同分组、不同输出倍率会得到不同结果。

4. 如何对账

  • 在控制台进入使用日志,查看每次请求的模型、输入 Token、输出 Token、消耗和耗时。
  • 如果是视频生成、图像生成、语音等非文本接口,按对应接口文档和账单记录计算,不套用文本公式。
  • 如果响应没有返回 usage,以平台日志记录为准。
  • 长上下文、多轮历史、工具调用和高推理强度都会增加 Token 消耗。

5. 降低 Token 消耗

做法效果
减少无关历史上下文降低输入 Token。
设置合理的 max_tokens 或 max_completion_tokens控制最大输出长度。
普通任务选择更经济的模型降低模型倍率。
Agent 工具减少无效循环降低多轮工具调用带来的额外输入和输出。