Token 用量计算
Token 是模型处理文本的基本单位。漫剧联盟 会在响应和使用日志中记录输入 Token、输出 Token、消耗额度和请求耗时,最终账单以平台使用日志为准。
输入用量prompt_tokens
输出用量completion_tokens
总 Tokentotal_tokens
对账入口控制台使用日志
1. 响应里的 Token 字段
普通对话请求完成后,响应中通常会返回 usage 字段。
json
{
"usage": {
"prompt_tokens": 128,
"completion_tokens": 256,
"total_tokens": 384
}
}
| 字段 | 含义 |
|---|---|
| prompt_tokens | 用户输入、系统提示词、历史上下文、工具定义等输入内容占用的 Token。 |
| completion_tokens | 模型生成内容占用的 Token,推理模型的思考输出也可能计入输出侧成本。 |
| total_tokens | 输入和输出合计,用于快速估算上下文规模。 |
2. 文本模型额度计算
文本对话的额度消耗会结合 Token 数和倍率计算,不是简单的 total_tokens。平台后端的核心计算方式如下:
formula
weighted_tokens = prompt_tokens + completion_tokens * completion_ratio
quota = ceil(weighted_tokens * model_ratio * group_ratio * 0.8)
display_amount = quota / quota_per_unit
其中 model_ratio 来自模型价格配置,group_ratio 来自用户分组,completion_ratio 是输出 Token 倍率,quota_per_unit 是系统额度展示单位。
3. 示例估算
假设一次请求输入 1,000 tokens,输出 500 tokens,输出倍率为 3,模型倍率为 2,用户组倍率为 1,则:
example
weighted_tokens = 1000 + 500 * 3 = 2500
quota = ceil(2500 * 2 * 1 * 0.8) = 4000
实际金额展示会继续按系统额度单位换算。不同模型、不同分组、不同输出倍率会得到不同结果。
4. 如何对账
- ✓在控制台进入使用日志,查看每次请求的模型、输入 Token、输出 Token、消耗和耗时。
- ✓如果是视频生成、图像生成、语音等非文本接口,按对应接口文档和账单记录计算,不套用文本公式。
- ✓如果响应没有返回 usage,以平台日志记录为准。
- ✓长上下文、多轮历史、工具调用和高推理强度都会增加 Token 消耗。
5. 降低 Token 消耗
| 做法 | 效果 |
|---|---|
| 减少无关历史上下文 | 降低输入 Token。 |
| 设置合理的 max_tokens 或 max_completion_tokens | 控制最大输出长度。 |
| 普通任务选择更经济的模型 | 降低模型倍率。 |
| Agent 工具减少无效循环 | 降低多轮工具调用带来的额外输入和输出。 |