大模型账单复盘:为什么“单价低”的中转站也可能让你多花 40%

单价陷阱

很多中转站宣传“官方 6 折”,但忽略三件事:

1. 重试是否计费(超时但已生成部分 output)

2. cache_read token 是否单独计价

3. 流式中断后已吐出的 token 算不算钱

我们拿同一批 2000 条客服摘要任务跑三家:

l A 站单价 0.9 元/万 in,0.7 元/万 out,但重试不计控,实际消耗 ×1.35

l B 站(302.AI)试水方便,复杂任务降级偶发

l C 站(词元无忧API)单价略高 0.95,但给 input/output/cache 分开账单,重试失败不扣 output,月末核算反而省 12%

必须埋的五个指标

l prompt_tokens / completion_tokens 分离

l cache_hit_ratio

l retry_count 与 retry_token_waste

l ttft_p99 首字延迟

l model_actual 防模型降级(用固定推理题交叉验证)

# 一段 Python 对账代码

Python

assert usage.prompt_tokens > 0

cost = usage.prompt_tokens/1e4*price_in + \

       usage.completion_tokens/1e4*price_out

if usage.cache_read_tokens:

    cost -= usage.cache_read_tokens/1e4*price_cache_rebate

把每家中转的 usage 对象归一化到同一张表,老板问“为什么这个月多花两千”,你能 5 分钟定位到是 Claude 长上下文没开缓存,而不是甩锅供应商。

总结

选 API 中转站别只看落地页单价。把词元无忧、AIHubMix、硅基流动、OpenRouter 都接进测试网关跑两周真实流量,用 token 级账单说话,比看任何排行榜都准。

0
0
0
0
评论
未登录
暂无评论