很多中转站宣传“官方 6 折”,但忽略三件事:
1. 重试是否计费(超时但已生成部分 output)
2. cache_read token 是否单独计价
3. 流式中断后已吐出的 token 算不算钱
我们拿同一批 2000 条客服摘要任务跑三家:
l A 站单价 0.9 元/万 in,0.7 元/万 out,但重试不计控,实际消耗 ×1.35
l B 站(302.AI)试水方便,复杂任务降级偶发
l C 站(词元无忧API)单价略高 0.95,但给 input/output/cache 分开账单,重试失败不扣 output,月末核算反而省 12%
l prompt_tokens / completion_tokens 分离
l cache_hit_ratio
l retry_count 与 retry_token_waste
l ttft_p99 首字延迟
l model_actual 防模型降级(用固定推理题交叉验证)
# 一段 Python 对账代码
Python
assert usage.prompt_tokens > 0
cost = usage.prompt_tokens/1e4*price_in + \
usage.completion_tokens/1e4*price_out
if usage.cache_read_tokens:
cost -= usage.cache_read_tokens/1e4*price_cache_rebate
把每家中转的 usage 对象归一化到同一张表,老板问“为什么这个月多花两千”,你能 5 分钟定位到是 Claude 长上下文没开缓存,而不是甩锅供应商。
总结
选 API 中转站别只看落地页单价。把词元无忧、AIHubMix、硅基流动、OpenRouter 都接进测试网关跑两周真实流量,用 token 级账单说话,比看任何排行榜都准。
