Ollama Cloud 的 Pro 套餐有一个周配额上限,但官方没说这个配额到底对应多少 token。前端只显示"当前已使用百分之几"和消耗的 token 数。

我的办法很直接:逐个模型跑一轮,记下消耗量和百分比,反推总配额。为了准确监控每次调用的 token 消耗和延迟数据,我专门部署了一套 New API 作为中间代理,所有请求都经过它转发,这样每次调用的输入输出 token、首字时间、总耗时都有完整记录。

反推公式:周总配额 = 消耗 token 数 / 占用百分比。百分比有 ±0.1% 的显示误差,所以每个数据给了一个范围值。
实验数据
批次 1 – GLM-5.1消耗 200 万 token,占用 0.5%配额。反推月总 13.33 亿 ~ 16.00 亿 ~ 20.00 亿 token。
批次 2 – DeepSeek-V4-Pro消耗 1240 万 token,占用 0.6%配额。反推月总 70.86 亿 ~ 82.67 亿 ~ 99.20 亿 token。
**批次 3 – DeepSeek-V4-Pro(二次验证)**消耗 3140 万 token,占用 1.6%配额。反推月总 73.88 亿 ~ 78.50 亿 ~ 83.73 亿 token。
批次 4 – kimi-k2.6消耗 570 万 token,占用 1.1%配额。反推月总 19.00 亿 ~ 20.73 亿 ~ 22.80 亿 token。


2682

被折叠的 条评论
为什么被折叠?



