你可能会说:
- “AI 接口按 token 收费,一个 token 是多少字?”
- “为什么我只问了一句话,却用掉了几万个 token?”
它是什么
一个 token 大约是半个到一个汉字,或者四分之三个英文单词。每次调用,模型读到的全部内容都算输入 token:不只是你的问题,还有系统提示词、工具说明、之前的对话。
所以"只问一句"也可能用掉几万个 token:Agent 把一长串工具说明都带上了。收窄工具、精简提示词,能显著降低每次调用的成本。
接口返回的用量字段,是估算成本的依据,但不一定可靠,尤其是兼容第三方的接口。重要的护栏不要只建立在它上面,要定期和实际账单对一对。
打个比方
像出租车的计价器:上车起步价(系统设定、工具说明)就要跳好几格,走多远(你的问题和回答)再往上加。看似只问了一句,起步价可能比路程还贵。
在这个网站里
兄弟项目 E2E Review 接入第三方模型时,同一句"回复一个字:好",默认配置下被报成两万多个输入 token;收窄配置后,两次测试一次报 1884、一次报 28。最后护栏改成在自己的数据库里数条数(第 19 课)。
容易搞混的地方
常见误解
我的问题很短,所以很便宜
正确理解
计费的是模型读到的全部内容。系统提示词、工具说明和对话历史,常常比你的问题长得多。
你可以这样告诉 AI
复制下面这段,贴给你的 AI
一次典型的调用会用掉多少输入和输出 token?其中系统提示词、工具说明、对话历史各占多少?按这个模型的价格,每次大约多少钱?接口上报的用量和平台账单对得上吗?
接下来去哪
先知道
- 大模型——一个读过海量文字的续写程序:给它一段开头,它按概率一个词一个词地往下写。
接着看
- 额度——一段时间里总共能用多少:每人每天多少次、全站每天花多少钱。用完就停,等下一个周期。
在这些课里出现
相关的真实事故