你可能会说:
- “AI 回答太慢了,用户以为页面卡死了,怎么办?”
- “换个更快的模型,就能解决慢的问题吗?”
它是什么
AI 功能的慢要分开看:首字时间决定"是不是卡住了",总耗时决定"要等多久才用得上"。流式输出主要改善前者。
首字时间里常常藏着可以省掉的步骤:模型先调用一次工具去查资料,再开始回答,第一个字就要多等好几秒。能提前放进提示词的资料,就不必让模型自己去查。
优化之前先量:分别记下首字时间、总耗时,最好在线上实际环境里量,而不只是在本地。
打个比方
像打电话问路:对方接起来说"稍等我查一下",和对方一言不发地查了三十秒,等的时间一样,焦虑程度完全不同。
在这个网站里
兄弟项目 E2E Review 的导师,单轮回答要 14 到 46 秒。打开增量输出后首字 13 秒;把当前页面的词条直接放进提示词、省掉一次查询,首字降到 7 秒左右;线上实测首字 8 秒、整段 9 秒(第 17 课)。
容易搞混的地方
常见误解
慢就换更快的模型
正确理解
先拆开看时间花在哪:模型生成、工具往返、网络、排队。很多时候省掉一次不必要的工具调用,比换模型更管用。
你可以这样告诉 AI
复制下面这段,贴给你的 AI
请分别测出这个功能的首字时间和总耗时(本地和线上各测几次),再拆开说明时间花在哪些步骤上,哪些步骤可以提前做或者省掉。
接下来去哪
先知道
- 流式输出——服务器一边生成、一边把已经生成的部分推给页面,而不是等全部写完再一次性返回。
接着看
- 工具调用——模型不直接动手,而是说"我要调用某某工具、参数是这些",由你的程序去执行,再把结果交还给它。
在这些课里出现
相关的真实事故