← 术语图鉴

延迟与首字时间

Latency / Time to First Token · 也叫 响应时间 / 首字延迟 / TTFT / 卡顿

从用户发出请求,到看到第一个字(首字时间)和看到完整结果(总耗时),分别要等多久。

你可能会说:

  • “AI 回答太慢了,用户以为页面卡死了,怎么办?”
  • “换个更快的模型,就能解决慢的问题吗?”

它是什么

AI 功能的慢要分开看:首字时间决定"是不是卡住了",总耗时决定"要等多久才用得上"。流式输出主要改善前者。

首字时间里常常藏着可以省掉的步骤:模型先调用一次工具去查资料,再开始回答,第一个字就要多等好几秒。能提前放进提示词的资料,就不必让模型自己去查。

优化之前先量:分别记下首字时间、总耗时,最好在线上实际环境里量,而不只是在本地。

打个比方

像打电话问路:对方接起来说"稍等我查一下",和对方一言不发地查了三十秒,等的时间一样,焦虑程度完全不同。

在这个网站里

兄弟项目 E2E Review 的导师,单轮回答要 14 到 46 秒。打开增量输出后首字 13 秒;把当前页面的词条直接放进提示词、省掉一次查询,首字降到 7 秒左右;线上实测首字 8 秒、整段 9 秒(第 17 课)。

容易搞混的地方

常见误解

慢就换更快的模型

正确理解

先拆开看时间花在哪:模型生成、工具往返、网络、排队。很多时候省掉一次不必要的工具调用,比换模型更管用。

你可以这样告诉 AI

复制下面这段,贴给你的 AI

请分别测出这个功能的首字时间和总耗时(本地和线上各测几次),再拆开说明时间花在哪些步骤上,哪些步骤可以提前做或者省掉。

先知道

  • 流式输出——服务器一边生成、一边把已经生成的部分推给页面,而不是等全部写完再一次性返回。

接着看

  • 工具调用——模型不直接动手,而是说"我要调用某某工具、参数是这些",由你的程序去执行,再把结果交还给它。

在这些课里出现

相关的真实事故