你可能会说:
- “让 AI 只根据我们自己的资料回答,要怎么做?”
- “做知识库是不是一定要上向量数据库?”
它是什么
模型自己记得的东西会过时,也会编。让它先检索、再作答,答案就落在你的资料上,还能给出出处。
最常见的做法是把资料切成小段、算成向量存进向量库,提问时找出最相近的几段交给模型。另一种做法是让 Agent 自己用搜索工具在原文里找:先搜关键词、再读命中的段落,不用预先切分、建库。
无论哪种,关键都在两件事:找得到(同一个概念要换几种说法去搜),以及找不到时老实说找不到,而不是用自己的记忆补上。
打个比方
像开卷考试:先翻书找到那几页,再照着书上写;书里没有的,就写"书上没讲"。
在这个网站里
兄弟项目里的知识库 Agent 没有用向量库:它只有读取、搜索、列文件三个工具,在语料目录里先搜关键词、再读原文,每条结论带出处;查不到,就原样回答一句固定的拒答语(第 23 课)。
容易搞混的地方
常见误解
知识库问答就等于向量数据库
正确理解
向量检索只是"找"的一种办法。资料不大时,让 Agent 直接在原文里搜也够用,而且它读过哪些原文一清二楚,出了错好追查。
你可以这样告诉 AI
复制下面这段,贴给你的 AI
回答只能依据资料里检索到的原文,每条结论标出出处;查不到就直接说查不到,不要用你自己的知识补。
接下来去哪
先知道
对比着看
- 幻觉——模型把不存在或不成立的东西,说得像真的一样:流畅、具体、语气笃定。
接着看
- 评测——一组带标准答案的问题:每次改提示词、换模型之后都跑一遍,用通过率判断是变好还是变坏。
在这些课里出现