Skip to content

第三章 认知搜索理论

真实问题

一家公司的 AI 应用小组,做了一件看起来很正确的事。

他们把半年里所有被验证有效的提问方式整理成一份《Prompt 手册》:怎么让 AI 扮演角色,怎么分步推理,怎么列失败模式,怎么做头脑风暴……一共八十多条,全公司推广。

一个月后,反馈回来了,而且两极分化。有人说效果立竿见影,有人说完全没用。最有意思的是同一条技巧,两个团队的评价截然相反:一个团队说"列失败模式"是他们用过的最好的技巧,另一个团队说它"纯粹浪费时间"——而两边都是认真执行了的。

负责人很困惑:技巧都是验证过的,执行也都到位,为什么效果像掷骰子?

把这个问题再放大一点。你也许有过类似的体验:同一个方法,在这个项目上屡试不爽,换个项目就平平无奇;同一个人,昨天还能稳稳地驾驭 AI,今天面对一类新问题就束手无策。

为什么同一套被验证过的方法,换个场景就时灵时不灵?

共同现象

先不急着回答。我们把视角拉高,看看这类"不稳定"背后,还有哪些反复出现的事。

现象一:技巧的效果,取决于问题出在哪

仔细复盘那些失效案例,会发现一个规律:技巧并不是无效,而是不对症。

方案的方向从一开始就错了,那么加深推理的技巧再强,也只是把错误的方向论证得更充分;提问本身目标模糊,那么换十个角色来回答,也只是得到十种模糊的答案。技巧之间似乎各有分工——有的管方向,有的管深度,有的管起点——但没有人见过那张写着分工的图。

现象二:同一份背景资料,给不给,结果差很多

两个工程师用同一个模型,修同一个系统的故障。一个把报错信息直接丢过去;另一个先粘贴了系统架构说明和自己的初步判断,再给报错。

后者的答案质量稳定地更好。注意一个细节:架构知识本来就装在模型的知识里,那份文档并没有教给 AI 任何它不会的东西。它改变的是这次搜索的某种状态——而这种状态,显然是可以被外界塑造的。

现象三:项目越长久,越依赖一些"被维护的东西"

观察任何一个超过三个月的 AI 协作项目,你会发现团队都会自发地开始维护一些东西:规范文档、决策记录、术语表、阶段总结。没有人教他们这么做,但不维护这些的项目,AI 的表现会逐渐漂移——上个月定下的原则,这个月被悄悄违反;前后两次回答,互相矛盾。

这些东西很少出现在每一次具体的提问里,但它们显然在持续地起作用。

现象四:高手能预判 AI 的表现

有经验的使用者,在按下回车之前,大致能预判这次回答的质量,以及如果质量不行、问题大概出在哪;新手只能事后碰运气。

这种差别一般被归为"手感"。但手感是无法传递的,而这些团队明明在传递它——手册就是一种尝试,只是失败了。这说明高手脑中的确存在一个关于"一次交互由什么构成"的隐性模型,只是这个模型还从来没有被说清楚过。

机制分析

四个现象,指向同一件事:一次 AI 交互不是一个点,而是一个有内部结构的系统。

把前两章的结论拼起来,这个系统的轮廓已经隐约可见。第一章看到:输入设定了搜索的初始条件。第二章看到:回答是初始条件出发的一条搜索轨迹。合起来,一次回答就是这个系统的一次运行。

现在,用这把"结构"的钥匙,逐个打开四个现象。

技巧为什么时灵时不灵?如果交互是一个系统,那么每个技巧作用的就只是系统的某一个部分。当瓶颈恰好在这个部分时,技巧立竿见影;当瓶颈在别的部分时,技巧自然无效。由此可以推出一个关键结论:系统的"部分"是真实存在的,否则技巧的效果无法解释。

背景资料为什么有用?它说明除了这一次输入的内容之外,还有一层更持久的东西在塑造搜索。资料不是在这次交互中临时生效的,它改变的是搜索赖以开始的那个状态。

长期项目为什么需要维护?那层持久的东西不是静态的——它会被每一次搜索的经验不断更新。维护得好,它越来越贴合项目;不维护,它就在一次次搜索中失真。

高手为什么能预判?因为系统的结构是稳定的、可学习的。他见过的每一次交互,都在校准他脑中那张结构图。

到这里,问题已经从"为什么技巧不稳定",变成了一个更本质的问题:

这张结构图,到底长什么样?

旧理论不足

在给出这张图之前,先看看现有的三个视角为什么画不出它。

视角一:Prompt 工程

提示词工程(Prompt Engineering)把交互看成"写好一句话"的艺术。它积累了大量有效的技巧,这是它真实的贡献;但它的视野只有输入这一个点。它回答不了:技巧为什么失效?长期项目维护的那些文档算什么?一个只看得见输入的视角,注定画不出整张图。

视角二:上下文工程

上下文工程(Context Engineering)进了一步:它意识到问题不只是那句话,还有那句话背后的所有信息。但它把一切归结为"往上下文里放对资料"——目标、约束、背景、记忆、规范,被装进同一个袋子。它回答不了:为什么这份资料改变了结果,而那份没有?为什么有的信息需要长期维护,有的用过即弃?不区分作用的种类,就无法解释作用的差别。

视角三:Agent 与 Workflow

还有一种视角直接跳到了编排:把复杂任务拆给多个 Agent,用 Workflow 串起来。编排确实是趋势,但它回答的是一个更后面的问题。如果一次调用的内部结构都还没有说清楚,那么编排一百次调用,也只是把不理解的东西复制了一百份。

三个视角并非错误,它们各自摸到了系统的一块。问题只在于:没有人把一次搜索和长期搜索放进同一个框架。(本书第四篇会回来把它们逐一安放好。)

提出新理论

其实,这张图的全部素材,在前面两章和上面的分析里都已经备齐。现在把它们组装起来。

首先,是本书的正式定义:

认知搜索(Cognitive Search):AI 在认知空间中,根据当前搜索配置,不断探索、筛选和组合知识,最终形成回答的过程。

这个定义里每个词都有出处。认知空间,由第一章提出、第二章展开——AI 在训练中积累的知识、经验与模式构成的可能性空间。搜索配置,是现象二和现象三逼出来的——那层持久的、可维护的、持续塑造每次搜索的东西。探索、筛选、组合,是一次搜索的实际动作。回答,是搜索走到终点后的产物。

接下来,把"一次认知搜索"拆开。任何一次搜索,无论大小,都必须回答四个问题:从哪里开始?为了什么?能去哪些地方?具体怎么走?这四个问题不多不少,正好对应一次搜索的四个组成部分:

  • 搜索初始化(Search Initialization):搜索开始之前,AI 已经拥有的认知状态——先验、偏置、角色、被预热的背景。
  • 搜索目标(Search Objective):这次搜索为了什么,以及什么答案算最好。
  • 搜索空间(Search Space):这次搜索实际可以探索的可能性范围。
  • 搜索运行(Search Runtime):搜索如何一步步真正执行。

第二章用过的两个词,现在也可以给出正式说法。搜索进行到某一时刻,AI 在认知空间中所处的位置——已经形成的中间结论和正在考虑的方向——称为搜索状态(Search State);一次搜索中,搜索状态依次经过的完整路径,称为搜索轨迹(Search Trajectory)。

这里需要对一下账:第一章说的"初始条件",就是搜索初始化完成后、搜索开始时的那个状态——它是搜索状态的起点。而第一章的三个变量,起点和方向属于搜索空间层,"范围"将在第六章展开为更精确的形态。

最后,把多次搜索连起来。那层贯穿始终、被长期维护的东西,称为搜索配置(Search Configuration):持续影响 AI 搜索行为的一组控制参数——目标、规则、约束、评价标准、产品定位、设计原则、历史决策、Memory,都在其中。而经验不断沉淀为配置、配置不断塑造未来搜索的循环,称为搜索演化(Search Evolution)。

至此,理论的骨架完整了:一次搜索有四层,多次搜索靠配置贯通,配置在演化中生长。

建立模型

先看一次搜索。四个组成部分按顺序衔接,构成四层搜索模型:

回答的问题
搜索初始化AI 从什么状态开始搜索?
搜索目标AI 为什么搜索?什么答案算最好?
搜索空间AI 可以搜索哪些可能性?
搜索运行AI 如何完成搜索?

四层共同决定一次回答的质量。这也意味着,一次失败的回答,病灶必然落在某一层里——这正是"诊断"成为可能的原因。

再看长期。搜索配置站在每一次搜索的背后,塑造它的初始化、目标与空间;每一次搜索的结果又反过来成为经验的来源:

一次搜索产生结果,结果被提炼为经验,经验更新搜索配置,新配置塑造未来的搜索。这个循环一旦转起来,项目就不再是孤立回答的堆积,而是一个持续生长的系统。真正成长的不是模型,而是这个搜索系统。

图示

第一张图,看清认知空间、搜索空间与搜索轨迹的关系:

第二张图,一次搜索的四层:

第三张图,长期项目的演化闭环:

三张图合起来,就是本书要反复使用的那张结构图:横向看,每一次回答都是四层构成的一次搜索;纵向看,无数次搜索被搜索配置贯通,在演化中不断变好。

这是解释,还是换词?

到这里,必须把一个最锋利的质疑摆上桌面:把 AI 的活动叫"搜索",会不会只是换了个词?

这个质疑值得认真对待。换说法是不需要证据的——任何现象都可以被重新描述。把"AI 给出了回答"改叫"AI 完成了一次搜索",如果到此为止,那么前面三章就只是一场词汇练习,什么都没解释。

换词和解释的区别,在于解释必须多做一件事:把整体拆成结构,让结构的不同部分可以被分别检验、分别调整、分别出错。可以用三道检验来判断这套理论属于哪一种。

第一道,可拆解。认知搜索被拆成了四层,而四层有各自独立的失效方式:初始化会空白(AI 对项目一无所知),目标会缺失(评价落回默认值),空间会锁死(答案被框在方案内部),运行会开环(错误被逐行放大)。请注意这个性质:一个词是不会"分四段出错"的,只有一个结构才会。本章开头的手册失灵,正是这个性质的现实样本——技巧失效的位置各不相同,恰因为它们是结构的不同部分在失效。

第二道,可预测。理论给出的判断是任何人都可以检验的:改变初始条件,轨迹就会改变——同一模型、同一想法,一句"站在反方立场"就能让分析转向;瓶颈在哪一层,决定了哪个技巧有效——目标层缺位时,方向层的技巧再强也够不着。这些不是事后解释,而是事前判断:你可以先预测,再验证。

第三道,可操作。当一次回答失败,理论告诉你去哪一层找问题:先检查起跑状态,再检查评价标准,再检查空间,最后检查运行。换词给不了这样的抓手,只有结构给得了。这也是全书每一章结尾都必须回答"它改变了搜索系统哪一部分"的原因——回答不出位置的概念,不被允许进入这套理论。

但仅有三道检验还不够。一套诚实的理论,还必须说清楚自己做不到什么。这套理论有三条明确的自我限制。

它不承诺结果正确。更好的搜索不等于更对的答案:评价函数由人提供,人可能定错;环境反馈会给出信号,信号可能被误读。理论能提升的是搜索的质量,而世界的投票权,永远在世界自己手里。

它有明确的失效区。当所需的知识不在认知空间里——先验缺失——任何配置都无能为力。此时理论给出的唯一建议是停止在提示词里挖掘,去补充材料或更换工具。同样,工具本身的缺陷也不是认知搜索问题;理论能做的,是帮你识别"这不是一个搜索问题",而不是假装它能解决一切。

它写好了自己的失效条款。本书的理论边界文档里明确写着:如果 Prompt、Context、Memory、Workflow、Agent 无法被统一解释为搜索控制,理论失败;如果改变搜索的控制参数改变不了 AI 的行为,理论失效。请注意,换词的理论写不出这样的条款——因为换词不承担任何可以被推翻的风险。

所以,"搜索"究竟是解释还是换词,不由理论自己宣布,而由你在自己的项目里裁决:下次 AI 给出令人失望的回答时,按四层排查一次。如果你能定位到具体的某一层并修好它,这个词就挣到了它的名字。

Prompt 映射

这套框架如果有用,它首先应该能治好本章开头那个"手册失灵"的病。办法很直接:把每一条技巧放到它所属的层里去。

常见做法作用位置
角色设定、Few-shot 示例、先介绍背景再提问搜索初始化
明确任务目标、给出评价标准、说明"怎样算好"搜索目标
第一性原理、扮演反方、头脑风暴、列失败模式搜索空间(起点、方向、广度)
思维链、分步执行、自我反思、调用工具核对搜索运行
项目规范、决策记录、术语表、Memory搜索配置

分类一旦完成,技巧时灵时不灵的谜题就解开了:每个技巧都有明确的作用层,它只在瓶颈位于那一层时有效。"列失败模式"对那个团队极其有效,是因为他们的方案方向从没被怀疑过;在另一个团队失效,是因为他们的瓶颈根本不在方向,而在于没人说清楚过"怎样算好"——那是目标层的问题,空间层的技巧再犀利也够不着。

这也解释了为什么高手不需要手册。他们看得见结构:先诊断瓶颈在哪一层,再从那一层里选择操作。技巧是无限的,层只有四层。

项目案例

回到开头那家公司的 AI 应用小组。手册推广失败后,负责人做了第二次尝试。这一次他没有补充任何技巧,而是用四层框架给手册做了一次"盘点"。

结果令人吃惊。八十多条技巧里,超过六十条集中在搜索空间一层:换方向、列方案、穷举失败模式;搜索运行有十几条;搜索目标只有零星两三条;搜索初始化几乎是空白。而大量失效反馈来自目标层和初始化层——提问没有说清成功标准,或者 AI 对项目背景一无所知。手册在这些场景里当然无能为力:它连对应层的工具都没有。

于是小组补了两块内容。一块是目标层的"成功标准模板":每类常见任务,先写清"什么结果算好"再开始提问。另一块是初始化层的"项目背景卡":一页纸说清产品定位、关键约束和术语,每次开启新任务先喂给 AI。同时,他们开始维护一份不断更新的决策记录——这是小组的第一份搜索配置。

三个月后的变化是结构性的。团队成员遇到问题时,第一反应不再是翻手册找技巧,而是先做诊断:这次的瓶颈在哪一层?然后在该层里选择操作。手册还是那本手册,但它从"碰运气时翻的技巧汇编",变成了"按层归位的工具箱"。

技巧没有变,模型没有变,变的是他们终于看见了技巧背后的那张图。

容易混淆

本章一口气给出了整套框架,有几组概念容易被混淆,逐一澄清。

"认知搜索,是不是就是 RAG 那套检索?"

不是一回事。RAG 属于信息检索(Information Retrieval):在文档库里按相关性取回资料,交给模型参考。认知搜索发生在 AI 的认知空间里,是对知识、经验与模式的探索、筛选和组合。本书明确不讨论信息检索;RAG 取回的资料,至多作为输入参与塑造一次搜索的空间,它不是搜索本身。

"认知空间和搜索空间,是一个东西吗?"

不是。认知空间是 AI 在训练中积累的全部可能性,对使用同一个模型的所有人都恒定;搜索空间是某一次搜索中实际可及的范围,由这次的初始化、目标和约束共同划定。认知空间恒定,搜索空间随每次提问而变。第二章说的"大量未被走过的区域",正是认知空间里、本次搜索空间之外的部分。

"搜索配置和 Context,有什么区别?"

这是全书最容易混的一对概念,值得说慢一点。搜索配置是长期稳定存在的控制参数集合:产品定位、设计原则、编码规范、历史决策、Memory。Context 是搜索配置在当前一次搜索中的具体表达。配置是长期的,Context 是一次性的;同一份配置,可以按任务裁剪成不同的 Context。所以准确的说法不是"上下文越来越重要",而是"搜索配置越来越丰富,Context 承载了越来越多的搜索配置"。

"四层模型,是不是把简单的事情复杂化了?"

随手问一个问题,确实用不上它。四层模型的价值在于诊断和预测:当结果不好时,它告诉你该检查哪一层;当新技巧出现时,它告诉你技巧改变了系统的哪一部分。它是一张检修图,只在需要检修的时候展开——但长期项目里,需要检修的时候远比你想象的多。

本章总结

本章从一个真实的困惑开始:被验证过的方法,为什么换个场景就时灵时不灵?

我们看到,技巧失效因为它不对症,资料有用因为它塑造了搜索的状态,长期项目自发维护着某些持续起作用的东西,高手能预判因为他们脑中有隐性模型——四个现象共同指向:一次 AI 交互是一个有内部结构的系统。

于是本章正式提出了认知搜索理论:

AI 在认知空间中,根据当前搜索配置,不断探索、筛选和组合知识,最终形成回答的过程。

一次认知搜索由四层构成:搜索初始化、搜索目标、搜索空间、搜索运行;搜索在认知空间中留下搜索轨迹;无数次搜索由搜索配置贯通,并在搜索演化中持续变好。那张曾经只存在于高手脑中的图,现在画在了纸上。

现在,回答每章都要回答的那个问题:

本章讨论的,是搜索系统的哪一部分?

答案是:本章给出的是搜索系统的全貌——它的所有部分,以及部分之间的关系。从下一章开始,我们拿着这张图逐层深入。第一站,是每一次搜索的起点:搜索初始化——AI 在开口之前,已经拥有了什么?

章节信息

  • 所属篇目:第一篇 · 重新认识 AI
  • 对应设计文档章节要点:正式提出认知搜索;搜索空间、搜索轨迹、搜索状态、搜索配置
  • 本章回答的核心问题:它改变了搜索系统哪一部分?——给出搜索系统的完整构造:一次搜索的四层模型,以及贯通多次搜索的搜索配置与搜索演化