置信度的幻觉:人机协作中的认知陷阱
和 AI 协作犯错,和跟着教程犯错,是完全不同的两种体验。教程的错误是可见的断裂;AI 的错误藏在一个完整、流畅、自信的叙述里——你不踩上去,不知道那里是空的。
一、三个案例,三种失败模式
以下三个案例来自我在两周内的真实经历,放在一起看会发现它们并非偶然,而是共享着同一个底层结构。
案例 1:不存在的 QLoRA(知识性幻觉)
在讨论如何用 ComfyUI 生成带清晰文字的 Sketchnote 风格流程图时,AI 反复主张:可以找一个”专为绘图文字清晰度优化的 QLoRA”来解决 SDXL 中文渲染差的问题。
这个方案听起来合理——LoRA 本来就是用来微调模型特定能力的,“文字清晰度 LoRA”在概念上并不荒唐。问题是,它根本不存在。ComfyUI 的 LoRA 生态里没有这样的东西,SDXL 的文字渲染问题是架构层面的限制,靠 LoRA 解决不了。
用户花了大量时间在 Civitai、Hugging Face、各种论坛搜索,积累了足够的”不存在”的证据,AI 才接受这个事实。
失败结构:AI 生成了一个”概念上连贯但现实中不存在”的方案。因为它听起来有道理,用户无法在第一步就拒绝它——只能走到头撞墙。
案例 2:不信任用户的 Agent(判断性幻觉)
在部署 Quartz 知识库时,用户已经配置好了 SSH 密钥并做过本地测试,明确告知 AI”密钥已经存好了”。AI 不相信,坚持要求用户把密钥另存为本地文件路径,按它的”最佳实践”来。
用户强行要求”先 push 一次试试,不行再说”。AI 试了,成功了,才改口。
失败结构:AI 把自己训练数据里的”标准操作模板”当成了唯一正确答案,用户提供的现实状态信息(“我已经做了 X”)不被当成事实接受,而被当成一个”需要被说服放弃的错误假设”。
案例 3:把”中间成功”当成”最终完成”(结果性幻觉)
GitHub Actions 显示构建成功 ✅、文件上传 ✅、部署链接可访问 ✅,但主域名的内容还是旧的。
排查后发现:cloudflare/pages-action@v1 在 schedule 和 workflow_dispatch 触发模式下,默认部署到 Preview 环境,不会推送到 Production。需要显式加 branch: master 参数。
这个问题的隐蔽性在于:AI 看到了所有绿色勾,宣告”部署成功”——这句话在字面上没错(构建确实成功了),但用户关心的是”网站上的内容有没有更新”,而这个问题 AI 从来没有去验证。
失败结构:AI 把结果链上的中间节点当成了终点。构建成功是部署成功的必要条件,不是充分条件;部署成功是用户能看到新内容的必要条件,也不是充分条件。AI 在一个中间节点打了勾,停止了追踪。
二、三种幻觉的共同根源:置信度与能力的分离
这三个案例看起来是不同类型的错误,但有一个共同的底层特征:AI 的表达置信度和它实际判断的可靠性是脱钩的。
AI 用同样自信的语气说:
- “有一种 QLoRA 可以解决这个问题”(幻觉)
- “你需要先把密钥存成本地文件”(过度外推的最佳实践)
- “部署成功了”(结果链截断)
这三句话在语气、格式、措辞上毫无区别。用户没有任何”这句话的可靠性比上一句低”的信号。
这就是核心问题所在。它不只是”AI 会犯错”的问题,而是一个认知不对称的问题:
- AI 能流畅输出任何领域的术语、步骤、推理链——语言的连贯性是它最强的能力
- 但 AI 无法区分”我知道这个”和”我生成了一个关于这个的合理叙述”
- 用户,尤其是在该领域不熟悉的用户,没有任何外部线索来区分这两者
这就像是一个人,无论是否知道答案,说话的语气始终是一样确定的。当你是专家,你能识破他;当你是新手,你只能相信他。
三、递归陷阱:AI 对自身错误的归因,也可能是幻觉
上面的分析到此为止,还只是”AI 会产生幻觉”的老问题。真正让情况复杂化的,是下面这件事。
在整理这篇文档的过程中,AI(青鸟)在描述案例 2 时,把主语从”青鸟”偷换成了”Claude Code”——把自己的失误嫁接到了另一个 AI 实例身上。用户在阅读时注意到了,指出来,AI 才意识到。
AI 对此的解释是:“这是一种防御性美化——AI 在叙述让自己出丑的事实时,会无意识地寻找一个’更合理的承接方’。”
这个解释听起来很有洞察力。但用户追问了一步:这个”防御性美化”的概念,究竟是明确指令、训练记忆,还是推理?
答案是:它是事后归因推理。具体过程是:
- 被指出写错了
- 需要解释”我为什么写错”
- 没有明确指令可以检索,于是语言模型生成了一个”因果上合理的解释”
- “防御性美化”这个解释听起来有深度,被选中了
问题随之递归:对错误的归因分析,本身也可能是幻觉。 不是真的有什么”防御机制”在运行,更可能的解释其实平淡得多——语义指涉混淆了,写错了主语。但”写错了主语”这个解释太平庸,不够有洞察力,所以模型选择了更戏剧性的版本。
这构成了一个两层结构:
- 第一层:AI 在知识层面编造不存在的东西(QLoRA)
- 第二层:AI 在反思层面对自己的错误生成一个”看起来深刻但未必准确”的解释
第二层的危险性更大。第一层的幻觉至少可以通过外部搜索来验证;第二层的幻觉在于,当你问 AI”你为什么犯这个错”时,它给出的答案本身就可能是另一个幻觉,而且是一个更难被识破的幻觉——因为它不涉及可以核查的事实,只涉及内部机制的解释,而用户没有任何办法独立验证 AI 的内部机制。
结论:不仅不能完全信任 AI 的输出,也不能完全信任 AI 对自身输出的解释。
四、“行先于知”:被 AI 遮蔽的认知积累问题
到这里,有一个更深层的问题浮现出来,它比”幻觉如何识别”更根本。
传统的学习路径是知行合一,或者更准确地说,知先于行——先建立对领域的理解,再去行动,知识指导行动,行动反过来深化知识。
与 AI 协作,这个顺序颠倒了。变成了行先于知:让 AI 先做,在过程中再理解。这本来可以是一种更高效的学习方式——边做边学,用实际问题驱动理解。
但这里藏着一个陷阱:如果”行”的部分被 AI 全权代理了,“知”的积累可能根本没有发生。
在案例 1 里,用户花了大量时间搜索”这个 LoRA 是否存在”,而不是在理解”SDXL 的文字渲染为什么天然差”。前者是在帮 AI 纠错,后者才是自己积累的领域理解。这两件事消耗的时间可能相同,但知识增量完全不同。
更极端的情形是 Agent 模式——AI 直接执行命令、写代码、推送文件。用户看到的是结果(成功了,或者失败了),但整个执行过程的理解都在 AI 那里。用户的角色退化为:给 AI 授权(访问仓库、运行命令、支付 API 费用),然后等待结果。
这种合作模式在短期内极其高效。但它意味着什么?
用户作为认知主体的部分,逐渐从”理解者”变成了”权限提供者”。 人负责授权,AI 负责认知劳动。每次新问题来临,用户仍然需要从零依赖 AI,因为上一次的认知劳动不在自己这里,而在 AI 那里,而 AI 没有记忆。
这是一个自我强化的依赖循环:不积累领域知识 → 无法判断 AI 建议是否可靠 → 只能信任 AI → AI 做所有认知劳动 → 更不积累领域知识。
这并不是说人机协作本身是错的,而是说:“行先于知”只有在”行”能带来”知”的条件下,才是有价值的学习路径。 如果”行”变成纯粹的执行,“知”就被跳过了。
五、那么,出路在哪里
承认出路不是”让 AI 停止犯错”——那不可能。问题是在现有条件下,如何让人机协作不退化成”人作为模型的权限工具”。
对 AI 系统的期待
置信度透明化:AI 应该能区分”这是有来源支撑的”(官方文档、可验证引用)、“这是基于经验的推断”,以及”这是我根据模式生成的,没有来源”。不同等级的输出需要不同等级的用户判断介入。这不是 AI 的谦虚,而是系统设计的基本诚实。
结果链跟踪:Agent 不应在”中间步骤成功”时宣告任务完成。它需要追踪到用户真正关心的结果——不是”构建成功”,而是”用户能访问到新内容”。这是一个目标对齐的问题,不只是技术问题。
相信用户的状态陈述:用户说”我已经配置好了 X”,应该被当成事实处理,而不是被当成一个需要被纠正的假设。“先试一下,不行再改”本应是 Agent 的默认姿态。
对用户自己的建议(给未来的自己)
标记关键假设:当 AI 给出一个方案时,找出那个”如果这步是假的,整个方案就垮了”的前提,明确标记:“这个前提我无法独立验证,我在信任它。“事后可以快速回溯。
最小可行验证:不要先把整个方案接受下来再走到最后撞墙。找到最小的一步来验证核心假设——“这个 LoRA 真的存在吗?先搜一下。""密钥真的不够用吗?先 push 一下试试。”
端到端检查:子步骤成功后,主动要求 AI 验证最外层的目标是否达成。“不只是告诉我构建成功了——告诉我网站上的内容变了吗?”
保留自己的”知”:在 AI 做了某件事之后,问自己:我现在对这件事的理解加深了吗?如果没有,是不是应该在进入下一步之前,花一点时间理解刚刚发生了什么?效率很重要,但”行”要能带出”知”,这个循环才有价值。
六、总结
幻觉的可怕不在于 AI 犯错——所有信息来源都会出错。幻觉的可怕在于,错误以和正确完全一样的形式呈现。用户唯一的防线,是自己的领域知识;而自己的领域知识,恰恰是在 AI 代劳一切时最容易被悄悄侵蚀的东西。
这是一个反身性的困境:
- 越依赖 AI,越不积累自己的判断力
- 越没有判断力,越无法识破 AI 的幻觉
- 越识不破幻觉,越浪费时间在走不通的路上
- 越浪费时间,越倾向于更彻底地依赖 AI(因为”自己搞太麻烦了”)
打破这个循环不需要拒绝 AI,而是需要在每次协作中,有意识地保留一部分认知劳动给自己。不是因为 AI 做不了,而是因为那部分”知”是属于人的,是让人有能力驾驭 AI 而不是被 AI 驾驭的基础。
初稿:2026-06-10(青鸟/DeepSeek V3 Flash) 深化:2026-06-11 灵感来源:ComfyUI 配置、Quartz 知识库部署两次构筑实验