Postsread more
智能体问题:幻觉与事实错误
幻觉:智能体最顽固的问题
如果只能用一个词概括当前 AI 智能体最致命的问题,行业里多数人会选"幻觉"(Hallucination)。通用大模型写诗写周报文采斐然,但让它分析"上季度 A 产品线毛利率下降的原因",它可能编造一串子虚乌有的数据,还附上看起来很专业的百分比。更糟糕的是——语气越自信,越难被非专业用户识破。
Fiddler AI 2026 年的报告给出了一个残酷的数字:生产环境智能体失败率 70%-95%,幻觉是头号杀手。BetterYeah 的调研发现,68% 的企业在 AI 落地中遭遇幻觉问题,其中 32% 因错误累积导致系统性风险。
这不是"模型还不够聪明"的问题。这是智能体的结构性挑战。
从单步错误到幻觉累加
单步幻觉:模型不确定时仍"自信输出"
LLM 的核心训练目标是"合理续写",而不是"如实回答"。当训练数据中缺少相关信息时,模型不会说"我不知道"——它会生成一段看起来连贯但实际上没有事实支撑的文字。
这是因为:
- 训练数据偏差:互联网文本中,自信断言远多于谦虚声明"我不确定"
- 采样机制:模型采样概率最高的 token 序列,不受事实约束
- 缺乏不确定性建模:模型内部没有显式的"置信度"信号传递给输出层
结果:模型在信息不足时的行为是"编造",而非"沉默"。
多步累加:小偏差滚雪球
当智能体执行多步任务时,单步幻觉的破坏力被指数放大。看一个典型场景:
步骤 1:检索客户信息 → 幻觉:编造了不存在的客户 ID
步骤 2:用该 ID 查询订单 → 返回空结果
步骤 3:智能体"推断"该客户是新客户 → 编造注册时间
步骤 4:基于虚假注册时间做客户画像分析 → 输出错误结论
步骤 5:基于错误结论撰写运营建议 → 决策偏离
每一步都"合乎逻辑",但起点就是一个虚构的事实。这就是幻觉累加效应——错误在推理链中不断传播和放大,最终输出和现实南辕北辙。
2025 年 Q1 某金融机构的案例就是典型:智能体在财报分析中第一次幻觉了一个营收数字,后续所有财务比率、趋势判断、投资建议全部基于这个错误数字展开。表面看报告专业完整,实际结论完全失真。
为什么传统 NLP 时代的幻觉没那么致命?
传统 QA 系统也幻觉,但影响范围有限——一次问答的错误不影响下一次。智能体截然不同:它是一个持续运行的闭环系统,前一步的输出是后一步的输入。一个幻觉 token 就像生物学中的基因突变,在后续"转录"过程中被不断放大。
三类幻觉的根源
1. 事实性幻觉
模型编造不存在的事实。典型表现: