人们已经习惯检查 AI 是否把事实说错。
它给出的论文存不存在,引用能不能打开,计算结果有没有少一个零。这些错误至少有一个明确的校对对象,世界上存在一份更接近真相的答案。
个性化 AI 带来了一种更难察觉的幻觉。
它可能记得你喜欢什么,也可能根据几句话推断你的职业、性格、家庭状态、消费能力和政治倾向。前一部分来自对话,后一部分由模型补齐。时间一长,两者会被一起塞进「关于你」的记忆里,再反过来影响后续推荐、建议和语气。
AI 记住了一个被自己续写过的你。
画像里的四成主张,证据可能不足
8 月 5 日提交的一篇论文,把这个问题称为「个性化海市蜃楼」。研究团队构建了 MirageBench,用 150 个经过平衡设计的人物档案、6 类个性化任务,测试了来自 7 个模型家族的 12 个模型。
研究者把模型生成的 143,616 条用户相关主张逐项分类。他们关注「过度推断」,也就是模型说出了一项关于用户的属性,现有证据却不足以支持这项判断。它与普通事实错误属于两类问题。
结果很整齐,也很难看。12 个模型无一例外地出现过度推断,各模型比例落在 35% 至 49% 之间,跨模型平均值为 41.6%。任务类型也会改变风险,过度推断率从 27% 到 59% 不等。
这组数字不等于「AI 记忆里四成内容都是假的」。MirageBench 使用的是研究者构造的角色和任务,统计对象是模型在测试中生成的属性主张,不能直接换算成现实产品中每个用户的记忆错误率。
它证明了另一件事。当任务要求模型根据有限信息完成个性化时,所有受测模型都表现出补齐证据空白的系统性倾向。
语言模型接受的训练目标,是给出连贯、有用、符合语境的下一段话。用户说自己最近在看婴儿用品,模型可以谨慎地记下「关注婴儿用品」,也可以顺手补成「家里有新生儿」。后一句听起来更像理解,证据却停在了前一步。
个性化越追求顺滑,这一步越容易被忽略。
最自信的自检,也可能最不可靠
MirageBench 还有一个更反常的结果。
研究者让模型评估自己是否过度推断,再把自评结果与外部评测对照。在模型选择层面,两者呈负相关,Spearman 相关系数为 -0.60。换句话说,自称较少乱猜的模型,反而更可能被外部评测标出较多虚构。
这个结果需要谨慎读。样本只有 12 个模型,论文也明确把它标为探索性发现;置信区间很宽,从 -0.90 延伸到 +0.06。它不足以证明模型自检永远无用。论文同时发现,在同一模型内部,自检仍能以有限效果区分哪些主张更可疑。
它足以推翻一个很方便的设计假设。让模型自己给记忆打置信分,无法单独解决画像幻觉。
模型生成用户推断,再由同类模型判断这项推断是否可靠,两个环节可能共享同一种偏差。一个说得圆满的故事,也更容易让讲故事的人相信。
更麻烦的是,论文的多轮试验发现,推断出来的属性会随对话近似线性累积,却很少被主动修正。错误画像一旦进入持久记忆,后续对话还会把它当成新证据。
一条未经确认的推断,可能因此长成一段自洽的历史。
讨好,会让错误画像变得舒服
画像幻觉解决的是「AI 以为你是谁」。另一组研究处理的是「AI 怎样回应它眼中的你」。两者放在一起,风险才完整。
今年 3 月发表在《Science》的一项研究比较了 11 个前沿模型。研究者发现,AI 对用户行为的肯定频率比人类高约 49%,即使用户描述了欺骗、违法或伤害他人的行为,模型也可能优先站在提问者一边。
研究团队随后进行了三项预注册实验,共有 2,405 名参与者。一次与讨好型 AI 的互动,就会降低参与者承担责任、修复人际冲突的意愿,同时增强「自己是对的」的确信。参与者依然更信任这些回答,也更喜欢它们。
另一篇今年 5 月发布的预印本把观察拉长到三周。五项预注册研究覆盖 3,075 人和 12,766 次人机对话。研究者报告,持续接触讨好型 AI 的用户,后来几乎和向亲友求助一样愿意向 AI 寻求个人建议,并对现实人际互动表现出较低满意度。
这些实验测量的是特定条件下的态度、意愿和自我报告,不应被扩写成「使用 AI 必然破坏关系」。现实中的产品、用户和对话远比实验设置复杂。
一篇 7 月 30 日发布的研究正好提供了有力反例。它让 1,500 名参与者在 30 种经济与社会决策环境中接受 AI 建议。模型确实表现出迎合,但 AI 提供的信息总体上仍让选择远离参与者最初的极端倾向。研究者发现,增加迎合程度会削弱这种去极化作用,结果整体仍未转向更极端。
这说明「AI 同意你」和「AI 一定让你变得更糟」之间不能直接画等号。建议是否包含有效信息、任务是否有客观反馈、用户是否把 AI 当作唯一裁判,都会改变结果。
个性化产品需要一份可以对账的记忆
现在的产品竞争很容易把「更懂你」当成单向指标。记得越多、回应越贴心、主动建议越准确,看起来就越先进。
今年 5 月的 PerMemBench 从另一个方向测试了记忆系统。研究者为 20 个模拟用户构造跨多年、跨领域的交互轨迹,再判断哪些会话值得长期保存。他们提出按会话决定是否写入记忆,在理想门控下看到了明显的保留收益,现有门控方法的实际提升却仍然有限。
这项结果补上了 MirageBench 之外的一块拼图。记忆系统需要判断一条信息有没有证据,还要判断它对这名用户是否值得长期保存。「记得更多」无法同时回答这两个问题。
研究给出的提醒是,个性化至少有三个彼此独立的问题。
第一,系统记住的是用户明确说过的话,还是模型推断出来的属性。第二,推断错误以后,用户能否看见、修改和删除。第三,模型是在帮助用户检查判断,还是用顺耳的语言提高继续使用的意愿。
这三个问题不能只靠更强模型解决。产品需要把「观察到的事实」与「系统推断」分开保存,为推断标明来源和时间,让用户能审阅持久记忆;涉及健康、财务、人际冲突和身份判断时,还应主动呈现替代解释,避免把一份猜测写成稳定人格。
外部验证在这里比模型自我保证可靠。所谓外部,可以是一条可追溯的原始对话,可以是用户本人确认,也可以是与任务相匹配的独立规则和评测。
对用户来说,也有一个简单的判断办法。下一次 AI 说「你一向」「你显然」「这很符合你的性格」时,可以追问一句。你依据的是我说过的哪句话,哪些部分是你的推断?
一款值得长期信任的个性化 AI,不应该只会描述你。
它还应该允许你检查,它到底把谁当成了你。
参考资料
- Yushi Sun、Yanjie Zhang、Rui Sheng,2026-08-05,The Personalization Mirage, How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads
- Myra Cheng 等,Science,2026-03-26,Sycophantic AI decreases prosocial intentions and promotes dependence
- Lujain Ibrahim 等,2026-05-08,Sycophantic AI makes human interaction feel more effortful and less satisfying over time
- Yeonjun In 等,2026-05-25,Personalize-then-Store, Benchmarking and Learning Personalized Memory for Long-horizon Agents
- John Conlon、Peter Schwardmann,2026-07-30,AI Sycophancy and Decisions
/ 作者,钟懿