你的 AI 越懂你,越可能在编造你
人们已经习惯检查 AI 是否把事实说错。 它给出的论文存不存在,引用能不能打开,计算结果有没有少一个零。这些错误至少有一个明确的校对对象,世界上存在一份更接近真相的答案。 个性化 AI 带来了一种更难察觉的幻觉。 它可能记得你喜欢什么,也可能根据几句话推断你的职业、性格、家庭状态、消费能力和政治倾向。前一部分来自对话,后一部分由模型补齐。时间一长,两者会被一起塞进「关于你」的记忆里,再反过来影响后续推荐、建议和语气。 AI 记住了一个被自己续写过的你。 画像里的四成主张,证据可能不足 8 月 5 日提交的一篇论文,把这个问题称为「个性化海市蜃楼」。研究团队构建了 MirageBench,用 150 个经过平衡设计的人物档案、6 类个性化任务,测试了来自 7 个模型家族的 12 个模型。 研究者把模型生成的 143,616 条用户相关主张逐项分类。他们关注「过度推断」,也就是模型说出了一项关于用户的属性,现有证据却不足以支持这项判断。它与普通事实错误属于两类问题。 结果很整齐,也很难看。12 个模型无一例外地出现过度推断,各模型比例落在 35% 至 49% 之间,跨模型平均值为 41.6%。任务类型也会改变风险,过度推断率从 27% 到 59% 不等。 这组数字不等于「AI 记忆里四成内容都是假的」。MirageBench 使用的是研究者构造的角色和任务,统计对象是模型在测试中生成的属性主张,不能直接换算成现实产品中每个用户的记忆错误率。 它证明了另一件事。当任务要求模型根据有限信息完成个性化时,所有受测模型都表现出补齐证据空白的系统性倾向。 语言模型接受的训练目标,是给出连贯、有用、符合语境的下一段话。用户说自己最近在看婴儿用品,模型可以谨慎地记下「关注婴儿用品」,也可以顺手补成「家里有新生儿」。后一句听起来更像理解,证据却停在了前一步。 个性化越追求顺滑,这一步越容易被忽略。 最自信的自检,也可能最不可靠 MirageBench 还有一个更反常的结果。 研究者让模型评估自己是否过度推断,再把自评结果与外部评测对照。在模型选择层面,两者呈负相关,Spearman 相关系数为 -0.60。换句话说,自称较少乱猜的模型,反而更可能被外部评测标出较多虚构。 这个结果需要谨慎读。样本只有 12 个模型,论文也明确把它标为探索性发现;置信区间很宽,从 -0.90 延伸到 +0.06。它不足以证明模型自检永远无用。论文同时发现,在同一模型内部,自检仍能以有限效果区分哪些主张更可疑。 它足以推翻一个很方便的设计假设。让模型自己给记忆打置信分,无法单独解决画像幻觉。 模型生成用户推断,再由同类模型判断这项推断是否可靠,两个环节可能共享同一种偏差。一个说得圆满的故事,也更容易让讲故事的人相信。 更麻烦的是,论文的多轮试验发现,推断出来的属性会随对话近似线性累积,却很少被主动修正。错误画像一旦进入持久记忆,后续对话还会把它当成新证据。 一条未经确认的推断,可能因此长成一段自洽的历史。 讨好,会让错误画像变得舒服 画像幻觉解决的是「AI 以为你是谁」。另一组研究处理的是「AI 怎样回应它眼中的你」。两者放在一起,风险才完整。 今年 3 月发表在《Science》的一项研究比较了 11 个前沿模型。研究者发现,AI 对用户行为的肯定频率比人类高约 49%,即使用户描述了欺骗、违法或伤害他人的行为,模型也可能优先站在提问者一边。 ...