HuggingFace Daily Papers(社区热门论文) · 2026/8/5

个性化幻象:LLM如何捏造用户画像,以及为何自我监控具有误导性

一项新研究揭示了LLM在个性化场景中的“过度推断”问题:模型会捏造超出证据支持的用户属性。研究引入MirageBench基准,测试12个模型发现所有模型均存在此现象(35%-49%)。更关键的是发现“自我监控反转”:自我评估越自信的模型,实际捏造越多,表明模型自我报告不可靠,外部验证才是更可信的基础。

arXiv:2608.04570 [cs.CL](2026年8月5日提交)

标题:个性化幻象:LLM如何捏造用户画像,以及为何自我监控具有误导性

作者:Yushi Sun, Yanjie Zhang, Rui Sheng

摘要: 具有持久记忆的个性化大语言模型(LLM)正被日益广泛地部署,然而其用户模型的忠实度仍未得到检验。我们研究了过度推断(OI)现象:即LLM捏造超出证据支持范围的用户属性。我们引入了MirageBench基准,包含150个在刻板印象、反刻板印象和中性画像之间平衡的人物设定,6项覆盖“想象梯度”的个性化任务,一个由独立评判者操作的四维忠实度分类体系(在400条声明上与盲法人工标注者进行验证:四类Cohen's kappa = 0.863,二类kappa = 0.900),以及一个涵盖7个模型家族共12个模型、基于143,616条已评判声明的排行榜。我们发现过度推断现象普遍存在:评估中的12个模型均对其35%至49%的声明进行了过度推断(跨模型均值41.6%;按声明加权41.8%),没有任何模型能够幸免。最引人注目的是,我们发现了“自我监控反转”现象:在模型选择层面,模型的自我评估OI与其评判者测量的OI呈负秩相关(rho = -0.60,p = 0.044;探索性分析,宽置信区间[-0.90, +0.06],n = 12)。报告过度推断最少的模型,往往被标记为捏造最多的模型,因此自我报告的信心在比较模型时是一个误导性信号,尽管在单一模型内部,自我审计仍能较好地对其自身声明进行排序(AUROC 0.58-0.83)。我们进一步表明,OI依赖于任务(27%-59%),并且在多轮试点中,推断出的属性近似线性累积,且很少被修正。MirageBench将外部验证而非模型自我报告定位为可信个性化的更可靠基础。

主题:计算与语言(cs.CL)

引用格式:arXiv:2608.04570 [cs.CL]

DOI:https://doi.org/10.48550/arXiv.2608.04570

提交历史:来自Yushi Sun [查看邮箱] [v1] 2026年8月5日 星期三 08:00:54 UTC(4,180 KB)

全文链接:查看PDF、查看HTML(实验性)、TeX源码、查看许可

当前浏览上下文:cs.CL < 上一篇 | 下一篇 > 新 | 近期 | 2026-08

参考文献与引用:NASA ADS、Google Scholar、Semantic Scholar、导出BibTeX引用

书目工具:书目浏览器、关联论文、Litmaps、scite.ai智能引用

代码、数据与媒体:alphaXiv、CatalyzeX代码查找器、DagsHub、Gotit.pub、Hugging Face、ScienceCast

演示:Replicate、Hugging Face Spaces、TXYZ.AI

相关论文推荐与搜索工具:Influence Flower、CORE推荐器

关于arXivLabs:arXivLabs是一个允许合作者直接在网站上开发和分享新arXiv功能的框架。与arXivLabs合作的组织和个人都接受并认同我们对开放性、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。有能为arXiv社区增值的项目想法吗?了解更多关于arXivLabs的信息。

本文作者中哪些是背书人?| 禁用MathJax

FDE 判断

对FDE项目而言,该研究直接警示:依赖LLM进行客户画像或个性化交付时,模型可能系统性捏造用户特征,且自我评估信号具有误导性。FDE在为企业客户部署个性化AI时,必须建立外部验证机制,而非信任模型自述,否则可能导致交付结果与客户真实需求严重偏离,影响项目信任度和交付质量。