计算机科学 > 社会与计算机 arXiv:2510.01395 (cs) [提交于2025年10月1日] 标题:阿谀奉承的AI减少亲社会意图并助长依赖 作者:Myra Cheng, Cinoo Lee, Pranav Khadpe, Sunny Yu, Dyllan Han, Dan Jurafsky 查看论文PDF,标题为《阿谀奉承的AI减少亲社会意图并助长依赖》,作者Myra Cheng等6人 查看PDF HTML(实验性)
摘要: 公众和学术界都对AI的“谄媚”现象表示担忧,即人工智能过度同意或奉承用户。然而,除了个别媒体关于严重后果(如强化妄想)的报道外,人们对谄媚的程度或其如何影响AI使用者知之甚少。在此,我们展示了当人们向AI寻求建议时,谄媚的普遍性和有害影响。
首先,在11个最先进的AI模型中,我们发现模型高度谄媚:它们对用户行为的肯定比人类多50%,甚至在用户查询提到操纵、欺骗或其他关系伤害的情况下也是如此。其次,在两个预注册实验(N=1604)中,包括一个参与者讨论生活中真实人际冲突的实时互动研究,我们发现与谄媚AI模型的互动显著降低了参与者采取行动修复人际冲突的意愿,同时增强了他们自认为正确的信念。然而,参与者认为谄媚的回应质量更高,更信任谄媚的AI模型,并更愿意再次使用它。这表明人们被不加质疑地认可他们的AI所吸引,即使这种认可可能侵蚀他们的判断力并减少他们亲社会行为的倾向。这些偏好产生了不正当的激励,既促使人们越来越依赖谄媚的AI模型,也促使AI模型训练偏向谄媚。我们的发现强调了明确解决这种激励结构以减轻AI谄媚广泛风险的必要性。
主题:社会与计算机 (cs.CY);人工智能 (cs.AI) 引用为:arXiv:2510.01395 [cs.CY](或此版本的arXiv:2510.01395v1 [cs.CY]) https://doi.org/10.48550/arXiv.2510.01395 通过DataCite了解更多arXiv发布的DOI
提交历史:来自Myra Cheng [查看电子邮件] [v1] 2025年10月1日 19:26:01 UTC(5,571 KB)
全文链接: 访问论文:查看PDF,标题为《阿谀奉承的AI减少亲社会意图并助长依赖》,作者Myra Cheng等6人 查看PDF HTML(实验性) TeX源代码查看许可证 当前浏览上下文:cs.CY < 上一个 | 下一个 > 新 | 近期 | 2025-10 更改为浏览:cs cs.AI
参考文献与引用: NASA ADS Google Scholar Semantic Scholar 导出BibTeX引用 加载中... BibTeX格式化引用 × 加载中... 数据提供:
书签: 书目工具: 书目浏览器(什么是书目浏览器?) 相关论文(什么是相关论文?) Litmaps(什么是Litmaps?) scite.ai(什么是scite智能引用?)
代码、数据与媒体: 与本文相关的代码、数据与媒体 alphaXiv(什么是alphaXiv?) 代码链接(什么是CatalyzeX代码查找器?) DagsHub(什么是DagsHub?) Gotit.pub(什么是Gotit.pub?) Hugging Face(什么是Hugging Face?) ScienceCast(什么是ScienceCast?)
演示: Replicate(什么是Replicate?) Spaces(什么是Hugging Face Spaces?) Spaces(什么是TXYZ.AI?)
相关论文推荐与搜索工具: Influence Flower链接(什么是Influence Flowers?) 核心推荐器(什么是CORE推荐器?)
作者、机构、主题
关于arXivLabs: arXivLabs:与社区合作者的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。与arXivLabs合作的个人和组织都接受并采纳了我们的价值观:开放性、社区、卓越和用户数据隐私。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有想法为arXiv社区增加价值吗?了解更多关于arXivLabs的信息。
哪些作者是本文的认可者?| 禁用MathJax(什么是MathJax?)