研究发现:有 AI 可用时,人们几乎完全不愿说“我不知道”
一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自动展示、用户无需主动询问时,弃权率最低降到 1%。
原贴
查看原文原文
中文翻译
研究人员开展了五项实验,共 3,132 名参与者,以检验使用语言模型是否会改变人们处理不确定性的方式。仅仅是有 AI 建议可用,就几乎抹平了人们说“我不知道”的意愿。
研究人员挑选的问题是所用模型 Step 3.5 Flash 几乎总是答错的。这些问题是关于电影中细微视觉细节的,比如《我爱贝克汉姆》中一支球队队服的颜色。作者表示,这类细节很少出现在在线文本中,这使它们成为幻觉的主要目标。GPT-5.5、Claude 4.6 Sonnet 和 Gemini 3.5 Flash 答对了其他大部分问题,但在较难的问题上有时也会失败。由于 AI 建议大多是错的,这一效应不能被解释为对可靠工具的合理委托。研究人员仍然看到人们倾向于服从 AI 答案,但这一倾向是否在电影冷知识之外同样强烈,仍是一个开放问题。
在前两项研究(1a 和 1b)中,参与者可以选择是否向 AI 寻求建议。在无 AI 访问的对照组中,他们分别在 36% 和 44% 的问题上保留了自己的判断。有 AI 访问时,这些数字降至 6% 和 3%。
在研究 2 中,研究人员还测量了参与者的信心。在没有金钱激励的情况下,有 AI 访问时信心达到 100 分制中的 75.9 分,而没有 AI 时为 29.6 分。这大约高出两倍半。与此同时,正确答案的比例从 27.6% 降至 10.0%。参与者自信得多,却错得更多。
在所有研究中,没有激励但有 AI 访问的参与者答对了 9.2% 的问题,而没有 AI 时为 27.5%。他们借助 AI 回答了更多问题,但正确的几率只有大约三分之一。
研究 2 至 4 加入了金钱激励。参与者每答对一题得 10 美分,每答错一题失去 10 美分,回答“我不知道”则什么也得不到。研究人员预先注册了这样的假设:激励会提高弃权的意愿,但 AI 的可用性会削弱这一效应。三项研究中没有一项显示出统计上显著的交互作用。研究称,AI 访问与金钱激励大体各自独立起作用。激励使参与者向 AI 寻求建议的频率降低——在研究 3 中为六次可能请求中的 4.53 次对 5.27 次——并在有 AI 时答对得更多。判断搁置随激励略有上升,但仍远低于无 AI 的对照组。正如研究人员所承认的,激励起了作用,但幅度不大。更大或基于声誉的激励能否进一步缩小差距尚不可知。
在研究 4 中,AI 答案被自动展示给参与者,无需他们主动询问。研究人员称,这反映了搜索引擎显示 AI 生成摘要、写作助手提供未经请求的建议这一日益增长的现实。效应几乎未变。没有激励时,判断搁置从无 AI 时的 35% 降至有自动显示 AI 答案时的 1%。有激励时,它从约 39% 降至 7%。
研究人员将他们的结果放在“Epistemia”的语境中,即因为 AI 答案听起来有说服力就接受它、而非真正核实它的倾向。语言模型总是必须给出一个答案。即使它不知道某事,它也从不暂停。作者写道,当用户把判断权交给这样一个系统时,他们可能会采纳它不加克制的习惯。这一效应也与“建议使用”研究此前显示的结果相反。人们通常会低估外部建议,只朝顾问的立场移动约三分之一。作者说,本研究中的参与者做的恰恰相反。
核心信息
一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自动展示、用户无需主动询问时,弃权率最低降到 1%。
- 一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自动展示、用户无需主动询问时,弃权率最低降到 1%。
- 原贴提到:Researchers ran five experiments with 3,132 participants to test whether
- 来源:the-decoder.com
详细解读
这是什么信号
这不是“AI 会不会答错”的问题,而是“AI 在场会不会改变人怎么面对不知道”的问题。研究做了 5 个实验、3,132 人。最关键的一组结果:没有 AI 时,人们在 36% 和 44% 的问题上选择不作判断;一旦可以求助 AI,这个比例掉到 6% 和 3%。研究还刻意选了所用模型几乎总是答错的题目——电影里的细微视觉细节,比如队服颜色,这类信息很少出现在在线文本里,属于幻觉高发区。也就是说,弃权率的崩塌不能解释为“把问题交给了可靠的专家”。
为什么重要
两个数字放在一起看,信号就很刺眼:有 AI 访问时,信心从 29.6 分升到 75.9 分(100 分制),正确率却从 27.6% 降到 10%。合并所有研究,有 AI 的参与者答对 9.2%,无 AI 时是 27.5%——多回答了很多题,正确率大约只有三分之一。更值得警惕的是传播形态:研究 4 里 AI 答案被自动展示、用户不必主动询问时,弃权率从 35% 掉到 1%。搜索引擎的 AI 摘要、写作助手未经请求的建议,正好是这种形态。研究者的解释是“Epistemia”:因为答案听起来可信就接受它,而不去核实——语言模型永远必须输出一个答案,它从不因为不知道而暂停,用户可能连这种“不克制”一起继承下来。
对谁有价值
AI 产品团队:决定“要不要显示答案、要不要显示不确定性”的人。知识密集型组织的决策者:把 AI 输出当作参考起点的人。内容与信息平台:搜索结果页上那一段摘要是怎么被读走的。做 AI 素养培训的人:这里有一个比“AI 会幻觉”更好用的教学切口——真正被改变的是人认错的意愿。还有研究者自己:这项发现与建议采纳(advice taking)的既有文献相反,过去人们通常会低估外部建议。
可以怎么行动
- 产品层面:把“我不知道”做成一等输出,而不是失败状态;在细节型、事实型问题上显式标注不确定性,而不是只给一个自信的句式。
- 流程层面:在关键判断上保留“无 AI 对照”,先写下自己的判断再打开 AI;对自动弹出的建议,明确要求先质疑再采纳。
- 组织层面:不要把回答率、采纳率当成唯一成功指标,同时看正确率;把“弃权”和“升级给人”作为被奖励的行为。研究里答错扣钱确实提升了正确率,但效果温和。
- 个人层面:区分“我记得”和“AI 说”。对低可验证性的细节,先默认自己不知道。
风险与限制
几个边界需要说清。第一,实验题目是为制造错误挑出来的电影视觉细节,这类问题在线文本稀少、模型易错,效应可能被放大;离开这类冷知识是否同样强烈,研究者自己说是开放问题。第二,模型表现并不一致:GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash 答对了大部分其他问题,只在更难的问题上失手;换模型、换题目,量级可能变化。第三,金钱激励减少求助、提升正确率,但与 AI 可用性的交互作用在三项研究中都不显著,作者也承认效果有限;更大或基于声誉的激励会怎样,未知。因此把它读成“AI 让人变笨”的证据是过度延伸,它更精确的含义是:AI 的在场会压缩人承认不确定的空间,而这个空间恰好是校准判断的最后一道闸门。
信息差价值
这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。
如果把《研究发现:有 AI 可用时,人们几乎完全不愿说“我不知道”》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。
参考来源
TOPIC HUBS
延伸专题
AI SUMMARY
这篇文章回答了什么
研究发现:有 AI 可用时,人们几乎完全不愿说“我不知道”主要讲什么?
一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自…
这篇文章最值得关注的要点是什么?
一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从…;原贴提到:Researchers ran five experiments with 3,132 participants to test whether;来源:the-decoder.com
这篇文章和哪些AI专题相关?
它适合放在Agent工作流、AI超级个体、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、工作流」等主题信号。;这篇内容命中「技能、认知」等主题信号。;这篇内容命中「模型」等主题信号。
阅读这篇文章建议先理解哪些关键词?
建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。