觉
AI觉醒星球
Awakening is here
Knowledge File / AI技能杠杆
2026-09-27 1 浏览 免费阅读

研究发现:有 AI 可用时,人们几乎完全不愿说“我不知道”

一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自动展示、用户无需主动询问时,弃权率最低降到 1%。

SOURCE / AI技能杠杆 MIN / 9 ACCESS / 免费阅读 POST / 2026-09-27 00:56:36

原贴

查看原文
作者:Matthias Bastian 来源站点:the-decoder.com 原贴时间:

原文

Researchers ran five experiments with 3,132 participants to test whether access to a language model changes how people handle uncertainty. Just having AI advice available nearly wiped out people's willingness to say "I don't know." The researchers picked questions where the model they used, Step 3.5 Flash , was almost always wrong. These were questions about fine visual details from movies, like the color of a team uniform in Bend It Like Beckham. According to the authors, such details rarely appear in online text, which makes them prime targets for hallucinations. GPT-5.5, Claude 4.6 Sonnet, and Gemini 3.5 Flash got most of the other questions right but sometimes failed on the harder ones. Because the AI advice was mostly wrong, the effect can't be explained as reasonable delegation to a reliable tool. The researchers still see a tendency for people to defer to AI answers, but whether this holds just as strongly beyond movie trivia remains an open question. In the first two studies (1a and 1b), participants could choose whether to ask an AI for advice. In the control group without AI access, they withheld their judgment on 36 and 44 percent of questions. With AI access, those numbers dropped to 6 and 3 percent. In Study 2, the researchers also measured participant confidence. Without financial incentives, confidence with AI access hit 75.9 points on a scale of 100, compared to 29.6 points without AI. That's roughly two and a half times higher. At the same time, the share of correct answers fell from 27.6 to 10.0 percent. Participants were far more confident but wrong much more often. Across all studies, participants without incentives who had AI access got 9.2 percent of questions right, versus 27.5 percent without AI. They answered more questions with AI but were correct only about a third as often. Studies 2 through 4 added financial incentives. Participants earned 10 cents for each correct answer, lost 10 cents for each wrong one, and got nothing for "I don't know." The researchers had pre-registered the hypothesis that incentives would increase willingness to abstain but that AI availability would weaken that effect. None of the three studies showed a statistically significant interaction. AI access and financial incentives worked largely on their own, according to the study. Incentives led participants to seek AI advice less often, with 4.53 versus 5.27 out of six possible requests in Study 3, and to answer correctly more often when AI was available. Judgment suspension rose slightly with incentives but stayed well below the no-AI control group. The incentives worked but were modest, as the researchers acknowledge. Whether larger or reputation-based incentives would close the gap further is unknown. In Study 4, the AI answer was shown to participants automatically without them having to ask. The researchers say this mirrors a growing reality where search engines display AI-generated summaries and writing assistants offer unsolicited suggestions. The effect barely changed. Without incentives, judgment suspension dropped from 35 percent without AI to 1 percent with automatically displayed AI answers. With incentives, it fell from about 39 to 7 percent. The researchers frame their results in the context of "Epistemia" , the tendency to accept AI answers because they sound convincing rather than actually checking them. A language model always has to produce an answer. It never pauses, even when it doesn't know something. When users hand off their judgment to such a system, they may adopt its lack of restraint, the authors write. The effect also runs counter to what "advice use" research has shown. People normally underweight outside advice and shift only about a third of the way toward an advisor's position. Participants in this study did the opposite, the authors say.

中文翻译

研究人员开展了五项实验,共 3,132 名参与者,以检验使用语言模型是否会改变人们处理不确定性的方式。仅仅是有 AI 建议可用,就几乎抹平了人们说“我不知道”的意愿。

研究人员挑选的问题是所用模型 Step 3.5 Flash 几乎总是答错的。这些问题是关于电影中细微视觉细节的,比如《我爱贝克汉姆》中一支球队队服的颜色。作者表示,这类细节很少出现在在线文本中,这使它们成为幻觉的主要目标。GPT-5.5、Claude 4.6 Sonnet 和 Gemini 3.5 Flash 答对了其他大部分问题,但在较难的问题上有时也会失败。由于 AI 建议大多是错的,这一效应不能被解释为对可靠工具的合理委托。研究人员仍然看到人们倾向于服从 AI 答案,但这一倾向是否在电影冷知识之外同样强烈,仍是一个开放问题。

在前两项研究(1a 和 1b)中,参与者可以选择是否向 AI 寻求建议。在无 AI 访问的对照组中,他们分别在 36% 和 44% 的问题上保留了自己的判断。有 AI 访问时,这些数字降至 6% 和 3%。

在研究 2 中,研究人员还测量了参与者的信心。在没有金钱激励的情况下,有 AI 访问时信心达到 100 分制中的 75.9 分,而没有 AI 时为 29.6 分。这大约高出两倍半。与此同时,正确答案的比例从 27.6% 降至 10.0%。参与者自信得多,却错得更多。

在所有研究中,没有激励但有 AI 访问的参与者答对了 9.2% 的问题,而没有 AI 时为 27.5%。他们借助 AI 回答了更多问题,但正确的几率只有大约三分之一。

研究 2 至 4 加入了金钱激励。参与者每答对一题得 10 美分,每答错一题失去 10 美分,回答“我不知道”则什么也得不到。研究人员预先注册了这样的假设:激励会提高弃权的意愿,但 AI 的可用性会削弱这一效应。三项研究中没有一项显示出统计上显著的交互作用。研究称,AI 访问与金钱激励大体各自独立起作用。激励使参与者向 AI 寻求建议的频率降低——在研究 3 中为六次可能请求中的 4.53 次对 5.27 次——并在有 AI 时答对得更多。判断搁置随激励略有上升,但仍远低于无 AI 的对照组。正如研究人员所承认的,激励起了作用,但幅度不大。更大或基于声誉的激励能否进一步缩小差距尚不可知。

在研究 4 中,AI 答案被自动展示给参与者,无需他们主动询问。研究人员称,这反映了搜索引擎显示 AI 生成摘要、写作助手提供未经请求的建议这一日益增长的现实。效应几乎未变。没有激励时,判断搁置从无 AI 时的 35% 降至有自动显示 AI 答案时的 1%。有激励时,它从约 39% 降至 7%。

研究人员将他们的结果放在“Epistemia”的语境中,即因为 AI 答案听起来有说服力就接受它、而非真正核实它的倾向。语言模型总是必须给出一个答案。即使它不知道某事,它也从不暂停。作者写道,当用户把判断权交给这样一个系统时,他们可能会采纳它不加克制的习惯。这一效应也与“建议使用”研究此前显示的结果相反。人们通常会低估外部建议,只朝顾问的立场移动约三分之一。作者说,本研究中的参与者做的恰恰相反。

核心信息

一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自动展示、用户无需主动询问时,弃权率最低降到 1%。

  • 一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自动展示、用户无需主动询问时,弃权率最低降到 1%。
  • 原贴提到:Researchers ran five experiments with 3,132 participants to test whether
  • 来源:the-decoder.com

详细解读

这是什么信号

这不是“AI 会不会答错”的问题,而是“AI 在场会不会改变人怎么面对不知道”的问题。研究做了 5 个实验、3,132 人。最关键的一组结果:没有 AI 时,人们在 36% 和 44% 的问题上选择不作判断;一旦可以求助 AI,这个比例掉到 6% 和 3%。研究还刻意选了所用模型几乎总是答错的题目——电影里的细微视觉细节,比如队服颜色,这类信息很少出现在在线文本里,属于幻觉高发区。也就是说,弃权率的崩塌不能解释为“把问题交给了可靠的专家”。

为什么重要

两个数字放在一起看,信号就很刺眼:有 AI 访问时,信心从 29.6 分升到 75.9 分(100 分制),正确率却从 27.6% 降到 10%。合并所有研究,有 AI 的参与者答对 9.2%,无 AI 时是 27.5%——多回答了很多题,正确率大约只有三分之一。更值得警惕的是传播形态:研究 4 里 AI 答案被自动展示、用户不必主动询问时,弃权率从 35% 掉到 1%。搜索引擎的 AI 摘要、写作助手未经请求的建议,正好是这种形态。研究者的解释是“Epistemia”:因为答案听起来可信就接受它,而不去核实——语言模型永远必须输出一个答案,它从不因为不知道而暂停,用户可能连这种“不克制”一起继承下来。

对谁有价值

AI 产品团队:决定“要不要显示答案、要不要显示不确定性”的人。知识密集型组织的决策者:把 AI 输出当作参考起点的人。内容与信息平台:搜索结果页上那一段摘要是怎么被读走的。做 AI 素养培训的人:这里有一个比“AI 会幻觉”更好用的教学切口——真正被改变的是人认错的意愿。还有研究者自己:这项发现与建议采纳(advice taking)的既有文献相反,过去人们通常会低估外部建议。

可以怎么行动

  • 产品层面:把“我不知道”做成一等输出,而不是失败状态;在细节型、事实型问题上显式标注不确定性,而不是只给一个自信的句式。
  • 流程层面:在关键判断上保留“无 AI 对照”,先写下自己的判断再打开 AI;对自动弹出的建议,明确要求先质疑再采纳。
  • 组织层面:不要把回答率、采纳率当成唯一成功指标,同时看正确率;把“弃权”和“升级给人”作为被奖励的行为。研究里答错扣钱确实提升了正确率,但效果温和。
  • 个人层面:区分“我记得”和“AI 说”。对低可验证性的细节,先默认自己不知道。

风险与限制

几个边界需要说清。第一,实验题目是为制造错误挑出来的电影视觉细节,这类问题在线文本稀少、模型易错,效应可能被放大;离开这类冷知识是否同样强烈,研究者自己说是开放问题。第二,模型表现并不一致:GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash 答对了大部分其他问题,只在更难的问题上失手;换模型、换题目,量级可能变化。第三,金钱激励减少求助、提升正确率,但与 AI 可用性的交互作用在三项研究中都不显著,作者也承认效果有限;更大或基于声誉的激励会怎样,未知。因此把它读成“AI 让人变笨”的证据是过度延伸,它更精确的含义是:AI 的在场会压缩人承认不确定的空间,而这个空间恰好是校准判断的最后一道闸门。

信息差价值

这条内容的真正价值,不只是“有人发布了一个新功能”,而是它揭示了 the-decoder.com 背后的产品方向、工作流变化或竞争信号。对 OPC 来说,这种信息可以转化成持续追踪的栏目选题。

如果把《研究发现:有 AI 可用时,人们几乎完全不愿说“我不知道”》放到你的内容系统里,它最大的价值在于帮助读者更快看懂“为什么值得关注”,而不是只看到一条碎片化动态。

参考来源

AI SUMMARY

这篇文章回答了什么

研究发现:有 AI 可用时,人们几乎完全不愿说“我不知道”主要讲什么?

一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从 27.6% 降到 10.0%;合并所有研究,有 AI 时正确率 9.2%,无 AI 时 27.5%。当 AI 答案被自…

这篇文章最值得关注的要点是什么?

一项包含 5 个实验、3,132 名参与者的研究显示,只要能向 AI 求助,人们几乎不再说“我不知道”。在研究者刻意挑选的、模型几乎总是答错的电影细节题上,参与者的信心升到约 2.5 倍(75.9 对 29.6,满分 100),正确率却从…;原贴提到:Researchers ran five experiments with 3,132 participants to test whether;来源:the-decoder.com

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI超级个体、AI工具专题里阅读。 关联原因:这篇内容命中「Agent、工作流」等主题信号。;这篇内容命中「技能、认知」等主题信号。;这篇内容命中「模型」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 已经是本栏目第一篇
下一篇 Arena:GPT-6 Sol(Max)以 +7.7% 净改进重塑 Agent Arena Pareto 前沿