研究:能查AI时,人们几乎不再说“我不知道”
五项实验、3132 名参与者,AI给出的建议几乎全错,但“我不知道”的比例仍从 44% 降到 3%,自信度升到 2.5 倍,正确率反而从 27.6% 跌到 10%。
AI解读:这项研究测试的不是“AI答得准不准”,而是一个更隐蔽的后果:手边有AI可查时,人还愿不愿意承认自己不知道。结果几乎是断崖式的,对照组有 36%–44% 的题留空说不知道,能查AI后只剩 3%–6%。
关键在于实验故意选了AI容易答错的题。他们问了电影里的视觉细节,比如《我爱贝克汉姆》里球队队服的颜色,这类信息很少出现在网络文本里,模型只能编。所以“答得多”并没有换成“答得对”,有AI时正确率从 27.6% 降到 10.0%,整体从 27.5% 降到 9.2%。
真正受影响的是那些本该用“我不知道”来止损的场景:搜索摘要、写作助手自动弹出的建议,只要答案在那儿,人就倾向接受。研究里即使不主动问、AI答案自动显示,留空率也降到 1%–7%。研究者的解释是,语言模型永远不会说“我不确定”,用户可能把这套不设限的习惯也接过来了。
经济激励能改善但幅度有限。答对得 10 美分、答错扣 10 美分时,参与者更少求助AI,也更常答对,但“AI是否可用”和“有没有钱”之间没有出现统计上显著的交互,说明两者各自起作用,光靠小奖励没能把判断权拉回来。
需要说明实验边界:题目是电影冷知识,AI被刻意选成不可靠,结论能否推广到医疗、法律等有真实后果的领域,研究者自己也没定论。但至少说明,单纯把模型做得更准,未必能解决“人不愿承认不知道”这件事。
一项由Marcoccia、Quattrociocchi、Capraro完成的研究用五项实验、3132 名参与者测试了同一个问题:手边有语言模型可用时,人还会不会说“我不知道”。结果显示,仅仅让AI建议处于可获取状态,几乎就抹掉了这种意愿。
在可以自己选择是否求助AI的前两项研究(1a、1b)中,没有AI可用的对照组分别在 36% 和 44% 的题目上保留判断;有AI可用时,这两个数字降到 6% 和 3%。
研究刻意选了该模型几乎总是答错的题目。他们使用的是Step 3.5 Flash,题目是电影中的细微视觉细节,例如《我爱贝克汉姆》(Bend It Like Beckham)里球队队服的颜色。作者称这类细节很少出现在网络文本中,因此是幻觉的高发目标。
研究 2 还测了自信度。在没有经济激励时,有AI可用者的信心达到 100 分制的 75.9 分,无AI时为 29.6 分,约为 2.5 倍。同一时间,正确率从 27.6% 降至 10.0%。
汇总所有研究,无激励条件下有AI可用的参与者答对 9.2% 的题目,无AI时为 27.5%。他们用AI回答了更多题,但正确率大约只有前者的三分之一。
研究 2 的图显示:AI可用使判断搁置(judgment suspension)接近零(a),自信度大幅上升(b),正确率同时下降(c),经济激励减少了参与者寻求AI建议的频率(d)。
激励减少了求助,但没有解决“不说不知道”
研究 2 至 4 加入了经济激励:每答对一题得 10 美分,答错扣 10 美分,答“我不知道”不得钱。研究者预注册的假设是,激励会提高弃权意愿,但AI可用性会削弱这一效果。三项研究都没有显示统计学上显著的交互作用,研究称AI可用性和经济激励大体各自独立地起作用。
激励让参与者更少寻求AI建议:研究 3 中请求次数为 4.53 次对 5.27 次(满分为 6 次),也让有AI可用时答对更多。判断搁置随激励略有上升,但仍远低于无AI对照组。研究者承认激励有效但温和,更大或基于声誉的激励能否进一步缩小差距尚不可知。
研究 4 中,AI答案被自动展示给参与者,无需他们主动提问。研究者称这反映了日益普遍的现实:搜索引擎显示AI生成摘要,写作助手主动给出建议。效果几乎没有变化:无激励时,判断搁置从无AI的 35% 降至有自动显示AI答案的 1%;有激励时,从约 39% 降至 7%。
- 研究 2–4 的激励设置:答对 +10 美分,答错 −10 美分,“我不知道”得 0。
- 研究 3 中寻求AI建议的平均次数:有激励 4.53 次,无激励 5.27 次(满分 6 次)。
- 研究 4 自动显示AI答案时,无激励下判断搁置从 35% 降至 1%,有激励下从约 39% 降至 7%。
研究者的解释:人类会沿用模型“必须回答”的习惯
研究者将结果放在“Epistemia”这一概念下讨论,即因为AI答案听起来可信而接受它、实际并不核实的倾向。作者写道,语言模型总是要产出答案,即使不知道某事也不会停顿。当用户把判断外包给这样一个系统时,他们可能也继承了它不设限的习惯。
这一效果与“建议使用”(advice use)研究中的常见发现相反。人们通常会低估外部建议,只向顾问的立场移动约三分之一。研究者称,本研究的参与者做了相反的事:他们从数据中得出结论,AI可用把一些本会答对的回答变成了错误。在无激励条件下,AI组回答了更多题,但正确答案更少。
研究团队写道,随着AI答案变得无处不在且越来越多地未经请求就出现,说“我不知道”的意愿可能是人机交互的首批牺牲品之一。人类判断能否在AI系统扩散中保持,可能较少取决于让模型更准确,而更多取决于人们是否继续认识并尊重自身知识的局限。
- 研究者将现象命名为“Epistemia”:接受AI答案因其听起来有说服力,而非实际核查。
- 与建议使用研究的对比:人们通常只向外部建议移动约三分之一,本研究中参与者却几乎完全采纳AI。
- 研究者的结论句:说“我不知道”的意愿可能是人机交互的首批牺牲品之一。
相关研究:AI使用与批判性思维、元认知的关联
文章还列举了其他研究作为背景。瑞士商学院一项 666 名参与者的研究显示,AI使用与批判性思维之间存在强负相关:人越信任AI,就越把认知任务外包,形成一个进一步削弱批判性思维的循环。
实验证据显示,与AI助手合作短短 10 到 15 分钟,就能在后续无AI任务中可测量地降低问题解决能力和坚持性;只把AI用于解释或忽略AI的参与者没有出现下降。微软的另一项研究得出相似结论,并指出AI使用对元认知(监控和引导自身思考的能力)提出了很高要求,较高教育水平是一个保护因素。
- 瑞士商学院研究:666 名参与者,AI使用与批判性思维呈强负相关。
- 实验证据:10–15 分钟AI助手合作即可降低后续无AI任务的表现,仅用AI做解释或忽略AI则无下降。
- 微软研究:AI使用对元认知要求高,高教育水平是保护因素。