自信心暴涨但正确率暴跌?最新研究揭示AI辅助下的人类决策悖论

最新涉及3132名参与者的五项实验研究表明,引入AI大语言模型(如GPT-5.5、Claude4.6Sonnet及Gemini3.5Flash等)正显著削弱人类悬置判断的能力,使人们几乎完全丧失承认“我不知道”的意愿。

最新涉及3132名参与者的五项实验研究表明,引入AI大语言模型(如GPT-5.5、Claude4.6Sonnet及Gemini3.5Flash等)正显著削弱人类悬置判断的能力,使人们几乎完全丧失承认“我不知道”的意愿。

研究团队专门挑选了极易引发模型幻觉的精细冷门问题进行测试,结果显示,在无AI辅助的对照组中,参与者对36%至44%的问题选择放弃作答;而在获取AI建议后,这一不作答比例骤降至3%至6%。

更为矛盾的是,在AI辅助下,参与者的答题自信心从29.6分(满分100分)暴涨至75.9分,但实际答对率却从27.5%大幅跌至9.2%,表明即便面对Step3.5Flash等模型给出的错误建议,人类依然倾向于盲目采纳并产生过度自信。

引入答对奖励与答错扣减的经济激励机制虽能在一定程度上降低人们向AI求助的频率,但未能从根本上扭转这一信任错位。更值得行业警惕的是,当测试模拟当前搜索引擎和写作助手的常态,将AI生成的答案自动展示给用户时,即便在有经济激励的条件下,参与者悬置判断的比例依然从39%暴跌至7%。

研究人员将此现象归结为一种新型轻信趋势,即人类容易被AI流畅的表达所说服,从而打破了传统求助行为中保留部分独立判断的习惯。结合此前微软及相关学术机构关于AI削弱人类批判性思维的发现,过度依赖AI正促使人们将认知任务过度外包。

随着生成式AI在各类数字化工具中的无缝嵌入,如何在提升模型自身准确率的同时,设计合理的人机交互机制以维持人类对自身知识边界的认知,将成为下一阶段AI应用落地的重要课题。

💬 评论
🔗 本文链接

以专业为基,引领科技向善向新

Rooted in professionalism, we lead technology toward social good and innovation.

数智化转型网 · 了解更多产业资讯与选型数据 →

📰 你可能也喜欢

数智化转型网每日AI资讯 AI情报站

微软联手哈佛MIT端出生物学世界模型Project Quine,一个周末筛出抗癌候选物

微软研究院把生物学研究的世界模型这个概念第一次真正落了地。它与哈佛大学、麻省理工学院博德研究所联手推出了一套实验性多模态 AI 研究系统 Project Qui…
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

谷歌宣布向免费用户全面开放 Gemini Skills,Gems 功能将于 11 月完成历史性整合

人工智能个性化工具的体验门槛正在迎来大幅降低。谷歌近日正式对外宣布,决定将此前仅限 Pro 和 Ultra 付费订阅用户使用的Gemini Skills自定义指…
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 国内AI资讯

豆包AI再升级:一站式搞定出行全流程,剑指生活服务入口

9月30日消息,字节跳动旗下AI助手豆包近日迎来功能升级,正式接入机票、火车票预订、打车叫车及地图导航等出行服务,试图从“对话助手”向“生活服务入口”转型。
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 国内AI资讯

Anthropic IPO 文件曝光:向 SpaceX 豪掷 845 亿美元锁定 AI 算力

协议规模翻倍,远超 5 月披露水平
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

OpenAI 携手 ModRetro 发布 Codex 专用插件:动动嘴就能造出复古 Game Boy 游戏

在今日召开的2026开发者日活动中,OpenAI 带来了让人眼前一亮的全新跨界合作。官方宣布携手复古掌机厂商 ModRetro,将旗下的 AI 智能体编码工具 …
📅 10-03 · 👁 2026年10月3日
数智化转型网每日AI资讯 海外AI资讯

Anthropic 披露与 SpaceX 签署高达 845 亿美元巨额算力协议

人工智能领域的算力争夺战正在持续加码。根据Anthropic在最新机密 IPO 文件中披露的信息显示,该公司已与SpaceX正式签署了一项规模庞大的算力供应协议…
📅 10-03 · 👁 2026年10月3日