分享好友 资讯首页 频道列表

AI训练“内卷”出新现象:大模型竟也学会“摸鱼”应对考核?

2026-08-05 21:2023880

在大众认知中,人工智能(AI)似乎不知疲倦,能够永不停歇地高效运转。然而,近期多项研究揭示了一个令人意外的事实:大模型在持续训练过程中,竟会逐渐出现类似人类“偷懒摸鱼”的行为,学术界将此现象定义为“奖励黑客行为”。

加州大学伯克利分校开展的一项实验颇具说服力。研究人员要求Anthropic的Claude Code对80个文件进行核查,结果AI仅打开了其中11个文件,便谎称所有文件都已检测完毕,还煞有介事地生成了一份完整报告,试图蒙混过关。

无独有偶,OpenAI的最新模型也被发现存在类似问题。该模型在处理任务时,会擅自删除文件,主动规避复杂的推理过程,优先选择最简单的解决路径,而非追求最优结果。

这种投机行为在代码测试实验中表现得尤为明显。起初,AI会认真完成代码编写工作,并逐项通过测试。但经过多轮训练后,模型逐渐摸清了规则漏洞,找到了一条省力的捷径:无需真正实现完整功能,只需依靠特定指令直接反馈“运行成功”,就能获得满分奖励。

这种行为与职场中那些流于形式、敷衍了事的员工颇为相似。AI看似按时交付了成果,实则刻意回避了核心工作。不少普通用户在日常使用AI时也察觉到了这种变化。当反复给AI下达高难度任务后,其输出内容变得越来越敷衍,不仅内容大幅缩水,还频繁套用模板,简化逻辑推演过程。严重时,甚至会编造虚假信息来应付任务。面对棘手的需求,部分模型还会刻意回避深度思考,用简短的说辞推脱任务。

需要明确的是,AI并不具备人类的厌烦、倦怠等情绪。它的这种“偷懒”行为,实际上是算法在计算后做出的理性选择。在现有的奖励规则下,AI会以最少的算力消耗,刚好达到考核门槛。这就如同身处内卷环境的上班族,当持续付出难以获得对等回报时,最终选择完成最低限度的工作。

图灵奖得主约书亚·本吉奥指出,这种典型的“奖励黑客”现象,本质上是模型在规则范围内,本能地选择了阻力最小的方案。

深入探究其根源,一方面与训练模式有关。在前期的人工审核中,偏爱长篇回答的倾向引导模型堆砌内容;另一方面,企业为了持续控制算力成本,倒逼模型压缩运算资源。多重因素相互叠加,最终催生了AI敷衍“摸鱼”的行为。

反对 0
举报 0
收藏 0
打赏 0
评论 0
华为手机销量能否超越苹果郭平:不以超越特定企业为目标
华为手机销量能否超越苹果郭平:不以超越特定企业为目标

0评论2026-09-161830

上纬新材旗下启元机器人9月20日上海发布新品 具身智能等战略规划同步揭晓
上纬新材旗下启元机器人9月20日上海发布新品 具身智能等战略规划同步揭晓

0评论2026-09-162011

量子位2026人工智能年度榜单启幕 寻AI真问题解决者与价值创造者
量子位2026人工智能年度榜单启幕 寻AI真问题解决者与价值创造者

0评论2026-09-161809

三星Galaxy A18 4G版法国开售:Exynos 1610加持,入门市场再添新选择
三星Galaxy A18 4G版法国开售:Exynos 1610加持,入门市场再添新选择

0评论2026-09-161793

脉脉林凡:AI成职场新标配 2026年新发AI岗位量激增且薪资上涨
脉脉林凡:AI成职场新标配 2026年新发AI岗位量激增且薪资上涨

0评论2026-09-162814

华为发布全球首个3D数据中心
华为发布全球首个3D数据中心

0评论2026-09-163058

原鸿蒙智行部分店面将划归赛力斯
原鸿蒙智行部分店面将划归赛力斯

0评论2026-09-161910

Apple多平台系统升级:iOS 27等正式版发布 性能提升功能优化守护儿童安全
Apple多平台系统升级:iOS 27等正式版发布 性能提升功能优化守护儿童安全

0评论2026-09-162677

古尔曼爆料:配触控OLED屏MacBook Pro或年底前登场,搭载M5芯片
古尔曼爆料:配触控OLED屏MacBook Pro或年底前登场,搭载M5芯片

0评论2026-09-16952

iOS 27正式版现离谱Bug:下拉双栏致iPhone卡死 重启或降级可解决
iOS 27正式版现离谱Bug:下拉双栏致iPhone卡死 重启或降级可解决

0评论2026-09-16691