分享好友 资讯首页 频道列表

OpenAI 推出 AI “忏悔”框架:旨在训练模型承认不当行为,提高诚实度

2025-12-05 01:1328910

OpenAI 今日宣布,正在开发一个名为的创新框架,旨在训练人工智能模型能够坦诚承认自身何时做出了不当行为或潜在的问题决策。

大型语言模型(LLM)通常被训练成提供“符合预期”的回答,这使得它们越来越容易做出阿谀奉承或信口开河的虚假陈述。OpenAI 的新训练模型正是为了解决这一问题,引导模型在主要答案之后做出二次回应,详细说明其得出主要答案的过程。

与传统 LLM 评判标准(如帮助性、准确性和服从性)不同,“忏悔”机制对二次回应的评判标准仅基于诚实性。

研究人员明确表示,他们的目标是鼓励模型坦诚地说明其行为,即便这些行为包括潜在的问题行为,例如:作弊,故意降低分数,违反指令等。

OpenAI 表示:“如果模型诚实地承认作弊、故意降低分数或违反指令,这种坦白反而会增加其奖励,而不是减少。”

OpenAI 认为,无论出于何种目的,类似“忏悔”这样的系统都可能对 LLM 的训练有所帮助,并强调其最终目标是让 AI 更加透明。相关的技术文档已同步发布,供感兴趣者查阅。

反对 0
举报 0
收藏 0
打赏 0
评论 0
OpenAI新图像模型“mona-lisa-1”现身盲测 性能细节待官方进一步揭晓
OpenAI新图像模型“mona-lisa-1”现身盲测 性能细节待官方进一步揭晓

0评论2026-08-131250

高通收购Modular强强联合,共拓AI计算平台多领域高增长市场
高通收购Modular强强联合,共拓AI计算平台多领域高增长市场

0评论2026-08-13971

荣耀Magic9系列9月重磅登场!影像AI全面升级 开启超前盲约引期待
荣耀Magic9系列9月重磅登场!影像AI全面升级 开启超前盲约引期待

0评论2026-08-131478

滴水湖论坛助力国产RISC-V芯片发展 40余款产品量产率超九成
滴水湖论坛助力国产RISC-V芯片发展 40余款产品量产率超九成

0评论2026-08-131094

Harness正式浮出水面,DeepSeek不再只做模型
Harness正式浮出水面,DeepSeek不再只做模型

0评论2026-08-12907

OpenAI元老级高管Brad Lightcap离职,IPO筹备期高管变动引关注
OpenAI元老级高管Brad Lightcap离职,IPO筹备期高管变动引关注

0评论2026-08-122561

OpenAI推付费重置额度服务:ChatGPT Plus用户8美元可续 探索使用时长新方案
OpenAI推付费重置额度服务:ChatGPT Plus用户8美元可续 探索使用时长新方案

0评论2026-08-121022

DeepSeek Harness团队公众号注册,桌面端Agent产品或加速落地?
DeepSeek Harness团队公众号注册,桌面端Agent产品或加速落地?

0评论2026-08-122974

56万亿像素宇宙二维地图问世 近40亿天体全景图助力探索宇宙奥秘
56万亿像素宇宙二维地图问世 近40亿天体全景图助力探索宇宙奥秘

0评论2026-08-121985

突发:OpenAI“1号商务员工”离职,或将创业
突发:OpenAI“1号商务员工”离职,或将创业

0评论2026-08-12517