分享好友 资讯首页 频道列表

GPT-6 Astra在ARC-AGI-3接近满分,评测升级,下一站挑战AI“发明力”

2026-09-16 16:5613100

在人工智能领域,一场关于通用人工智能(AGI)评测标准的变革正在悄然发生。GPT-6 Astra模型在ARC-AGI-3基准测试中取得99.9%的惊人成绩后,这场变革被推向了高潮。该测试集原本被视为衡量AI系统类人智能水平的关键指标,如今却因工程优化手段的介入而面临重新定义。

ARC系列测试由深度学习专家弗朗索瓦·肖莱创立,其第三代测试突破传统静态图像推理模式,将AI置于包含千余个关卡的动态游戏环境中。测试要求系统通过观察画面、执行动作、观察结果循环,自主发现隐藏规则并完成通关。这种设计被认为更接近人类认知世界的真实过程,需要同时具备探索、建模、目标设定和规划执行四大能力。

OpenAI团队通过引入Provider Adapter技术,使同一模型在标准框架下62.7%的得分飙升至99.9%。这种上下文管理适配器能保留模型推理状态,使其更高效地调用外部工具。无独有偶,Claude Opus模型在更换测试框架后,成绩也从30%跃升至95.5%,英伟达AVO系统甚至在公开演示中取得满分。这些案例引发学界对评测公平性的激烈讨论,焦点从模型能力转向测试框架的设计合理性。

面对基准测试的"饱和"现象,肖莱团队宣布加速推进后续版本开发。计划于明年第一季度发布的ARC-AGI-4将延长测试时间尺度,着重考察持续学习和知识迁移能力。每个游戏关卡数量将大幅增加,且后续关卡必须复用前期习得的知识。更引人注目的是,被称作"人类终极考卷"的ARC-AGI-5已进入实质研发阶段,其核心将围绕"开放式发明"能力展开。

新测试的设计面临根本性挑战:传统基准依赖"存在正确答案"的前提,而发明创造本质上是创造新答案的过程。研发团队正探索将智能定义为"获取新技能的效率",通过衡量AI创造的工具或规则能否提升后续问题解决速度来量化发明能力。例如GPT-6 Astra在测试中已展现出初步迹象,其通过创造速记符号系统将解题步数减少51.7%。

这场评测革命折射出AI发展的深层矛盾。当现有测试体系被快速突破,人类不得不持续寻找更具挑战性的评估方式。ARC系列测试可能在第6代或第7代后终结,肖莱曾表示,当人类无法提出"AI不能做而人类能做"的任务时,即意味着AGI时代的到来。随着AI系统在发明创造领域展开角逐,评测标准与AI能力的军备竞赛正进入未知领域,这场竞赛的终点或许将重新定义人类对智能的认知边界。

反对 0
举报 0
收藏 0
打赏 0
评论 0
赛富时CEO贝尼奥夫呼吁:AI发展需兼顾安全伦理,科技巨头应担公共责任
赛富时CEO贝尼奥夫呼吁:AI发展需兼顾安全伦理,科技巨头应担公共责任

0评论2026-09-162712

华为高层谈AI时代布局:聚焦ICT与计算,以创新“扬长避短”谋发展
华为高层谈AI时代布局:聚焦ICT与计算,以创新“扬长避短”谋发展

0评论2026-09-162942

突发,GPT-6 Sol曝光了!
突发,GPT-6 Sol曝光了!

0评论2026-09-162706

又一领域全球领先:国产MCV模式全球首次实现5公里分辨率
又一领域全球领先:国产MCV模式全球首次实现5公里分辨率

0评论2026-09-162552

vivo全球用户已接近6亿 蓝心四款核心模型亮相
vivo全球用户已接近6亿 蓝心四款核心模型亮相

0评论2026-09-161271

豆包大模型Doubao-Seed-2.1-pro 0915版升级:多模态强化成本再降
豆包大模型Doubao-Seed-2.1-pro 0915版升级:多模态强化成本再降

0评论2026-09-161491

对话蚂蚁灵波朱兴:机器人落地仍存挑战,何时能真正“替班”成焦点
对话蚂蚁灵波朱兴:机器人落地仍存挑战,何时能真正“替班”成焦点

0评论2026-09-162543

OpenAI CFO:AI时代“智力”成商品,人类“判断力”成核心资产
OpenAI CFO:AI时代“智力”成商品,人类“判断力”成核心资产

0评论2026-09-122403

全链路数智赋能 岚图汽车凭供应链智能平台斩获2026人工智能应用大赛二等奖
全链路数智赋能 岚图汽车凭供应链智能平台斩获2026人工智能应用大赛二等奖

0评论2026-09-121603

浦江创新论坛上,千觉机器人多维触觉技术解锁真实交互新场景
浦江创新论坛上,千觉机器人多维触觉技术解锁真实交互新场景

0评论2026-09-121290