分享好友 资讯首页 频道列表

MirrorCode榜单揭晓:Claude Fable 5登顶,AI编程迈向“项目级委托”新阶段

2026-08-05 21:2022680

在最新发布的MirrorCode编程能力排行榜上,AI模型Claude Fable 5以64%的绝对成功率再次占据榜首位置,将竞争对手远远甩在身后。紧随其后的GPT-5.6 Sol仅获得21%的成绩,仅为Claude的三分之一。更令人惊讶的是,排名第四的GPT-5.5表现更为惨淡,成功率仅为10%,甚至不及自家上一代模型GPT-5.4。

MirrorCode测试环境极为严苛,模型需要在完全隔离的条件下完成编程任务,无法访问互联网、查看原始代码或使用第三方依赖库。测试涵盖25个不同领域的目标程序,包括Unix工具、解释器、数据查询、生物信息学、密码学和压缩工具等。每个目标程序使用两种编程语言实现,每种语言运行三次,且必须同时通过可见测试和隐藏测试才能算作成功,任何细微的错误都会导致任务失败。

在如此严格的测试标准下,Claude Fable 5的表现尤为亮眼。当使用资源消耗较高的Go语言时,其解出率达到64%;而当换成相对冷门的Ada语言时,成绩仅略微下降至61%。考虑到开源生态中Python语料库规模是Ada的230倍,这一成绩差异显得格外突出。这表明Fable 5已不再单纯依赖对热门语言语法的记忆,而是真正掌握了从零构建完整软件项目的能力。

测试过程中,模型需要不断向原始程序输入数据,观察输出结果以推断内部逻辑,然后逐步编写出行为一致的新程序。这个过程更像是持续数天的调试工作,而非简单的代码生成。例如在处理生物信息学工具gotree时,Claude Opus 4.7虽然以99.95%的完成度通过了2000项测试,但因遗漏了一个处理日期注释的特殊情况而未能达标。尽管如此,它仍将原本需要数周完成的工作压缩至十几个小时,效率提升显著。

其他模型在语言切换测试中表现明显下滑。GPT-5.6 Sol的成绩从24%降至19%,GPT-5.4从21%降至12%,而GPT-5.5更是从17%暴跌至5%。这种差距凸显出Claude Fable 5在跨语言编程能力上的独特优势。该模型似乎能够先理解原始程序的工作原理,再使用不同语言重新实现相同功能,而非简单的代码翻译。

当前AI编程领域正经历重大变革。Cursor已实现数百个智能体协作一周,从零编写出超过100万行代码的浏览器项目;Anthropic则通过16个Claude智能体并行工作,构建出能够编译Linux内核的C编译器;OpenAI的数据显示,70%以上的Codex用户曾提交过需要人类工作一小时以上的任务,25%的用户提交过超过八小时的工作量。这些案例表明,人们交给AI的任务单位正在从代码片段转向完整项目。

MirrorCode榜单的64%成功率,正是对这种"项目级委托"能力的量化证明。只要目标明确且结果可自动验证,前沿AI模型已经能够独立完成部分中大型软件项目。这种转变意味着,未来开发者的工作模式将从逐行编写代码转变为在关键节点把控方向,代码本身的成本将持续降低,而能够清晰定义问题和验证结果的专业人才将变得更加稀缺。

反对 0
举报 0
收藏 0
打赏 0
评论 0
OpenAI宣布GPT-5.5模型10月14日下线 用户需尽快切换至替代模型
OpenAI宣布GPT-5.5模型10月14日下线 用户需尽快切换至替代模型

0评论2026-09-162409

优必选超级工厂投产:人形机器人量产启幕,中国智造再攀新高峰
优必选超级工厂投产:人形机器人量产启幕,中国智造再攀新高峰

0评论2026-09-162251

云知声U2-Flash实测:快速完成Agent搭建与大型滑梯建模,表现亮眼
云知声U2-Flash实测:快速完成Agent搭建与大型滑梯建模,表现亮眼

0评论2026-09-161714

GPT-6 Sol即将发布:性能逼近旗舰却成本更低,AI进化再提速
GPT-6 Sol即将发布:性能逼近旗舰却成本更低,AI进化再提速

0评论2026-09-162685

国产MCV模式全球领跑:5公里分辨率10天预报1小时内完成,异构计算显实力
国产MCV模式全球领跑:5公里分辨率10天预报1小时内完成,异构计算显实力

0评论2026-09-16955

从厨房到餐桌的革新:AI手机芯片如何让智能体验“热气腾腾”?
从厨房到餐桌的革新:AI手机芯片如何让智能体验“热气腾腾”?

0评论2026-09-162792

云知声U2-Flash实测:快速构建Agent与3D建模,展现高效生产力新范式
云知声U2-Flash实测:快速构建Agent与3D建模,展现高效生产力新范式

0评论2026-09-162916

魔芯科技新一轮融资或达10亿元,估值近100亿元
魔芯科技新一轮融资或达10亿元,估值近100亿元

0评论2026-09-12655

DeepSeek开启灰度测试:AI语音对话功能上线,四种音色任你选
DeepSeek开启灰度测试:AI语音对话功能上线,四种音色任你选

0评论2026-09-122832

AI赋能具身智能:机器人“真干活” 解锁生产生活高危场景新图景
AI赋能具身智能:机器人“真干活” 解锁生产生活高危场景新图景

0评论2026-09-122310