跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
前沿哨所

0%完成率!Meta发布新基准ProgramBench,揭露AI只会写代码不懂做工程

1 分钟阅读阅读(182)
赞助推荐 团队协作里的 AI 办公工作台

Meta FAIR联合斯坦福等机构发布了全新编程基准ProgramBench,旨在重新定义AI编程评估方式,考核模型是否具备从零构建真实软件系统的“工程智能”。不同于传统的补全函数或修复Bug,该测试要求模型仅依据文档重建ffmpeg、SQLite等知名软件。结果显示,所有主流AI模型的完成率均为0%。尽管Claude Opus系列表现相对较好,但模型普遍倾向于生成臃肿的单文件代码,缺乏人类工程师的模块化架构能力。这项研究表明,AI在代码生成上虽有突破,但跨越代码与真实软件工程之间的鸿沟仍需时日。

原文链接:Linux.do

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 0%完成率!Meta发布新基准ProgramBench,揭露AI只会写代码不懂做工程
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型