发生了什么
最近,OpenAI 对广泛use的编码基准test SWE-bench Verified 进行了深入分析,result令人大跌眼镜。这个原本被用来衡量 AI 编程能力的重要标尺,竟然存在严重的数据污染questions。simple来说,test用的数据 and 用来训练model的数据混在了一起,导致testresult根本不靠谱,无法真实反映前沿的编码进展。
核心变化解读
这次分析的核心发现主要集中在两点:有缺陷的test用例 and 训练数据泄露。首先,部分test用例本身就have questions,这让model即使没有真正理解代码,也能靠“猜”通过test。其次,更严重的是训练数据泄露。很多test题目的答案其实已经包含在model的训练数据里了,这就像考试前把答案发给了学生,考出来的高分自然没有任何参考价值。
正因为这些questions,SWE-bench Verified 已经失去了作为权威基准的公信力。为了解决这个questions,原作者明确recommended大家转而use SWE-bench Pro。这个新版本专门针对上述漏洞进行了修复,能够更严格、更公平地评估 AI model的真实编程水平。对于关注 AI 技术发展的我们来说,这意味着以后在看各种model的“跑分”时,得擦亮眼睛,看看它们用的是哪个基准,别被虚高的数字给忽悠了。
对users in China的影响
对于我们China的developers and AI 爱好者来说,这个消息其实挺重要的。很多人在评估Chinamodel or Choosetools时,往往会参考这些国际基准的分数。现在既然旧基准“注水”了,那些基于 SWE-bench Verified 的宣传成绩就要打个大大的问号。如果你正在use ChatGPT 的 Plus or Pro plan辅助编程, or 者打算尝试Other具备代码能力的model,建议多关注它们在 SWE-bench Pro 上的表现。这才是衡量代码实力的“硬通货”。
你need 做什么
面对基准test的更迭,我们最该做的是更新自己的认知坐标系。以后看到model宣传编程能力时,优先confirm其是否通过了 SWE-bench Pro 的验证。如果你need 升级手中的 AI tools,receive更强的代码辅助能力,欢迎前往 ChatGPT Recharge Center 了解latestplan详情,确保你use的tools是基于latest、最严苛标准检验过的强者。