SWE-bench Verified被曝数据污染

OpenAIAI新闻AI工具ChatGPT充值
SWE-bench Verified被曝数据污染

发生了什么

最近,OpenAI 对广泛使用的编码基准测试 SWE-bench Verified 进行了深入分析,结果令人大跌眼镜。这个原本被用来衡量 AI 编程能力的重要标尺,竟然存在严重的数据污染问题。简单来说,测试用的数据和用来训练模型的数据混在了一起,导致测试结果根本不靠谱,无法真实反映前沿的编码进展。

核心变化解读

这次分析的核心发现主要集中在两点:有缺陷的测试用例和训练数据泄露。首先,部分测试用例本身就有问题,这让模型即使没有真正理解代码,也能靠“猜”通过测试。其次,更严重的是训练数据泄露。很多测试题目的答案其实已经包含在模型的训练数据里了,这就像考试前把答案发给了学生,考出来的高分自然没有任何参考价值。

正因为这些问题,SWE-bench Verified 已经失去了作为权威基准的公信力。为了解决这个问题,原作者明确推荐大家转而使用 SWE-bench Pro。这个新版本专门针对上述漏洞进行了修复,能够更严格、更公平地评估 AI 模型的真实编程水平。对于关注 AI 技术发展的我们来说,这意味着以后在看各种模型的“跑分”时,得擦亮眼睛,看看它们用的是哪个基准,别被虚高的数字给忽悠了。

对国内用户的影响

对于我们国内的开发者和 AI 爱好者来说,这个消息其实挺重要的。很多人在评估国内模型或选择工具时,往往会参考这些国际基准的分数。现在既然旧基准“注水”了,那些基于 SWE-bench Verified 的宣传成绩就要打个大大的问号。如果你正在使用 ChatGPT 的 Plus 或 Pro 套餐辅助编程,或者打算尝试其他具备代码能力的模型,建议多关注它们在 SWE-bench Pro 上的表现。这才是衡量代码实力的“硬通货”。

你需要做什么

面对基准测试的更迭,我们最该做的是更新自己的认知坐标系。以后看到模型宣传编程能力时,优先确认其是否通过了 SWE-bench Pro 的验证。如果你需要升级手中的 AI 工具,获取更强的代码辅助能力,欢迎前往 ChatGPT 充值中心 了解最新套餐详情,确保你使用的工具是基于最新、最严苛标准检验过的强者。

需要充值 ChatGPT?
2分钟到账 · 支付宝/微信支付 · 自动发货
立即充值 →

📚 相关阅读

❓ 常见问题

为什么SWE-bench Verified不再可靠?
因为分析发现它存在训练数据泄露和测试用例缺陷,导致模型可能“看过”答案,无法真实衡量编程能力。
应该使用哪个基准来测试AI编程能力?
作者推荐使用SWE-bench Pro,它修复了数据污染问题,能更准确地反映前沿模型的编码水平。