SWE-bench Verified被曝數據污染

OpenAIAI新聞AI工具ChatGPT儲值
SWE-bench Verified被曝數據污染

發生了什麼

最近,OpenAI 對廣泛使用的編碼基準測試 SWE-bench Verified 進行了深入分析,結果令人大跌眼鏡。這個原本被用來衡量 AI 編程能力的重要標尺,竟然存在嚴重的數據污染問題。簡單來說,測試用的數據和用來訓練模型的數據混在了一起,導致測試結果根本不靠譜,無法真實反映前沿的編碼進展。

核心變化解讀

這次分析的核心發現主要集中在兩點:有缺陷的測試用例和訓練數據泄露。首先,部分測試用例本身就有問題,這讓模型即使沒有真正理解代碼,也能靠“猜”通過測試。其次,更嚴重的是訓練數據泄露。很多測試題目的答案其實已經包含在模型的訓練數據裏了,這就像考試前把答案發給了學生,考出來的高分自然沒有任何參考價值。

正因爲這些問題,SWE-bench Verified 已經失去了作爲權威基準的公信力。爲了解決這個問題,原作者明確推薦大家轉而使用 SWE-bench Pro。這個新版本專門針對上述漏洞進行了修復,能夠更嚴格、更公平地評估 AI 模型的真實編程水平。對於關注 AI 技術發展的我們來說,這意味着以後在看各種模型的“跑分”時,得擦亮眼睛,看看它們用的是哪個基準,別被虛高的數字給忽悠了。

對國內用戶的影響

對於我們國內的開發者和 AI 愛好者來說,這個訊息其實挺重要的。很多人在評估國內模型或選擇工具時,往往會參考這些國際基準的分數。現在既然舊基準“注水”了,那些基於 SWE-bench Verified 的宣傳成績就要打個大大的問號。如果你正在使用 ChatGPT 的 Plus 或 Pro 方案輔助編程,或者打算嘗試其他具備代碼能力的模型,建議多關注它們在 SWE-bench Pro 上的表現。這才是衡量代碼實力的“硬通貨”。

你需要做什麼

面對基準測試的更迭,我們最該做的是更新自己的認知坐標系。以後看到模型宣傳編程能力時,優先確認其是否通過了 SWE-bench Pro 的驗證。如果你需要升級手中的 AI 工具,獲取更強的代碼輔助能力,歡迎前往 ChatGPT 儲值中心 瞭解最新方案詳情,確保你使用的工具是基於最新、最嚴苛標準檢驗過的強者。

需要儲值 ChatGPT?
2分鐘到賬 · 支付寶/微信支付 · 自動發貨
立即儲值 →

📚 相關閱讀

❓ 常見問題

爲什麼SWE-bench Verified不再可靠?
因爲分析發現它存在訓練數據泄露和測試用例缺陷,導致模型可能“看過”答案,無法真實衡量編程能力。
應該使用哪個基準來測試AI編程能力?
作者推薦使用SWE-bench Pro,它修復了數據污染問題,能更準確地反映前沿模型的編碼水平。