OpenAI 这个造假问题有点严重啊
除了那个很离谱的 52.8>69.1 的问题
有人发现他们的 SWE-bench 少跑了23道题
如果算上这部分,其实 GPT5 还不如 Claude 4 sonnet
那为什么不跑这23道题呢?
 
 
Back to Top