Open AI riktar skarp kritik mot det populära programmeringsriktmärket SWE-Bench Pro efter en granskning. Enligt företaget är omkring 30 procent av testuppgifterna trasiga eller bristfälligt utformade, vilket riskerar att ge en missvisande bild av hur bra AI-modeller faktiskt är på mjukvaruutveckling.
Granskningen omfattade både AI-assisterade analyser och manuella bedömningar från erfarna programmerare. Totalt identifierades problem i mellan 27 och 34 procent av de 731 offentliga testuppgifterna.
Som följd väljer Open AI nu att dra tillbaka sin tidigare rekommendation att använda SWE-Bench Pro som standard för att utvärdera AI-modeller. Istället efterlyser Open AI nya riktmärken.
SWE-Bench Pro har själva inte kommenterat det hela.
