esports

Open AI anklagar populär AI-mätning för att innehålla omfattande fel

Open AI riktar skarp kritik mot det populära programmeringsriktmärket SWE-Bench Pro efter en granskning. Enligt företaget är omkring 30 procent av testuppgifterna trasiga eller bristfälligt utformade, vilket riskerar att ge en missvisande bild av hur bra AI-modeller faktiskt är på mjukvaruutveckling.

Granskningen omfattade både AI-assisterade analyser och manuella bedömningar från erfarna programmerare. Totalt identifierades problem i mellan 27 och 34 procent av de 731 offentliga testuppgifterna.

Som följd väljer Open AI nu att dra tillbaka sin tidigare rekommendation att använda SWE-Bench Pro som standard för att utvärdera AI-modeller. Istället efterlyser Open AI nya riktmärken.

SWE-Bench Pro har själva inte kommenterat det hela.

Originalquelle: www.idg.se →