在编码评估中区分信号与噪声
OpenAI新分析揭示流行编码基准SWE-Bench Pro的问题,引发对AI模型评估可靠性与准确性的担忧。
中文处理结果
OpenAI的一项新分析揭示了流行编码基准SWE-Bench Pro中的问题,引发了对评估AI模型可靠性和准确性的担忧。
原始正文摘录
Separating signal from noise in coding evaluations
A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.