Vault 资讯瀑布官方2026.07.08 21:00 UTC+8

在编码评估中区分信号与噪声

OpenAI新分析揭示流行编码基准SWE-Bench Pro的问题,引发对AI模型评估可靠性与准确性的担忧。

OpenAI的一项新分析揭示了流行编码基准SWE-Bench Pro中的问题,引发了对评估AI模型可靠性和准确性的担忧。

Separating signal from noise in coding evaluations

A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.

查看原始发布
在编码评估中区分信号与噪声 — Vault2077