从 SWE-bench 到 SWE-Explore:Coding Agent 评测开始拆解过程了

从 SWE-bench 到 SWE-Explore:Coding Agent 评测开始拆解过程了

6分钟 ·
播放数35
·
评论数0

我们常用“这个 Bug 修好了没”来评价 Coding Agent,但这篇论文提醒我们:修代码之前,还有一个更基础的问题,Agent 到底有没有找到该看的代码?SWE-Explore 把代码库探索单独拆出来评测,让 Agent 在固定行数预算内返回最相关的代码区域。结果显示,现代 Agent 已经比较会找到相关文件,但真正拉开差距的是能不能定位到关键代码行,并把有限上下文用得足够高效。

  • 这篇论文把 coding agent 的能力拆开了:不是只看最终 patch 是否通过测试,而是专门测“探索代码库”的能力。

  • 数据集覆盖 848 个 issue、203 个开源仓库、10 种编程语言,任务是返回排序后的相关代码区域。

  • 它用成功修复 issue 的 agent 轨迹来构造 line-level ground truth,也就是“成功路径里真正看过哪些关键代码”。

  • 一个很适合讲的发现:现代方法的文件级定位已经不错,但行级覆盖、排序和上下文效率仍然是短板。

  • 这对做 coding agent 很有启发:提升修复率不一定只靠更强模型,也可能要先提升检索、导航和上下文选择。