觉
AI觉醒星球
Awakening is here
Knowledge File / AI技能杠杆
2026-06-14 3 浏览 免费阅读

趋势解读:AI coding agents find the right file but,讨论数据集与基础模型

新基准SWE-Explore揭示了AI编码代理在精确代码行定位上的弱点,代理在文件级表现良好,但行覆盖率仅14-19%,更强模型无法改善,而研究系统CoSIL通过代码网络扫描显著提升性能。

SOURCE / AI技能杠杆 MIN / 9 ACCESS / 免费阅读 POST / 2026-06-14 16:54:47

原贴

查看原文
作者:Jonathan Kemper 来源站点:the-decoder.com 原贴时间:

原文

A new benchmark separates code search from the actual fix and exposes a hidden weakness of AI coding agents. They land in the right neighborhood but miss the crucial spots. Until now, AI coding has mostly been judged by the result. Did the agent fix the bug or not? That single metric hides what actually went wrong. Maybe the agent never read the relevant code. Maybe it saw the correct file and still wrote the wrong patch. Either way, the outcome looks the same. An international research team involving Shanghai Jiao Tong University is tackling this blind spot with SWE-Explore. The benchmark only evaluates the first phase of the process. An agent receives a bug description and a software project, then returns a ranked list of code sections it considers relevant. Figuring out which sections truly matter is nearly impossible to do by hand. So the team takes a different approach. For each of the 848 problems in the dataset, at least two successful solution attempts exist from powerful models like GPT-5.4, Gemini 3 Pro, Claude Sonnet 4.6, or Kimi K2.6. From these runs, the researchers extract which files and lines the AI actually examined before fixing the bug. Passages that multiple independent solution paths converge on count as a signal of useful context. They're not strictly required, but strongly indicated. A separate verification step fills in individual key passages, and the team then manually reviews each region again. The dataset draws from 203 open-source projects across ten programming languages. Python dominates with 547 of 848 tasks, followed by Go, JavaScript, and Rust. The comparison pits traditional search methods against five general-purpose coding agents, including Claude Code, Codex, and OpenHands, along with four research systems built specifically for code search. Old-school keyword search barely beats chance. In a case study, the authors show why. A bug description like "RuntimeWarning on Overflow" contains terms that show up far more often in a project's templates and docs than in the actual source code. AI agents pull ahead clearly because they search the project step by step instead of sorting all hits at once. At the file level, the agents do fine. They find the right source file, rank it early, and keep the selection tight. But the moment the test zooms in to individual lines of code, the system falls apart. General coding agents cover only 14 to 19 percent of the lines that actually matter. Throwing a stronger language model at the problem doesn't fix it. The team ran the same agent with six different models from OpenAI, Anthropic, Google, Moonshot, and Zhipu. The GPT family leads, but the pattern holds. File hit rates stay consistently higher than actual line coverage. The various agent architectures land strikingly close to each other. Claude Code, Codex, OpenHands, Mini-SWE-Agent, and AweAgent post nearly identical scores across every metric. The CoSIL research system is the outlier. It scans code as a network of interconnected building blocks and achieves much higher line coverage. Among the specialized localization systems, AutoCodeRover works precisely but stays conservative, while OrcaLoca produces little noise but misses many relevant spots.

中文翻译

一个新的基准将代码搜索与实际修复分离开来,揭示了AI编码代理的一个隐藏弱点。它们能到达正确的区域,但错过了关键点。到目前为止,AI编码大多根据结果来评判。代理是否修复了Bug?这个单一指标掩盖了实际出错的地方。也许代理从未读取相关代码。也许它看到了正确的文件,但仍然写了错误的补丁。无论哪种方式,结果看起来都一样。一个包括上海交通大学在内的国际研究团队正在用SWE-Explore解决这个盲点。该基准只评估过程的第一阶段。代理收到一个Bug描述和一个软件项目,然后返回一个它认为相关的代码段排序列表。手动确定哪些段真正重要几乎是不可能的。因此,团队采取了不同的方法。对于数据集中848个问题中的每一个,至少存在两个来自GPT-5.4、Gemini 3 Pro、Claude Sonnet 4.6或Kimi K2.6等强大模型的成功解决方案。从这些运行中,研究人员提取了AI在修复Bug之前实际检查过的文件和行。多个独立解决方案路径汇聚的段落被视为有用上下文的信号。它们不是严格必需的,但被强烈指示。单独的验证步骤填充了个别关键段落,然后团队手动再次检查每个区域。该数据集来自十个编程语言的203个开源项目。Python在848个任务中占547个,其次是Go、JavaScript和Rust。比较将传统搜索方法与五个通用编码代理(包括Claude Code、Codex和OpenHands)以及四个专门为代码搜索构建的研究系统进行对比。老式的关键词搜索几乎不比随机好。在一个案例研究中,作者展示了原因。像"RuntimeWarning on Overflow"这样的Bug描述包含的术语在项目的模板和文档中出现的频率远高于实际源代码。AI代理明显领先,因为它们逐步搜索项目,而不是一次性对所有结果排序。在文件级别,代理表现不错。它们找到正确的源文件,早期排序,并保持选择紧凑。但当测试深入到单个代码行时,系统崩溃了。通用编码代理只覆盖了实际重要行的14%到19%。使用更强的语言模型并不能解决问题。团队用来自OpenAI、Anthropic、Google、Moonshot和Zhipu的六个不同模型运行了同一个代理。GPT系列领先,但模式保持不变。文件命中率始终高于实际行覆盖率。各种代理架构的得分惊人地接近。Claude Code、Codex、OpenHands、Mini-SWE-Agent和AweAgent在每个指标上几乎都得到相同的分数。CoSIL研究系统是例外。它将代码扫描为互连构建块的网络,并实现了更高的行覆盖率。在专门的定位系统中,AutoCodeRover工作精确但保持保守,而OrcaLoca产生很少的噪声但错过了许多相关位置。

核心信息

新基准SWE-Explore揭示了AI编码代理在精确代码行定位上的弱点,代理在文件级表现良好,但行覆盖率仅14-19%,更强模型无法改善,而研究系统CoSIL通过代码网络扫描显著提升性能。

  • 新基准SWE-Explore分离代码搜索与修复,揭示AI编码代理在行级定位上的短板。
  • 代理文件命中率高,但关键行覆盖率仅14-19%,更强模型无法显著改善。
  • 不同代理架构得分接近,表明当前编码代理策略已局部收敛。
  • CoSIL通过代码网络扫描大幅提升行覆盖率,提供新设计思路。
  • 传统关键词搜索几乎无效,AI代理逐步搜索优势明显但仍有瓶颈。

详细解读

这是什么信号

AI编码代理在软件工程中的应用正从“能否修复Bug”的粗略评估转向精细的过程诊断。新基准SWE-Explore将代码搜索与修复分离,暴露了代理在精准代码行定位上的短板——它们能找对文件(命中率较高),但具体到关键行时覆盖率仅14-19%。这意味着当前AI代理更像“半成品工具”:能大致定位问题区域,但无法精确捕捉问题根源。

为什么重要

这一发现直接挑战了“更强模型即更好”的直觉。研究显示,无论使用GPT-4o、Claude还是Gemini,通用编码代理的行覆盖率提升有限,说明瓶颈不在于语言模型本身,而在于代理的搜索策略与代码理解架构。同时,传统关键词搜索几近无效,表明AI代理的渐进式搜索路径是其仅有的优势。此外,不同代理(如Claude Code、Codex)得分惊人接近,暗示当前架构可能已收敛至局部最优。

对谁有价值

对开发者:需意识到AI辅助编码工具当前更适合作为“文件级导航器”而非“行级调试师”,使用时仍需人工核实具体代码。对AI Agent开发者:应学习CoSIL将代码视为网络而非平铺文本的思路,或研究多步推理与上下文聚合机制。对AI创业公司:精确定位能力是差异化机会——开发专注于代码精准定位的专用工具或插件,可填补市场空白。

可以怎么行动

1. 在工程实践中,将AI编码代理用于快速找到相关文件的范围,但手动审查关键行。2. 对代理进行针对性训练:在训练数据中增加高精度行级标注,或设计奖励函数优化行覆盖率。3. 工具集成:在IDE中结合传统搜索与AI代理,例如先由AI定位文件,再用正则或静态分析精确定位行。

风险或限制

数据集基于开源项目(Python为主),对封闭商业软件或其他语言(如C++)的泛化性待验证。基准仅评估单阶段“搜索”,未考虑多轮交互或动态修复过程。此外,手动验证步骤可能引入人为偏差。这些因素限制了结论的绝对可靠性。

信息差价值

信息差价值:多数开发者与团队仅用“能否修Bug”评估AI编码工具,忽略了过程缺陷。本文揭示的代理行级定位短板是行业内尚未广泛认知的弱点,掌握此信息可避免盲目依赖AI工具,并为工具选型提供新维度——优先评估行覆盖率而非最终修复率。

业务启发:对AI工具厂商,可开发专注“精准代码上下文推荐”的中间层产品,提升代理精确定位能力。对软件公司,可调整开发流程:将AI代理定位为“初筛器”,人工做精细排查,提高整体效率。对培训领域,可设计专门训练任务增强代理对代码语义网络的理解。

可沉淀动作:1. 在团队中建立AI编码代理的能力评估标准,包含文件命中率与行覆盖率。2. 尝试集成类似CoSIL的代码网络分析机制到现有代理流程中。3. 定期跟踪SWE-Explore等基准更新,持续优化工具链。

参考来源

AI SUMMARY

这篇文章回答了什么

趋势解读:AI coding agents find the right file but,讨论数据集与基础模型主要讲什么?

新基准SWE-Explore揭示了AI编码代理在精确代码行定位上的弱点,代理在文件级表现良好,但行覆盖率仅14-19%,更强模型无法改善,而研究系统CoSIL通过代码网络扫描显著提升性能。

这篇文章最值得关注的要点是什么?

新基准SWE-Explore揭示了AI编码代理在精确代码行定位上的弱点,代理在文件级表现良好,但行覆盖率仅14-19%,更强模型无法改善,而研究系统CoSIL通过代码网络扫描显著提升性能。;新基准SWE-Explore分离代码搜索与修复,揭示AI编码代理在行级定位上的短板。;代理文件命中率高,但关键行覆盖率仅14-19%,更强模型无法显著改善。;不同代理架构得分接近,表明当前编码代理策略已局部收敛。

这篇文章和哪些AI专题相关?

它适合放在Agent工作流、AI工具、AI超级个体专题里阅读。 关联原因:这篇内容命中「Agent、工作流」等主题信号。;这篇内容命中「自动化、模型」等主题信号。;这篇内容命中「技能」等主题信号。

阅读这篇文章建议先理解哪些关键词?

建议先理解AI工具、工具、自动化、模型、Cursor这些关键词,再结合正文判断工具、机会或风险是否值得进入自己的工作流。

上一篇 趋势解读:KPMG fabricated AI case studies in a report,解读最新 AI 进展 下一篇 趋势解读:Microsoft CEO Satya Nadella admits he's a token-maxer,,提升开发者接入体验
北竹游乐场 免费玩小游戏 免费玩