走进学院
学院资讯
科研动态
学生培养

科研Xᴬᴵ大模型系列 | 北京中关村学院RepoNavigator:32B智能体逆袭GPT-5

日期: 2026-06-09

“大模型”是北京中关村学院AI核心学部的重点板块,团队长期关注大模型智能体、长程任务执行、工具使用、强化学习、自主进化等前沿方向。本篇介绍团队在仓库级代码智能体上的最新进展:RepoNavigator。更多成果将陆续发布。

近日,北京中关村学院AI核心学部联合北京大学、百度等单位,在大模型智能体与软件工程交叉方向取得新进展。相关论文《One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents》已发布于arXiv,并被ICML 2026收录。

论文提出了一种面向真实代码仓库的智能体方法RepoNavigator。不同于以往依赖多个检索、搜索、结构分析工具的复杂智能体系统,RepoNavigator只为大模型配备一个核心工具:jump,即跳转到符号定义位置。在此基础上,团队通过强化学习直接训练大模型,使其学会像程序员使用 IDE 一样,在大型代码仓库中沿着代码调用关系进行导航,定位与软件问题相关的文件和函数。这一工作表明:在仓库级代码理解任务中,工具不一定越多越好一个与代码执行逻辑高度对齐的工具,配合强化学习训练,反而可以带来更高的效率、更强的可控性和更好的泛化能力。

微信图片_2026-06-11_201454_329.png图1|RepoNavigator将仓库级问题定位从“关键词检索”转向“沿代码结构导航”

从“搜索代码”到“沿执行逻辑导航代码”

随着大语言模型能力的快速提升,LLM Agent已成为软件工程自动化的重要方向。当前,智能体已经能够调用终端、编辑器、搜索工具和测试工具,尝试自动完成代码修复、Bug定位、功能开发等任务。但在真实软件仓库中,问题远比单文件编程复杂。一个GitHub Issue往往涉及成千上万个文件、复杂的模块依赖、多层函数调用和跨文件符号引用。由于上下文窗口有限,大模型无法一次性读完整个仓库,必须通过工具不断获取局部信息,再逐步推理。

现有方法通常将仓库级问题定位看作一个检索任务:给智能体提供多个工具,例如搜索类、搜索函数、查看导入关系、检索字符串等,让模型在大量工具之间选择和组合。然而,这种设计也带来两个问题:

• 第一,工具越多,智能体需要学习的接口越复杂,错误调用和无效调用更容易发生;

• 第二,许多检索工具并不真正反映代码执行过程,容易让模型停留在“关键词搜索”层面,而不是理解程序实际如何运行。

RepoNavigator的核心思想是:与其给智能体很多碎片化工具,不如给它一个足够基础、足够结构化、足够贴近程序执行逻辑的工具。

一个工具:jumpRepoNavigator

使用的唯一工具是jump:给定一个文件中的符号,工具会通过语言服务器定位该符号的定义位置。

这看似简单,却对应程序员日常阅读大型代码库时最常用的操作之一:在IDE中点击“跳转到定义”。当开发者阅读一段代码时,如果遇到未知函数、类、变量或方法,通常不会盲目全文搜索,而是沿着调用关系逐层跳转,查看它们的真实定义和实现。

RepoNavigator将这一过程转化为智能体可学习的交互动作。模型在每一步可以进行自然语言推理,也可以调用jump工具获取新的代码片段;经过多轮“思考—行动—观察”,最终输出与问题相关的文件和函数位置。这种设计有三个优势:

• 更贴近代码执行逻辑:jump本质上是在追踪符号绑定、函数调用、类方法、模块导入等结构关系,比单纯关键词检索更接近程序真实运行方式。

• 更小的动作空间:智能体只需要学习一个工具的调用方式,避免在多个工具之间反复选择和组合,从而降低训练难度和错误传播。

• 更强的可控性和可训练性:统一工具接口使得强化学习更容易优化长程工具调用行为,模型能够逐步学会何时跳转、跳转到哪里、何时停止探索。

微信图片_2026-06-11_201549_626.png图2|方法总览:智能体只使用jump工具,在多轮交互中定位与Issue相关的文件和函数

直接用强化学习训练仓库级智能体

在软件工程任务中,直接训练一个智能体修复代码非常困难。因为同一个Bug可能有多种正确修复方式,必须运行测试或构建Docker环境才能判断补丁是否有效,训练成本很高。RepoNavigator 选择了一个更可扩展、更可验证的中间任务:Issue Localization,即问题定位。也就是说,模型不直接生成补丁,而是先判断:为了解决这个Issue,哪些文件、哪些函数最可能需要修改。已有研究表明,一旦相关位置被准确定位,后续代码修复会变得显著更容易。

更重要的是,定位任务的输出是文件路径和函数名,可以通过字符串匹配或集合指标进行评估,因此适合用于大规模强化学习训练。在训练上,RepoNavigator采用基于可验证奖励的强化学习方法GRPO。奖励不仅考虑最终定位结果是否准确,还考虑工具调用是否成功。这样,模型不仅要学会“猜对答案”,还要学会稳定、正确地使用jump工具进行多步探索。

值得注意的是,RepoNavigator不依赖闭源大模型蒸馏,而是直接从开源预训练模型出发,通过强化学习训练获得仓库级导航能力。这一点对于构建自主可控的大模型智能体具有重要意义。

微信图片_2026-06-11_201634_633.png图3|训练策略:以Issue Localization为可验证任务,通过GRPO强化学习优化工具调用轨迹

实验结果:7B超越14B,32B超越闭源模型

论文在SWE-bench Verified 和 SWE-bench Pro等真实软件工程基准上进行了系统实验。结果显示,RepoNavigator在函数级和文件级定位指标上均取得了领先表现。尤其是在强化学习训练后:

• 7B模型超过了多种14B基线方法

• 14B模型超过了多种32B基线方法

• 32B模型在多数核心指标上超过GPT-5的结果,并达到仓库级代码定位任务的前沿水平

微信图片_2026-06-11_201704_522.png图4|实验结果:RepoNavigator在不同模型规模下持续提升,说明“一个高质量工具 + 强化学习”具有良好的扩展性

在SWE-bench Verified上,基于Qwen2.5-32B的RepoNavigator经过GRPO训练后,在函数级 IoU、文件级Sample-F1、文件级IoU等核心指标上均显著优于同规模基线。

在更具泛化检验意义的SWE-bench Pro Python 子集上,RepoNavigator同样保持稳定优势。由于SWE-bench Pro发布晚于Qwen2.5系列模型,这也进一步说明RepoNavigator的提升并非简单来自数据记忆,而是来自更有效的工具设计和强化学习训练。

此外,团队还将RepoNavigator的定位结果接入下游代码修复流程。实验表明,更好的定位能力能够进一步提升Issue解决率,说明RepoNavigator不只是指标上更好,也能真正帮助软件工程智能体完成后续修复任务。

为什么“一个工具”反而更强?

论文进一步分析了RepoNavigator成功的原因。传统观点往往认为,给智能体更多工具,就能让它完成更多任务。但在长程智能体系统中,工具数量增加也会带来额外负担:模型需要理解更多接口、选择更多动作、处理更多无关信息,任何一步调用失败都可能影响最终结果。

RepoNavigator 提出了一种相反的思路:减少工具数量,但提高工具质量。jump工具虽然单一,却具有很强的结构表达能力。它能让智能体沿着代码依赖关系逐步扩展视野,而不是在整个仓库中盲目搜索。相比之下,多个碎片化搜索工具虽然覆盖范围更大,但也更容易把模型引向无关区域。

论文中的消融实验也验证了这一点:当在 RepoNavigator中加入更多传统检索工具时,性能并没有提升,反而下降。这说明对于仓库级智能体而言,关键不是堆叠工具,而是设计与任务结构高度匹配、能被模型稳定掌握的工具环境。这一结论对未来智能体系统设计具有启发意义:智能体能力的提升,不只来自更大的模型,也来自更好的工具抽象、更清晰的交互环境和更有效的强化学习训练。

面向真实软件工程的可训练智能体

RepoNavigator的研究意义不止于代码定位本身。在更广泛的大模型智能体研究中,如何让模型真正学会使用工具、在复杂环境中执行长程任务,是当前领域的核心问题之一。许多智能体系统依赖提示词工程或闭源模型蒸馏,虽然能在部分任务上取得效果,但难以形成可扩展、可复现、可自主优化的训练范式。

RepoNavigator展示了一条更简洁的路径:为任务设计一个结构化、可验证、贴近真实操作逻辑的工具环境,再通过强化学习让模型在环境中自主试错和优化。这种范式有望推广到更多智能体场景,例如软件维护、代码审查、知识库导航、复杂文档理解、科研工作流自动化等。其核心思想是:不是让模型被动模仿人类轨迹,而是让模型在可验证环境中学习如何行动。

持续探索Agent自主进化与软件智能

北京中关村学院人工智能核心方向团队长期关注大模型智能体、长程任务执行、工具使用、强化学习、自主进化等前沿方向。RepoNavigator是团队在“面向真实复杂环境的可训练Agent”方向上的重要探索之一。未来,团队将继续围绕软件工程智能体、Agent强化学习、工具环境设计和长程任务可靠执行展开研究,推动大模型从“会生成答案”走向“会使用工具、会执行任务、会持续改进”的新阶段。

论文链接:https://arxiv.org/abs/2512.20957

 

作者团队及合作单位

本文第一作者为北京大学计算机学院硕士生张兆熙,相关工作完成于其在北京中关村学院x中关村人工智能研究院(简称“中关村两院”)实习期间;通讯作者为中关村两院研究员段易通、北京大学计算机学院副教授吴云芳。

本项目依托中关村两院AI模型方向开展。该方向聚焦大语言模型与智能体前沿研究,探索智能从语言理解、工具使用、环境交互到自主进化的核心机制,推动模型能力从通用智能迈向超级智能。

Agent自主实现千款软件智能化适配:中关村两院“超级软件智能”完成阶段性验证
AutoSOTA Live @CVPR 2026:当自主AI科研系统遇上顶会