走进学院
学院资讯
科研动态
学生培养

AutoSOTA @CVPR 2026:让自主AI科研系统与顶会同频共振

日期: 2026-06-20

当自主科研系统实时走进AI顶会

在CVPR 2026期间,北京中关村学院与清华团队开展了一次 AutoSOTA Live @ CVPR 2026大规模实时自主AI研究实验。

我们把 AutoSOTA 放进了一个更接近真实科研环境的场景里:在顶会进行的同时,面向已公开的 CVPR 论文,实时完成论文理解、代码复现、环境配置、性能验证以及后续优化探索。

换句话说,AutoSOTA Live 想回答的问题是:

当一批真实顶会论文同时出现时,AI科研智能体能不能在会议级规模上,持续处理这些论文对应的代码库,并给出可复现、可验证、可公开追踪的研究结果?

这也是它与很多自主科研系统的关键区别。过去,自主科研系统更多是在相对封闭、相对标准化的任务环境中验证能力,例如固定 benchmark、固定代码框架,或者少量精心挑选的实验案例。但真实科研不是这样。真实论文代码库往往依赖复杂、文档不完整、评测协议分散、实验成本高,而且不同论文之间任务、指标和工程结构差异很大。

因此,AutoSOTA Live 更强调系统需要在 CVPR 会议同步进行期间,实时对最新论文开展自主复现和优化分析;系统不是只处理一篇论文,而是在会议级的大规模论文集合上连续运行,接受真实代码库、真实算力预算和真实评测协议的压力测试。这正是 AutoSOTA Live 最核心的定位:

一次面向真实顶会论文的会议级大规模、实时 的AI 自主研究实验。

图3.png

会级规模实时自主AI研究实验

AutoSOTA 对 CVPR 2026 论文进行了系统性的自主复现和优化探索。我们综合原论文是否开源代码仓库以及对原方法在有限资源(2张A100GPU * 5h)下能否完成核心指标复现及优化的预估等条件,从筛选出的150余篇论文中,系统与会议同步地实时刷新超越了73篇论文汇报的模型性能,超过80%的优化模型发现了新颖AI模型设计

这组数字背后,包含的不只是最终性能变化。更重要的是,它意味着 AutoSOTA 已经能够在会议级任务规模下,完成自动理解论文和代码结构 - 识别官方仓库与关键依赖 - 配置环境并建立可运行 baseline - 根据论文指标构建优化目标 - 生成候选改进方案 - 修改代码并运行实验 - 分析失败原因 迭代优化尝试 - 输出可审计的技术报告的这一整套研究执行流程。

这种系统化意味着AutoSOTA越来越接近一种科研基础设施:帮助研究者处理繁琐、重复、但又必须完成的实验迭代,把人的注意力从大量工程细节中释放出来

这也呼应了 AutoSOTA Live 开始前提出的问题:在 AI 研究中,许多研究者会把大量时间投入到为最后几个百分点反复调参与实验迭代之中。如果这部分工作能够被 agent 系统持续接管,人类研究者是否能把更多精力投入到更具原创性、更需要长期判断的问题上?

 

从论文代码库延申至科研社区互动

AutoSOTA Live 不是一个只在实验室团队内部运行的实验。

在会议期间,研究团队也在社交平台上持续公开实时研究进展,并收到了26封论文原作者的邮件反馈,对 AutoSOTA 优化结果的采纳和复现。在 X 和 LinkedIn 上,也有多位论文原作者围绕 AutoSOTA 的结果进行回复与互动;在小红书平台上,相关内容获得了 1.5W 帖子阅读量;话题 #AutoSOTA 浏览量超过 2.4W,并获得 1.3k+ 点赞收藏。

这些反馈说明,AutoSOTA Live 并不只是一次离线评测。它开始进入现实的科研传播过程当中:系统给出结果,团队公开过程,作者反馈意见,社区继续讨论,部分优化被原作者团队采纳并复现。

这意味着自主科研不能仅仅只是系统独立运行任务,而是进一步进入了真实的研究社区的反馈循环,获得了相应的讨论,向着自主科研的社区生态做出了一些令人惊喜的尝试。

 

投稿至Paper with Code公开评测榜单

AutoSOTA 团队也将部分优化结果整理并提交到 Papers with Code。

Papers with Code 是 AI 领域重要的公开评测与论文代码平台,收录了 574 个 benchmark 和十万余篇论文。

团队已向 Papers with Code 提交 51 篇 CVPR 会议优化成功论文的结果。这意味着,AutoSOTA 的输出不只是本地得到的一组更好看的数字,而是被整理成可以公开查看和继续核验,可以和原论文结果作对照的更加开放、更加欢迎社区互动的新形式。

真正有价值的研究结果,不能只是一段日志或一次孤立运行。它需要同时回答论文和代码是什么/baseline 如何建立/代码如何实现了进一步的优化/指标提升体现在哪些 benchmark 上/是否遵守合理的评测协议……等等问题;而Paper-with-Code 形式的整理,正是通过把这些信息放到一个更公开、更可追踪的框架里,为 AutoSOTA Live 增加了一个外部接口:结果进入公开评测体系,接受更长期的查看、比较和复核。然而,它又不仅仅是一个简单的结果展示入口,而是 AutoSOTA Live 从内部实验走向科研社区公共评价体系的一部分:它让自主科研系统的产出更接近真实科研成果:不仅有性能变化,也有代码、指标、协议和复核路径。

图2.png

最佳论文研究成果8小时极速优化

在CVPR 2026会议上斩获 Best Student Paper Honorable Mention的论文ChordEdit: One-Step Low-Energy Transport for Image Editing,是CVPR Live中一个很有代表性的案例。它解决的是 text-guided image editing 任务:把图像改成目标语义,同时尽量保持背景、构图和非编辑区域不变;通过one-step editing的范式,追求更轻量、更快速、更适合实时场景的图像编辑。

也正因为如此,继续优化它并不容易:如果为了提升指标引入更多迭代步骤,就会偏离 ChordEdit 原本最重要的设计优势。

AutoSOTA 在 8 小时内自动找到了一条更均衡的优化路径,在不破坏实验约束前提下同时处理背景保真、编辑效果和推理速度之间的权衡。优化具体包括两部分:算法侧引入 Cleanup Blending,减少 U-Net cleanup 在最后阶段对非编辑区域的过度重绘;并根据 source prompt 和 target prompt 的 embedding 相似度,自适应调节编辑强度;系统侧采用 TF32、SDPA attention等工程优化,在不改变编辑逻辑的情况下压缩推理开销。实验结果表现为:背景保真明显提升(MSE 下降 36.4%,etc.),编辑效果基本保持,单图推理时间从 0.37 秒下降到 0.25 秒

案例说明,AutoSOTA 并不是简单地产生一段代码,而是在真实论文代码库中理解方法约束、识别指标权衡、尝试候选路径,并保留同时满足质量和效率约束的改动。

AutoSOTA Live 的意义,不只是获得了一批更好的实验结果;更重要的是,它把自主科研系统放进了一个更接近真实科研的场景下。在这里,系统面对的是最前沿的顶会论文、真实的代码仓库、复杂依赖、有限算力、分散评测协议,以及来自作者和社区的外部反馈。

AutoSOTA Live 试图验证的是:AI研究智能体能否从单点能力,走向端到端、会议级、实时的大规模科研执行能力

AutoSOTA 已经形成了一个论文进入系统 - 系统完成复现和优化 - 结果被整理成技术报告和公开代码 - 结果提交到 Papers with Code - 作者和社区继续反馈 - 下一轮系统改进再吸收这些真实经验的初步闭环。当然,这种闭环并不意味着科研可以完全自主。相反,它让人的角色变得更关键。

人需要定义问题,选择目标,审查实验,判断哪些提升是真实有效的,哪些只是指标上的偶然收益;也需要决定哪些方向值得继续投入,哪些结果应该谨慎解释。

但可以确定的是,科研流程中一部分高强度、重复性的实验执行、失败复盘和增量优化,正在开始被 agent 系统承担。如果说过去的自主科研更多停留在论文阅读、代码生成和实验辅助,那么 AutoSOTA Live 指向的是下一步:

AI 开始以实时、大规模、可复核的方式参与真实科研流程。

 

项目信息

AutoSOTA 论文:

https://arxiv.org/abs/2604.05550

AutoSOTA GitHub:

https://github.com/tsinghua-fib-lab/AutoSOTA

AutoSOTA 项目主页:

https://tsinghua-fib-lab.github.io/AutoSOTA/

AutoSOTA @ CVPR 2026 项目主页:

https://tsinghua-fib-lab.github.io/AutoSOTA/cvpr.html

ChordEdit 论文:

https://arxiv.org/abs/2602.19083

ChordEdit 项目主页:

https://chordedit.github.io/

告别盲盒试错,走向精准命中: FIDIA让序列设计迈入「功能导向」
科研Xᴬᴵ | SciCustom:用知识单元组合,为新的科学评测需求自动生成Benchmark(ACL 2026)