跳到正文

SWE-agent

一个研究项目的主张:瓶颈从来不是模型,而是模型面前的界面。

Screenshot of SWE-agent
编辑截图, 27 Sep 2026SWE-agent ↗

这是什么

给它一个 GitHub issue,它尝试自动修复。它真正的贡献不是一个产品而是一个概念——Agent-Computer Interface(ACI),主张模型做不好软件工程,部分原因是给它的工具是为人设计的。团队围绕模型重新设计了命令和反馈格式,报告在 SWE-bench 上解决了 12.29% 的 issue,是当时的最优结果。

谁做的SWE-agent 出自普林斯顿大学的一个研究组,而不是一个产品团队:NeurIPS 2024 论文列了七位作者——John Yang、Carlos E. Jimenez、Alexander Wettig、Kilian Lieret、Shunyu Yao、Karthik R. Narasimhan、Ofir Press,仓库的第一次提交由 Jimenez 完成。七人中有六人同时是 SWE-bench 的作者,本档案里 12.29% 这个数字就是在那一套基准上测出来的,基准由同一个组在 2023 年 10 月发表(arXiv:2310.06770)。仓库此后累计 101 位贡献者;这个组的后续项目 EnIGMA 把这套界面思路搬到 CTF 安全题目上,合作方是特拉维夫大学与纽约大学的研究者。

制作过程

3 个阶段
  1. 01

    把问题重新定义成界面问题

    研究问题不是「哪个模型最强」,而是「模型该看到什么」。团队设计了专门的命令和输出格式,让语言模型能浏览仓库、查看、编辑、执行代码,而不必去啃那些为人眼设计的终端输出。他们把这套东西命名为 Agent-Computer Interface。

  2. 02

    一个有日期的数字

    在 SWE-bench 测试集上解决 12.29% 的 issue,2024 年 4 月的最优结果。写这份档案时这个数字已经过去了两年,引用时必须带上日期——一个没有日期的基准分数会被读成当下的水平。

  3. 03

    研究者自己推荐了后继项目

    SWE-agent 的文档顶部挂着一条横幅,推荐改用 mini-swe-agent,称其「性能相同,但简单和灵活得多」。原项目仍在维护,但写它的人建议新用户去别处——这值得如实写出来,而不是简单标成「活跃」。

他会告诉你什么

  • 进展停滞时,模型与工作之间的界面是一个正当的着手点,不只是模型本身。
  • 基准成绩是一种带保质期的声明,发布时就应该带上日期。
  • 一个会推荐自己替代品的研究项目是在尽职,不是失败。

相关档案

全部档案 →