DeepSWE
基本信息
- 是什么:长程软件工程(Long-Horizon SWE)基准,专测前沿编程 Agent 在原创工程任务上的真实能力
- 榜单 v1.1:113 任务 / 91 仓库 / 5 种语言 / 28 个模型
- 官方更新日期:2026-09-22(原笔记写 2026-09-03,已过时)
- 名字来源:Agentica 2025-07 发布的 DeepSWE-Preview——32B、纯强化学习(RL)训练的软件工程智能体(SWE-Bench Verified 59%,开源权重第一),同名基准延续其名
核心特点(官方口径)
- 无污染:任务从零编写,不改编自既有 commit/PR,模型预训练时没见过答案
- 高多样性:任务横跨 91 个仓库、5 种语言
- 真实复杂度:提示词只有 SWE-bench Pro 一半长(约 2 倍输出 token),但解法工作量约为其 5.5 倍
- 程序化终态评分:手写验证器测软件行为而非实现细节
2026-10-02 当前榜单(重要更正)
| 模型 | 分数 |
|---|---|
| gpt-6-astra | 74% ±3% |
| gemini-3.8-flash | 74% ±1% |
| claude-opus-5 | 74% ±4% |
| gpt-6-luna | 67% ±4% |
| deepseek-v4-pro | 63% |
| glm-5.3-flash | 63% ±4% |
| deepseek-v4-flash | 53% |
两条原日记引用的分数查无实据:
- 「DeepSeek V4.1 Flash 74.2%」——当前 v1.1 榜无此条目,deepseek-v4-flash 实际为 53%
- 「Step-5 67.7%」——当前榜无 Step-5
两家并列 74% 之后,[[Step-5]] 的分数需按官网 Step Code Bench 口径引用,不要与 DeepSWE 混用。
官方链接
- 榜单官网:https://deepswe.datacurve.ai/
- Agentica 项目页:https://agentica-project.com/
相关笔记
- AutomationBench - 同期另一 Agent 基准(Zapier,业务工作流向)
- ARC-AGI-3 · Step-5 · GPT-6.1 Astra
相关日记
- 2026-09-23 - 三模型编程能力对比引用