为什么重要

该方法显著提高了数据效率,减少训练成本的同时提升模型性能,对软件工程领域的模型训练具有重要价值。

关键事实

事实 1

SWE-Prime 是一个多粒度、两阶段的 SFT 数据选择方法。

来源与依据

单一来源

we propose SWE-Prime, a multi-granularity, two-stage SFT data selection method

arXiv · 第一方证据 · 支持

查看 arXiv 原文

事实 2

第一阶段进行轨迹级筛选,基于过程质量、结果质量和数据代表性选择高质量且具代表性的成功轨迹子集。

来源与依据

单一来源

the first stage performs trajectory-level screening based on process quality, result quality, and data representativeness

arXiv · 第一方证据 · 支持

查看 arXiv 原文

事实 3

在 SWE-Bench Pro 和 SWE-Bench Verified 上,使用 SWE-Prime 选出的 10% 轨迹子集训练,比使用完整已解决数据集训练带来最高分别 12.2% 和 24.2% 的相对性能提升。

来源与依据

单一来源

training on the 10% trajectory subset selected by SWE-Prime outperforms training on the full resolved dataset, yielding relative performance gains of up to 12.2% and 24.2%

arXiv · 第一方证据 · 支持

查看 arXiv 原文