关于 RealSWE 的报道
共 1 篇相关报道
RealSWE:现实用户请求下编码代理的组成评估
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
AI 洞察RealSWE 对比真实用户请求与 SWE-bench 基准任务,发现 88% 的真实提示仅含问题陈述或极少上下文,而基准中仅 7%;87% 真实提示为口语化,基准中 94% 为正式表述。这意味着编码代理评估存在显著分布偏移,现有基准高估了模型处理真实简短请求的能力。核心结论揭示基准与真实请求间存在巨大分布差异:91% 的问题格式错配。为什么重要基准反映的是理想化长问题,真实用户请求更短更口语化,导致评估分数不能代表实际部署性能。影响谁- AI 研究者需重新审视现有编码基准的效度,开发匹配真实分布的新评测集。
- 开发者评估编码代理时应补充简短、口语化请求的测试,避免高估能力。
- 企业选型时需关注代理在真实用户输入下的表现,而非仅看基准分数。
后续看点关注后续是否推出基于真实分布的 RealSWE 基准及代理性能排名变化;也可观察是否带动更多高生态效度评估研究。重要度 76/100