RealSWE に関する報道
関連記事 1 件
RealSWE: 現実的なユーザー要求に基づくコーディング エージェントの構成評価
RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests
AI インサイトRealSWE は、実際のユーザー リクエストと SWE ベンチ ベンチマーク タスクを比較したところ、実際のプロンプトの 88% には、問題のステートメントまたは最小限のコンテキストのみが含まれていたのに対し、ベースラインではわずか 7% であったことがわかりました。実際のプロンプトの 87% は口語的なものでしたが、ベースラインの正式なステートメントでは 94% でした。これは、エンコード エージェントの評価に大幅な分布の変化があり、既存のベンチマークが実際の短いリクエストを処理するモデルの能力を過大評価していることを意味します。重要度 76/100