Terminal-Bench-LILT に関する報道
関連記事 1 件
Terminal-Bench-LILT: 言語、地域、文化に基づいた多言語エージェント コーディング ベンチマーク
Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture
AI インサイトTerminal-Bench-LILT がリリースされました。これには 10 言語で 300 のコーディング タスクが含まれていますが、英語に相当するものはありません。最も強力なモデルの合格率はわずか 63.1% であり、多言語エージェントのコーディング能力が成熟には程遠いことを示しています。以前のすべて英語のみのレビューと比較して、これは言語/地域/文化の側面を体系的にカバーする最初のコーディング会社ベンチマークです。重要度 78/100