Articles sur Terminal-Bench-LILT
1 articles liés
Terminal-Bench-LILT : référence de codage agent multilingue fondée sur la langue, la région et la culture
Terminal-Bench-LILT: Multilingual Agentic Coding Benchmark Grounded in Language, Region, and Culture
AI InsightTerminal-Bench-LILT est publié, contenant 300 tâches de codage en 10 langues, dont aucune n'a d'équivalent en anglais. Le taux de réussite du modèle le plus performant n'est que de 63,1 %, ce qui indique que les capacités de codage des agents multilingues sont loin d'être matures. Par rapport aux précédentes revues entièrement en anglais, il s’agit du premier benchmark d’agence de codage qui couvre systématiquement les dimensions langue/région/culture.Importance 78/100