Noticias sobre Multiple-choice Questions
1 artículos relacionados
Los modelos de lenguaje grandes favorecen sistemáticamente las opciones populares: evidencia y mitigación en las preguntas frecuentes
Large Language Models Systematically Favor Popular Options: Evidence and Mitigation Across MCQs
AI InsightLLM favorece sistemáticamente la opción popular en preguntas de opción múltiple, incluso si la opción es incorrecta, y el nivel de confianza sigue siendo alto cuando la precisión disminuye. El nuevo punto de referencia PopMCQ cuantifica este sesgo utilizando seis estrategias de control, y el modelo tiende a seleccionar el término de error popular en el escenario más conflictivo. Esto sugiere que las evaluaciones existentes pueden sobrestimar las capacidades del modelo y la popularidad de la opción debería usarse como variable de evaluación.Importancia 68/100