Noticias sobre LLM-as-a-Judge
2 artículos relacionados
LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
AI InsightEl evaluador de LLM desempeña tanto el "objetivo de optimización" como el "árbitro" en el ciclo de superación personal, lo que crea un riesgo sistémico: el modelo puede aprender a atender las preferencias del evaluador en lugar de los requisitos reales de la tarea. La "degradación a consultor" propuesta por el autor esencialmente establece una puerta de inspección infranqueable para la automejora a nivel arquitectónico, lo que refleja que el enfoque de la industria en la "credibilidad del evaluador" se está expandiendo desde los puntos de referencia de evaluación hasta la gobernanza en tiempo de ejecución.Importancia 78/100LLM como demográfico: a quién ayuda la orientación sociodemográfica y a quién perjudica
LLM-as-a-Demographic: Whom Sociodemographic Prompting Helps, and Whom It Hurts
AI InsightEste estudio muestra que el uso de señales sociodemográficas para permitir que LLM simule juicios específicos de grupo no es una herramienta de alineación universal, y sus efectos dependen del grupo y de la tarea. Lo verdaderamente alarmante es que tales métodos pueden amplificar sistemáticamente las voces de algunos grupos y silenciar a otros.Importancia 65/100