Noticias sobre CVaR-UCBVI
1 artículos relacionados
Lamento del orden líder casi Minimax sin continuidad para CVaR-UCBVI
Continuity-Free Near-Minimax Leading-Order Regret for CVaR-UCBVI
AI InsightEste artículo demuestra que el algoritmo CVaR-UCBVI puede alcanzar un límite de arrepentimiento casi mínimo-máximo para cualquier distribución de rendimiento normalizada sin la necesidad de supuestos de límite inferior de continuidad o densidad. En comparación con trabajos anteriores que requerían un límite inferior de densidad para obtener una mejor tasa, esto llena el vacío teórico y avanza el análisis de arrepentimiento del aprendizaje por refuerzo CVaR bajo configuración de tabla a una situación más general.Importancia 75/100