Noticias sobre KV cache
2 artículos relacionados
GrowPage: Presupuestos de KV bajo demanda para un servicio eficiente de razonamiento de LLM
GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
AI InsightGrowPage convierte la capacidad de caché KV de un presupuesto estático a recursos de tiempo de ejecución, lo que significa que la gestión de la memoria del sistema de inferencia está pasando de "reserva" a "programación bajo demanda". Si se puede implementar este cambio, afectará directamente el rendimiento y el costo de la inferencia de salida larga, y también sugiere que la optimización de la inferencia futura puede depender más de la gestión dinámica de recursos que de estrategias de compresión fijas.Importancia 70/100¿Qué importa en el desalojo agresivo de KV en tiempo de decodificación? Agregación temporal y preservación de la clasificación
What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation
AI InsightEste estudio muestra que el cuello de botella del desalojo de KV durante la decodificación puede no ser el diseño de la función de puntuación, sino las reglas de agregación de pasos cruzados. La agregación de EMA hace que los efectos de la mayoría de las funciones de puntuación converjan, lo que significa que es necesario reexaminar algunas conclusiones de la investigación existente: lo que realmente determina la estabilidad del conjunto de desalojo puede ser la combinación de la agregación de tiempo y el peso de las capas, en lugar de una única fórmula de puntuación.Importancia 62/100