Articles sur KV cache
2 articles liés
GrowPage : budgétisation KV à la demande pour un service de raisonnement LLM efficace
GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving
AI InsightGrowPage convertit la capacité de cache KV du budget statique en ressources d'exécution, ce qui signifie que la gestion de la mémoire du système d'inférence passe de la « réservation » à la « planification à la demande ». Si ce changement peut être mis en œuvre, il affectera directement le débit et le coût de l'inférence de sortie longue, et suggère également que l'optimisation future de l'inférence pourrait s'appuyer davantage sur la gestion dynamique des ressources plutôt que sur des stratégies de compression fixes.Importance 70/100Qu'est-ce qui est important pour l'expulsion agressive des KV au moment du décodage ? Agrégation temporelle et préservation du classement
What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation
AI InsightCette étude montre que le goulot d'étranglement de l'expulsion de KV pendant le décodage n'est peut-être pas la conception de la fonction de notation, mais les règles d'agrégation entre étapes. L'agrégation EMA fait converger les effets de la plupart des fonctions de notation, ce qui signifie que certaines conclusions des recherches existantes doivent être réexaminées - ce qui détermine réellement la stabilité de l'ensemble d'expulsion peut être le couplage de l'agrégation temporelle et du poids des couches, plutôt qu'une formule de notation unique.Importance 62/100