Articles sur LLM Inference
3 articles liés
Des marges, pas des fenêtres : décodage spéculatif avec perte par étape, sans formation
Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding
AI InsightLes règles de vérification et le projet de forme d’arbre du décodage spéculatif ont longtemps été considérés comme des hyperparamètres statiques. AdaptiveSpec les a remplacés par une prise de décision dynamique jeton par jeton, ce qui signifie que l'accélération de l'inférence passe d'une « stratégie préfixée » à une « stratégie adaptative par entrée ». Cela pourrait être la prochaine source structurelle de réduction des coûts de latence et de puissance de calcul, plutôt que de simplement empiler la puissance de calcul.Importance 65/100CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing
AI InsightL’étape de pré-remplissage du raisonnement en contexte long a une complexité quadratique et devient un goulot d’étranglement informatique. CRISP contourne la surcharge indirecte des méthodes dynamiques d’attention clairsemée existantes en lisant directement les décisions de routage et en détectant les niveaux de qualité. Cela signifie que le coût d’infrastructure du raisonnement contextuel ultra-long devrait encore être réduit.Importance 60/100La frontière efficace de l'inférence LLM
The efficient frontier of LLM inference
AI InsightL'article propose qu'il existe une frontière efficace dans l'ingénierie d'inférence, et la technologie est divisée en deux catégories : le déplacement le long de la courbe et l'extrapolation globale. Par rapport à l'accent mis précédemment sur les compromis entre délai et débit, de nouvelles dimensions telles que la qualité-débit et l'intelligence-vitesse ont été ajoutées, fournissant ainsi un cadre d'analyse unifié pour l'optimisation de l'inférence.Importance 40/100EntitésLLM Inference