Articles sur Llama-3.1-8B-Instruct
1 articles liés
SemKV : quantification sémantique du cache KV à précision mixte guidée par la falaise de qualité pour l'inférence LLM à contexte long
SemKV: Semantic Mixed-Precision KV Cache Quantization Guided by the Quality Cliff for Long-Context LLM Inference
AI InsightCette étude a révélé que la quantification uniforme KV présente une falaise de qualité à 2,0 bits : en dessous de 2,322 bits, elle est impossible à distinguer du FP16, mais s'effondre soudainement à 2,0 bits. Par rapport à la précédente solution de précision mixte qui recherchait une faible largeur de bit, il a été démontré cette fois que seule la précision mixte près de la falaise présente des avantages statistiques, modifiant ainsi l'orientation de la conception.Importance 68/100