Noticias sobre SemKV
1 artículos relacionados
SemKV: Cuantización de caché KV semántica de precisión mixta guiada por el acantilado de calidad para inferencia LLM de contexto largo
SemKV: Semantic Mixed-Precision KV Cache Quantization Guided by the Quality Cliff for Long-Context LLM Inference
AI InsightEste estudio reveló que la cuantificación uniforme de KV tiene un límite de calidad en 2,0 bits: por debajo de 2,322 bits, es indistinguible de FP16, pero colapsa repentinamente en 2,0 bits. En comparación con la solución de precisión mixta anterior que buscaba un ancho de barrena bajo, esta vez se demostró que solo la precisión mixta cerca del acantilado tiene ventajas estadísticas, cambiando el enfoque del diseño.Importancia 68/100