Noticias sobre LLM inference
3 artículos relacionados
Márgenes, no ventanas: decodificación especulativa con pérdidas por paso sin formación
Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding
AI InsightLas reglas de verificación y el borrador de la forma de árbol de la decodificación especulativa se han considerado durante mucho tiempo hiperparámetros estáticos. AdaptiveSpec los ha cambiado a una toma de decisiones dinámica token por token, lo que significa que la aceleración de la inferencia está pasando de una "estrategia prefijada" a una "adaptativa por entrada". Esta puede ser la próxima fuente estructural para reducir la latencia y los costos de potencia informática, en lugar de simplemente acumular potencia informática.Importancia 65/100CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing
AI InsightLa etapa de pre-llenado del razonamiento de contexto largo tiene complejidad cuadrática y se convierte en un cuello de botella computacional. CRISP evita la sobrecarga indirecta de los métodos dinámicos de atención dispersa existentes al leer directamente las decisiones de enrutamiento y detectar los niveles de calidad. Esto significa que se espera que el costo de infraestructura del razonamiento en contexto ultralargo se reduzca aún más.Importancia 60/100La frontera eficiente de la inferencia LLM
The efficient frontier of LLM inference
AI InsightEl artículo propone que existe una frontera eficiente en la ingeniería de inferencia y la tecnología se divide en dos categorías: movimiento a lo largo de la curva y extrapolación general. En comparación con el enfoque anterior en las compensaciones entre retraso y rendimiento, se han agregado nuevas dimensiones como calidad-rendimiento e inteligencia-velocidad, lo que proporciona un marco de análisis unificado para la optimización de la inferencia.Importancia 40/100EntidadesLLM Inference