Noticias sobre speculative decoding
2 artículos relacionados
Márgenes, no ventanas: decodificación especulativa con pérdidas por paso sin formación
Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding
AI InsightLas reglas de verificación y el borrador de la forma de árbol de la decodificación especulativa se han considerado durante mucho tiempo hiperparámetros estáticos. AdaptiveSpec los ha cambiado a una toma de decisiones dinámica token por token, lo que significa que la aceleración de la inferencia está pasando de una "estrategia prefijada" a una "adaptativa por entrada". Esta puede ser la próxima fuente estructural para reducir la latencia y los costos de potencia informática, en lugar de simplemente acumular potencia informática.Importancia 65/100Codiseño de modelos de IA mediante decodificación especulativa para una inferencia LLM más rápida
Co-Designing AI Models Using Speculative Decoding for Faster LLM Inference
AI InsightLa decodificación especulativa está evolucionando de una tecnología de aceleración del tiempo de inferencia a una variable clave en la etapa de diseño del modelo. NVIDIA ha vinculado la longitud del borrador, el mecanismo del borrador y el frente de Pareto en forma de pautas, lo que significa que la optimización del rendimiento del modelo ya no depende solo del entrenamiento o el tiempo de ejecución, sino que se extiende al diseño conjunto de arquitectura y algoritmos de inferencia.Importancia 45/100