Articles sur vLLM
3 articles liés
Des marges, pas des fenêtres : décodage spéculatif avec perte par étape, sans formation
Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding
AI InsightLes règles de vérification et le projet de forme d’arbre du décodage spéculatif ont longtemps été considérés comme des hyperparamètres statiques. AdaptiveSpec les a remplacés par une prise de décision dynamique jeton par jeton, ce qui signifie que l'accélération de l'inférence passe d'une « stratégie préfixée » à une « stratégie adaptative par entrée ». Cela pourrait être la prochaine source structurelle de réduction des coûts de latence et de puissance de calcul, plutôt que de simplement empiler la puissance de calcul.Importance 65/100Meet Switchyard: A Rust Proxy and Library That Routes and Translates LLM Traffic Across OpenAI and Anthropic APIs
AI InsightL'essence de la sortie de Switchyard par NVIDIA est d'insérer une couche d'interopérabilité ouverte entre le client LLM et le backend d'inférence, permettant à des outils tels que Claude Code ou Codex CLI de basculer de manière transparente entre vLLM, NIM ou Ollama. Cela montre que la portée concurrentielle de NVIDIA s’étend des puces à l’écosystème des logiciels d’inférence. Le statut de pré-publication montre qu'il a l'intention d'établir des normes à l'avance plutôt que de les commercialiser immédiatement.Importance 60/100vLLM v0.28.0
AI InsightLa sortie de vLLM v0.28.0 introduit un nouveau benchmark de performances, marquant la transition d'un environnement d'agent statique à un monde de formation adaptative, ce qui revêt une grande importance pour l'expansion des domaines d'application LLM.Importance 60/100