vLLM
Moteur d'inférence et de serving LLM haute performance et économe en mémoire.
Site officiel / GitHub ↗ Visiter
À quoi sert cette technologie ?
Son rôle dans les environnements de production et pourquoi elle est enseignée dans nos cursus.
vLLM est un moteur d'inférence haute performance et économe en mémoire pour les grands modèles de langage, avec PagedAttention et batching continu — la référence pour le serving LLM en production.
Ce que vous allez apprendre
Les compétences opérationnelles acquises sur cette technologie dans nos cursus.
- Servir des LLM avec vLLM sur OpenShift AI
- Configurer quantification et batching pour le débit
- Monitorer et mettre à l'échelle les endpoints d'inférence
- Optimiser l'efficacité mémoire avec PagedAttention
Actualités & Dernières évolutions
Les innovations récentes, versions majeures et tendances clés de l'écosystème.
vLLM v0.9 : Support natif du Speculative Decoding et des modèles de raisonnement
Réduction de 50% de la latence par token sur les modèles de raisonnement complexe et support élargi des GPU récents.
Standardisation de vLLM comme moteur de serving par défaut sur OpenShift AI
Déploiement en production simplifié avec scaling automatique basé sur la file d'attente des requêtes.
Présent dans le cursus
Retrouvez cette technologie dans les modules suivants de nos cursus certifiants Red Hat.
AS300 — AI Platform Engineer
Voir le cursus →
Red Hat OpenShift AI (RHOAI)
AI267 · Module 7 — AS300
GenAI Fundamentals + Granite + RHEL AI
AI296 · Module 8 — AS300