Aperta Scientia Crest
← Toutes les technologies
vLLM

vLLM

Catégorie : IA & MLOps ✨ Technologie du moment

Moteur d'inférence et de serving LLM haute performance et économe en mémoire.

Site officiel / GitHub ↗ Visiter
Chouette Rôle & Utilité

À quoi sert cette technologie ?

Son rôle dans les environnements de production et pourquoi elle est enseignée dans nos cursus.

vLLM est un moteur d'inférence haute performance et économe en mémoire pour les grands modèles de langage, avec PagedAttention et batching continu — la référence pour le serving LLM en production.

Chouette Pédagogie & Compétences

Ce que vous allez apprendre

Les compétences opérationnelles acquises sur cette technologie dans nos cursus.

  • Servir des LLM avec vLLM sur OpenShift AI
  • Configurer quantification et batching pour le débit
  • Monitorer et mettre à l'échelle les endpoints d'inférence
  • Optimiser l'efficacité mémoire avec PagedAttention
Chouette Veille Technologique

Actualités & Dernières évolutions

Les innovations récentes, versions majeures et tendances clés de l'écosystème.

High Performance 2026-07

vLLM v0.9 : Support natif du Speculative Decoding et des modèles de raisonnement

Réduction de 50% de la latence par token sur les modèles de raisonnement complexe et support élargi des GPU récents.

Ecosystem 2026-03

Standardisation de vLLM comme moteur de serving par défaut sur OpenShift AI

Déploiement en production simplifié avec scaling automatique basé sur la file d'attente des requêtes.

Présent dans le cursus

Retrouvez cette technologie dans les modules suivants de nos cursus certifiants Red Hat.

Mascotte AS300 AS300 — AI Platform Engineer

Voir le cursus →
M7

Red Hat OpenShift AI (RHOAI)

AI267 · Module 7 — AS300

M8

GenAI Fundamentals + Granite + RHEL AI

AI296 · Module 8 — AS300

Dans la même catégorie