vLLM : ce que fait ce moteur d'inférence open source, pourquoi il tient la charge (PagedAttention, batching), comment le déployer et quand le préférer à Ollama.
Faire tourner un modèle d'IA pour une personne, c'est facile. Le faire tourner pour cinquante collaborateurs qui l'interrogent en même temps, avec des temps de réponse corrects, c'est une autre affaire. C'est précisément le problème que résout vLLM, le moteur open source devenu la référence pour servir des grands modèles de langage (LLM) en production.
Ce guide explique ce qu'est vLLM, pourquoi il est si efficace, comment le déployer, et dans quels cas il vaut mieux lui préférer un outil plus simple comme Ollama.
vLLM est un moteur d'inférence open source (licence Apache 2.0), né à l'université de Berkeley. Son rôle : charger un modèle d'IA sur un serveur équipé de cartes graphiques, et répondre aux requêtes de nombreux utilisateurs ou applications le plus efficacement possible.
Il ne fournit pas d'interface de conversation : c'est une brique serveur. Les utilisateurs passent par une interface comme Open WebUI, et les applications par son API.
Deux innovations font sa réputation.
PagedAttention. Pendant qu'il génère une réponse, un modèle garde en mémoire des informations sur le texte déjà traité. Les moteurs classiques réservent cette mémoire de façon rigide, ce qui en gaspille une grande partie. vLLM la gère par petits blocs, un peu comme la mémoire d'un système d'exploitation. Résultat : beaucoup plus de requêtes tiennent en même temps dans la mémoire de la carte graphique.
Le traitement par lots en continu. Au lieu de traiter les requêtes les unes après les autres, ou par groupes figés, vLLM intègre les nouvelles requêtes au fil de l'eau dans le calcul en cours. La carte graphique travaille en permanence à plein régime.
Concrètement, sur un même matériel, vLLM peut servir nettement plus d'utilisateurs simultanés qu'un moteur pensé d'abord pour la simplicité. Et le matériel GPU étant la partie la plus coûteuse d'une IA locale, mieux l'utiliser change directement l'équation économique.
| Critère | Ollama | vLLM |
|---|---|---|
| Objectif | Simplicité, poste ou petit serveur | Performance en charge, serveur GPU |
| Installation | Très simple | Plus technique |
| Matériel | Carte graphique, Mac ou même processeur seul | Serveur avec carte(s) graphique(s), surtout NVIDIA |
| Utilisateurs simultanés | Quelques-uns | Des dizaines ou plus |
| Gestion des modèles | Bibliothèque intégrée, une commande | Modèles Hugging Face, configuration plus fine |
| API compatible OpenAI | Oui | Oui |
| Cas typique | Test, petite équipe, poste individuel | Service IA interne pour toute l'entreprise |
Les deux outils ne s'opposent pas : on commence très souvent avec Ollama pour tester et valider les usages, puis on passe à vLLM quand le nombre d'utilisateurs augmente. Notre comparatif LM Studio vs Ollama détaille ce parcours type.
vLLM fonctionne principalement sous Linux, avec des cartes graphiques NVIDIA (d'autres matériels sont pris en charge, avec plus ou moins de maturité). Deux méthodes courantes :
vllm serve suivie du nom du modèle.Les réglages importants portent sur la part de mémoire graphique allouée, la longueur maximale des textes traités, le nombre de cartes utilisées et le format du modèle. Ce sont eux qui déterminent le nombre d'utilisateurs que le serveur pourra servir confortablement. Le choix du matériel lui-même est détaillé dans notre guide serveur IA : matériel et budget.
vLLM est le moteur qui permet de passer d'une IA locale « de démonstration » à un vrai service utilisé par toute l'entreprise. Grâce à sa gestion optimisée de la mémoire et au traitement continu des requêtes, il tire le maximum de cartes graphiques coûteuses, et son API compatible OpenAI le rend facile à intégrer. Il demande en revanche plus de compétences techniques qu'Ollama : c'est l'outil de la mise à l'échelle, pas celui des premiers tests.
Chez Automato, nous concevons et déployons des infrastructures d'IA locale pour les entreprises, d'Ollama pour démarrer jusqu'à vLLM pour servir toutes vos équipes : dimensionnement, installation sécurisée, supervision et interface utilisateur. Vous préparez un déploiement à plus grande échelle ? Échangeons sur votre projet.
30 minutes pour comprendre votre besoin et voir si on peut vous aider. Sans engagement, sans blabla commercial.