Automatisation IA 6 min de lecture

Serveur IA en entreprise : quel matériel choisir et quel budget prévoir ?

Serveur IA : comment dimensionner le matériel pour faire tourner un LLM en local (GPU, VRAM, RAM), poste ou serveur, achat ou location, et comment raisonner le budget.

A
Automato
24 septembre 2026
Illustration de l'article « Serveur IA en entreprise : quel matériel choisir et quel budget prévoir ? »

Vous envisagez de faire tourner une IA en local pour garder vos données chez vous ? Très vite, la question matérielle arrive : faut-il un serveur IA, quelle carte graphique, combien de mémoire, et pour quel budget ? Les réponses que l'on trouve en ligne vont du simple PC de bureau au cluster à plusieurs centaines de milliers d'euros, ce qui n'aide pas beaucoup.

Ce guide donne une méthode pour dimensionner correctement votre matériel, sans le sous-estimer ni le surpayer.

Ce qui compte vraiment : la mémoire graphique

Pour faire tourner un grand modèle de langage (LLM), le composant déterminant n'est pas le processeur, mais la mémoire de la carte graphique (VRAM). Le modèle doit être chargé en mémoire pour répondre rapidement ; s'il ne tient pas en VRAM, il tourne beaucoup plus lentement, voire pas du tout.

La taille d'un modèle se mesure en milliards de paramètres (on parle de modèles « 8B », « 24B », « 70B »…). Plus il y a de paramètres, plus le modèle est capable, et plus il demande de mémoire.

Bonne nouvelle : la quantification permet de compresser un modèle en réduisant la précision de ses paramètres. Un modèle quantifié sur 4 bits occupe environ quatre fois moins de mémoire que sa version d'origine, avec une perte de qualité généralement faible. C'est ce format qu'utilisent la plupart des outils comme Ollama.

À retenir comme ordre de grandeur : en 4 bits, comptez un peu plus d'un demi-gigaoctet de VRAM par milliard de paramètres, plus une marge pour le contexte (la longueur des textes traités) et le nombre d'utilisateurs simultanés.

Dimensionner selon la taille du modèle

Taille du modèle Mémoire nécessaire (4 bits, ordre de grandeur) Matériel typique Usages adaptés
Petit (3 à 8B) Environ 4 à 8 Go PC avec carte graphique grand public, Mac récent Reformulation, tri, extraction simple, tests
Moyen (12 à 32B) Environ 10 à 24 Go Carte graphique haut de gamme ou poste de travail pro Rédaction, synthèse, RAG sur documents, la plupart des usages métier
Grand (70B et plus) 40 Go et plus Serveur avec une ou plusieurs cartes pro Raisonnement complexe, qualité proche des meilleurs modèles

Ces chiffres sont indicatifs : ils varient selon le modèle, le niveau de quantification et la longueur de contexte utilisée. La seule façon d'être sûr est de tester le modèle visé sur vos propres tâches.

Pour beaucoup d'entreprises, la zone la plus intéressante est celle des modèles moyens : ils offrent une qualité très correcte en français sur les tâches courantes, avec un matériel qui reste raisonnable.

Poste de travail ou vrai serveur ?

Le poste de travail dédié

Pour une petite équipe ou une phase de test, un poste équipé d'une bonne carte graphique suffit souvent. Les ordinateurs Apple récents sont aussi une option intéressante : leur mémoire unifiée, partagée entre processeur et carte graphique, permet de charger des modèles assez gros. C'est une solution simple, mais limitée en nombre d'utilisateurs simultanés.

Le serveur IA

Dès qu'une équipe entière utilise l'IA au quotidien, il faut un serveur : une machine conçue pour tourner en continu, avec une ou plusieurs cartes graphiques professionnelles, installée dans une baie ou une salle technique. Couplé à un moteur optimisé pour servir plusieurs utilisateurs en parallèle (comme vLLM), il offre des temps de réponse stables même en charge. Voir notre guide vLLM.

Le serveur implique aussi des contraintes physiques souvent oubliées : consommation électrique, dégagement de chaleur, bruit, alimentation secourue et accès réseau sécurisé.

Acheter ou louer ?

Deux logiques s'opposent, et aucune n'est meilleure dans l'absolu.

Acheter son serveur : investissement initial plus élevé, mais coût d'usage faible ensuite. Les données restent physiquement dans vos locaux, et l'IA fonctionne même sans connexion internet. Pertinent pour un usage intensif et durable, et pour les données les plus sensibles.

Louer un serveur GPU chez un hébergeur français : pas d'achat de matériel, mise en route rapide, possibilité d'augmenter ou de réduire la puissance selon les besoins. Les données sont hébergées en France, sur un serveur dédié. C'est souvent la meilleure option pour démarrer, et une vraie solution d'IA souveraine pour les entreprises qui n'ont pas de salle serveur.

Beaucoup d'entreprises commencent par la location pour valider les usages, puis investissent dans du matériel une fois les besoins stabilisés.

Comment raisonner le budget

Plutôt que de partir d'un prix catalogue, partez de vos usages :

  1. Combien d'utilisateurs, et combien en simultané aux heures de pointe ?
  2. Quelles tâches : questions courtes, rédaction, ou analyse de longs documents (qui demande plus de mémoire) ?
  3. Quelle qualité minimale : un modèle moyen suffit-il, ou avez-vous besoin d'un grand modèle ?
  4. Quel niveau de sensibilité des données : impose-t-il un hébergement dans vos locaux ?

Le budget total ne se limite pas au matériel. Il faut ajouter l'installation et la configuration, la connexion à vos documents et à vos outils, la sécurisation, la formation des équipes et la maintenance dans la durée. En face, il faut mettre ce que l'IA locale remplace : abonnements par utilisateur à des assistants en ligne, temps gagné par les équipes, et risques évités sur les données.

Les prix du matériel évoluent vite, en particulier ceux des cartes graphiques : faites établir un chiffrage à jour sur votre configuration réelle plutôt que de vous fier à des tarifs trouvés en ligne.

Les erreurs fréquentes

  • Acheter avant de tester. Commencez par évaluer les modèles sur vos cas réels, sur un poste de test ou un serveur loué. Vous saurez alors exactement de quelle taille de modèle vous avez besoin.
  • Sous-dimensionner la mémoire. Un modèle qui tient tout juste en VRAM pour un utilisateur peut saturer dès que trois personnes l'interrogent en même temps.
  • Oublier l'exploitation. Un serveur IA doit être supervisé, sauvegardé et mis à jour, comme n'importe quel serveur critique.
  • Viser trop gros. Le modèle le plus puissant n'est pas toujours nécessaire : pour extraire des informations de factures ou résumer des comptes rendus, un modèle moyen bien choisi fait très bien l'affaire.

Conclusion

Choisir un serveur IA, c'est d'abord choisir la taille de modèle dont vous avez besoin, puis la mémoire graphique qui va avec, et enfin le mode d'hébergement : poste, serveur sur site ou location en cloud souverain. En partant des usages plutôt que du catalogue, on évite à la fois le matériel sous-dimensionné qui déçoit et l'investissement disproportionné. Pour la vision d'ensemble, notre guide de l'IA locale replace ces choix dans la démarche globale.

Chez Automato, nous dimensionnons et déployons des serveurs IA pour les entreprises, sur site ou chez un hébergeur français, après un test sur vos propres cas d'usage. Vous voulez savoir de quel matériel vous avez vraiment besoin ? Parlons-en.

Parlons de votre projet

30 minutes pour comprendre votre besoin et voir si on peut vous aider. Sans engagement, sans blabla commercial.

Pierre-Yves, co-fondateur d'Automato
Pierre-Yves
Co-fondateur · Automato
Prendre RDV
À lire ensuite