Automatisation IA 6 min de lecture

Ollama : le guide pour faire tourner un LLM en local en entreprise

Ollama : ce que c'est, comment l'installer (Windows, Mac, Linux, Docker), choisir un modèle comme Mistral, utiliser son API et passer en production en entreprise.

A
Automato
24 septembre 2026
Illustration de l'article « Ollama : le guide pour faire tourner un LLM en local en entreprise »

Si vous vous intéressez à l'IA locale, vous avez forcément croisé Ollama. Cet outil open source est devenu en peu de temps la façon la plus simple de faire tourner un grand modèle de langage (LLM) sur sa propre machine. Une commande, et un modèle comme Mistral ou Llama répond à vos questions sans qu'aucune donnée ne quitte votre ordinateur.

Ce guide explique ce qu'est Ollama, comment l'installer et l'utiliser, et surtout ce qu'il faut prévoir pour passer d'un test sur un poste à un usage sérieux en entreprise.

Ollama, c'est quoi ?

Ollama est un logiciel libre (sous licence MIT) qui permet de télécharger, gérer et exécuter des modèles d'IA open source en local. Il se charge de tout ce qui est compliqué : récupérer le modèle dans le bon format, l'optimiser pour votre matériel (carte graphique, puce Apple ou simple processeur), et l'exposer via une interface en ligne de commande et une API.

Concrètement, Ollama joue le rôle de moteur : il fait tourner le modèle. Il ne fournit pas lui-même d'interface de conversation élaborée comme celle de ChatGPT, mais de nombreux outils viennent se brancher dessus pour ça, comme Open WebUI.

Pourquoi un tel succès ? Parce qu'il rend l'IA locale accessible à n'importe quel profil technique, en quelques minutes.

Installer Ollama

L'installation est volontairement simple :

  • Windows et macOS : un installateur à télécharger depuis le site officiel ollama.com, comme n'importe quelle application.
  • Linux : un script d'installation officiel, à lancer en une ligne de commande depuis le terminal.
  • Docker : une image officielle ollama/ollama, idéale pour un serveur (voir plus bas).

Une fois installé, Ollama tourne en arrière-plan. Vous pouvez vérifier qu'il fonctionne en tapant ollama --version dans un terminal.

Lancer un premier modèle

Tout passe par quelques commandes :

  • ollama run mistral : télécharge le modèle Mistral s'il n'est pas déjà présent, puis ouvre une conversation directement dans le terminal.
  • ollama pull llama3.1 : télécharge un modèle sans le lancer.
  • ollama list : affiche les modèles installés.
  • ollama rm <modèle> : supprime un modèle pour libérer de l'espace.

La bibliothèque d'Ollama propose des centaines de modèles et de variantes. Chaque modèle existe généralement en plusieurs tailles (nombre de paramètres) et niveaux de compression. Plus le modèle est gros, meilleures sont les réponses, mais plus il faut de mémoire. Notre guide serveur IA : matériel et budget détaille comment choisir selon votre machine.

Quel modèle choisir pour un usage en entreprise ?

Famille Éditeur Points forts Pour quels usages
Mistral Mistral AI (France) Très bon en français, éditeur européen Rédaction, synthèse, assistant interne
Llama Meta Écosystème très large, nombreuses variantes Usage généraliste, base de nombreux modèles spécialisés
Qwen Alibaba Performant en raisonnement et en code Analyse, extraction de données, développement
Gemma Google Modèles compacts et efficaces Postes modestes, tâches ciblées

Les classements évoluent tous les mois, et les conditions de licence varient d'un modèle à l'autre : vérifiez-les avant un usage commercial. Surtout, testez plusieurs modèles sur vos propres tâches, en français, avant de choisir. C'est la seule évaluation qui compte.

Utiliser l'API d'Ollama

Au-delà du terminal, Ollama expose une API locale (par défaut sur le port 11434). C'est ce qui le rend vraiment utile en entreprise : n'importe quelle application peut interroger le modèle.

Point pratique important : Ollama propose une API compatible avec le format d'OpenAI. Beaucoup d'outils conçus pour ChatGPT peuvent donc être redirigés vers votre modèle local en changeant simplement l'adresse du serveur. C'est le cas de nombreux outils d'automatisation : n8n, par exemple, sait dialoguer avec Ollama, ce qui permet de construire des agents IA avec n8n entièrement en local.

Ollama avec Docker

Sur un serveur, la méthode la plus propre est de passer par Docker. On lance le conteneur officiel en montant un volume pour conserver les modèles téléchargés, et en donnant accès à la carte graphique si le serveur en a une. Cette approche facilite les mises à jour, la sauvegarde et l'intégration avec d'autres services (interface web, base de documents, outil d'automatisation) dans un même fichier docker-compose.

C'est la même logique que pour auto-héberger n8n avec Docker : un environnement reproductible, isolé et facile à maintenir.

Du test à la production : ce qu'il faut ajouter

Ollama sur un poste, c'est parfait pour tester. Pour un usage par toute une équipe, plusieurs briques sont nécessaires.

Une interface pour les utilisateurs. Vos collaborateurs n'utiliseront pas un terminal. Une interface comme Open WebUI offre une expérience proche de ChatGPT : conversations, historique, dépôt de documents, gestion des utilisateurs. Voir notre guide Open WebUI.

La sécurité. Par défaut, l'API d'Ollama n'a pas d'authentification. Si vous l'ouvrez sur le réseau, il faut la placer derrière un proxy avec contrôle d'accès, en HTTPS, et ne jamais l'exposer directement sur internet.

La connexion à vos documents. Pour que l'IA réponde à partir de vos procédures, contrats ou documentation, il faut mettre en place du RAG : indexer vos documents et les fournir au modèle au moment de la question.

La montée en charge. Ollama gère plusieurs requêtes, mais il est d'abord pensé pour la simplicité. Pour de nombreux utilisateurs simultanés sur un serveur GPU, un moteur spécialisé comme vLLM peut être plus adapté. Notre guide vLLM détaille ce passage à l'échelle. Nous comparons ces outils dans LM Studio vs Ollama.

La maintenance. Mises à jour d'Ollama et des modèles, supervision, sauvegardes : comme tout service interne, il faut quelqu'un pour s'en occuper dans la durée.

Les limites d'Ollama

  • La qualité dépend du modèle et du matériel. Un petit modèle sur un ordinateur portable ne rivalisera pas avec les meilleurs assistants en ligne sur des tâches complexes.
  • Ce n'est qu'un moteur. Interface, droits d'accès, RAG et intégrations sont à construire autour.
  • Attention à l'offre cloud. Ollama propose aussi désormais une option d'exécution dans son propre cloud. Si l'objectif est de garder vos données en local, assurez-vous d'utiliser des modèles qui tournent sur votre machine.

Conclusion

Ollama est aujourd'hui la porte d'entrée idéale vers l'IA locale : gratuit, simple à installer, compatible avec la plupart des modèles open source et avec les outils existants grâce à son API. Pour une entreprise, c'est une excellente base technique, à condition de l'entourer de ce qui fait un vrai service : une interface, de la sécurité, une connexion à vos documents et un suivi.

Chez Automato, nous déployons Ollama et les briques qui l'entourent pour construire une IA locale d'entreprise prête pour vos équipes : choix du modèle sur vos cas réels, installation sur votre serveur ou en cloud français, interface sécurisée et RAG sur vos documents. Vous avez testé Ollama et voulez passer à l'étape suivante ? Parlons-en.

Parlons de votre projet

30 minutes pour comprendre votre besoin et voir si on peut vous aider. Sans engagement, sans blabla commercial.

Pierre-Yves, co-fondateur d'Automato
Pierre-Yves
Co-fondateur · Automato
Prendre RDV
À lire ensuite