IA open source : ce que recouvre le terme, les principales familles de modèles (Mistral, Llama, Qwen, Gemma…), les licences à vérifier et comment choisir pour votre entreprise.
Il y a quelques années, l'IA générative de qualité était réservée à une poignée de géants accessibles uniquement par API. Ce n'est plus le cas. Mistral, Meta, Alibaba, Google et d'autres publient aujourd'hui des modèles que n'importe quelle entreprise peut télécharger, installer sur ses serveurs et adapter à ses besoins. C'est ce qu'on appelle l'IA open source, et c'est elle qui rend possible une IA vraiment maîtrisée en entreprise.
Ce guide explique ce que recouvre réellement le terme, présente les principales familles de modèles et donne une méthode pour choisir.
Un modèle d'IA open source est un modèle dont l'éditeur publie les « poids », c'est-à-dire les fichiers qui contiennent tout ce que le modèle a appris. Avec ces fichiers, vous pouvez faire tourner le modèle sur votre propre machine, sans passer par l'éditeur.
Une nuance importante : dans la plupart des cas, on devrait plutôt parler de modèles à poids ouverts (open weights). Les éditeurs publient le modèle, mais rarement les données et le code qui ont servi à l'entraîner, ce qu'exigerait une définition stricte de l'open source. Pour une entreprise, la différence est surtout théorique. Ce qui compte en pratique, c'est de pouvoir installer le modèle chez soi, et de savoir ce que sa licence autorise.
| Famille | Éditeur | Points forts | Licence à vérifier |
|---|---|---|---|
| Mistral | Mistral AI (France) | Excellent en français, éditeur européen, plusieurs tailles | Beaucoup de modèles sous Apache 2.0, d'autres sous licences spécifiques |
| Llama | Meta (États-Unis) | Écosystème immense, base de nombreux modèles dérivés | Licence communautaire propre à Meta, avec conditions |
| Qwen | Alibaba (Chine) | Très performant en raisonnement, en code et en multilingue | Majoritairement Apache 2.0 selon les versions |
| Gemma | Google (États-Unis) | Modèles compacts et efficaces, adaptés aux petites machines | Conditions d'utilisation propres à Google |
| DeepSeek | DeepSeek (Chine) | Modèles de raisonnement performants | Licence permissive sur plusieurs modèles |
| gpt-oss | OpenAI (États-Unis) | Modèles ouverts de l'éditeur de ChatGPT | Apache 2.0 |
Ce paysage évolue tous les mois : de nouvelles versions sortent en permanence et les classements changent. Plutôt que de chercher « le meilleur modèle » dans l'absolu, il faut chercher le meilleur modèle pour vos tâches, sur votre matériel.
« Open source » ne veut pas toujours dire « libre de tout usage ». Avant de déployer un modèle en entreprise, vérifiez sa licence :
En cas de doute, lisez la licence publiée avec le modèle sur sa page officielle ou sur Hugging Face, la plateforme qui héberge la plupart des modèles ouverts.
Rédaction, synthèse, extraction de données dans des documents, classification, réponse à des questions sur une base documentaire, génération de code : chaque tâche a ses modèles forts. Listez vos cas d'usage prioritaires avant de regarder les classements.
Beaucoup de modèles sont d'abord entraînés sur de l'anglais. Testez-les sur vos propres textes : c'est souvent là que les écarts sont les plus visibles. Les modèles de Mistral ont ici un avantage naturel.
La taille du modèle (en milliards de paramètres) détermine la mémoire nécessaire. Un grand modèle sur un serveur sous-dimensionné sera lent ou inutilisable. Notre guide serveur IA : matériel et budget aide à faire correspondre modèle et machine.
Installez deux ou trois candidats avec un outil comme Ollama ou LM Studio, et comparez leurs réponses sur un jeu de cas réels : vos documents, vos questions, vos formats. Une demi-journée de test vaut mieux que tous les classements publiés en ligne.
De meilleurs modèles sortiront. Construisez votre installation pour pouvoir changer de modèle facilement : une interface et des automatisations qui ne dépendent pas d'un modèle précis vous permettront de profiter des progrès sans tout refaire.
L'IA open source a changé la donne pour les entreprises : il est désormais possible d'avoir une IA générative de très bon niveau, installée chez soi, sans dépendre d'un fournisseur et sans exposer ses données. Le choix du modèle se fait en partant de vos tâches, de votre matériel et de la licence, puis en testant sur vos cas réels.
Chez Automato, nous sélectionnons, testons et déployons des modèles open source pour construire une IA locale d'entreprise adaptée à vos usages : choix du modèle sur vos propres documents, installation sur votre serveur ou en cloud français, interface pour vos équipes. Vous voulez savoir quel modèle conviendrait à votre activité ? Parlons-en.
30 minutes pour comprendre votre besoin et voir si on peut vous aider. Sans engagement, sans blabla commercial.