Un LLM local en entreprise : matériel, coûts, réalité
Un LLM local demande moins de matériel qu'on ne le croit. L'essentiel est de choisir la bonne taille de modèle pour la tâche.
Traduction produite automatiquement par IA. La version allemande est l'original vérifié par la rédaction.
Faire tourner un modèle de langage en interne est aujourd'hui plus accessible au Mittelstand que le débat ne le laisse penser. De nombreux cas d'usage concrets tournent sur une seule carte graphique professionnelle, pas sur un centre de données. L'erreur coûteuse la plus fréquente n'est pas de manquer de matériel, mais de choisir un modèle trop grand pour une tâche qu'un plus petit accomplit tout aussi bien.
Cet article précise quel matériel supporte quelle taille de modèle, à quoi ressemble le calcul de coût sur trois ans et ce que l'exploitation exige vraiment au quotidien.
01. Le matériel dont un LLM local a réellement besoin
La grandeur décisive est la mémoire graphique, c'est-à-dire le VRAM du GPU. Il détermine quel modèle peut être chargé. Grâce à la quantification, c'est-à-dire une représentation numérique plus économe des poids du modèle, ce besoin diminue nettement, le plus souvent sans perte de qualité perceptible pour des tâches métier.
En gros : un modèle de la classe 7 à 8 milliards tourne, quantifié, sur une carte d'environ 16 à 24 gigaoctets de VRAM. Les modèles autour de 30 milliards de paramètres demandent généralement une carte d'environ 48 gigaoctets. Pour les très grands modèles au-delà de 70 milliards de paramètres, plusieurs cartes deviennent nécessaires. De nombreux cas du Mittelstand restent dans les deux premières classes.
02. Taille du modèle : plus petit suffit souvent
La tentation est grande de prendre le modèle le plus puissant disponible. En pratique, la bonne taille de modèle est fonction de la tâche, pas de l'ambition. Pour la classification, l'extraction depuis des documents ou la réponse à des questions à partir d'une base de connaissances, un modèle plus petit suffit souvent, dès lors qu'un bon retrieval fournit les passages pertinents.
C'est précisément ici que se vérifie le lien que nous avons montré ailleurs : un retriever bien réglé rend un modèle plus petit exploitable et économise du matériel. Jusqu'où portent désormais les modèles ouverts se lit dans les publications récentes, par exemple Kimi K2.7 Code et Nemotron 3 de NVIDIA, disponibles ouvertement et exécutables sur votre propre matériel.
03. Le calcul de coût sur trois ans
Un seul GPU professionnel coûte, selon la classe, un montant à quatre chiffres du milieu au haut de gamme, auxquels s'ajoutent le serveur, l'électricité et l'exploitation. C'est un investissement unique. Face à lui, un service cloud oppose le paiement par requête, qui croît avec l'usage.
La comparaison équitable ne calcule pas le prix du jour, mais le coût total sur deux à trois ans pour votre charge attendue. Sous un usage constant et élevé, le matériel local s'amortit souvent sur cette période. Sous une charge faible ou très fluctuante, le cloud reste généralement plus avantageux. L'arbitrage complet figure dans On-Premise vs Cloud-LLM : quand l'IA locale est le bon choix.
04. Exploitation, maintenance et le test de réalité
Le matériel est la partie visible, l'exploitation la partie sous-estimée. Un modèle local doit être mis à jour, supervisé et sécurisé. Il faut quelqu'un pour déployer les modèles, entretenir la base de données vectorielle et intervenir en cas d'incident. Pour les petites équipes, c'est là le véritable effort, pas l'achat de la carte.
L'avantage : les outils qui travaillent localement et ne transmettent rien vers l'extérieur s'intègrent dans cette architecture. Un exemple tiré de notre propre travail est Graphify, qui transforme localement une base de code en graphe de connaissances, sans que le code ne quitte la machine. De tels composants locaux réduisent l'effort d'exploitation, car ils n'exigent aucun partage de données supplémentaire vers l'extérieur.
05. Un démarrage réaliste
Le point de départ judicieux est petit et concret : un cas d'usage clairement délimité, un modèle de la classe inférieure, un seul GPU et un retrieval proprement configuré. L'équipe y apprend l'exploitation, et l'étape d'extension suivante se décide à partir de l'expérience, pas à partir d'une fiche technique.
Qui veut commencer par le savoir contenu dans les documents trouvera l'architecture adaptée dans Qu'est-ce que le RAG ? Le Retrieval-Augmented Generation expliqué pour le Mittelstand. Pourquoi le contrôle opérationnel sur les modèles compte à long terme figure dans La leçon de souveraineté de Fable 5.

