Tech & open source14 min de lectureVérifié le 26 août 2026

Self-host un LLM : coûts, matériel, limites

Self-host un LLM : VRAM, GPU, location cloud. Ordres de grandeur sourcés (Mistral, NVIDIA, AWS), pas de prix inventés.

Open sourceLLMSelf-hostingSécuritéPrix
Petit boîtier d’atelier à côté d’une baie serveur trop grande : deux échelles de self-host
Dans cet article
  1. En une phrase
  2. 1. Trois self-host, pas un
  3. 2. Ce que les fiches exigent (pas un banc Kervia)
  4. 3. Cartes et instances : capacités, pas des prix boutique
  5. 4. Un prix cloud sourcé : et ce qu’il n’est pas
  6. 5. Les limites que la VRAM ne dit pas
  7. 6. Grille PME, sans théâtre
  8. Ce qu’il faut retenir
  9. Limites
  10. Sources

On vous dit : « on le met chez nous, ça coûtera moins cher, et les devis ne sortent plus. »

Trois promesses collées. Aucune n’est vraie parce que vous avez tapé ollama run.

Self-host un LLM, ce n’est pas un bouton. C’est une taille de modèle, une quantité de mémoire GPU, un endroit où tourne l’inférence, et quelqu’un qui maintient le bazar. Les poids ouverts vous donnent le droit de télécharger. Ils ne paient pas la carte. Ils ne tiennent pas tout seuls dans le local de l’atelier.

Ici : des ordres de grandeur lus sur des pages officielles le 21 août 2026. Pas un devis Kervia. Pas un tarif électricité romand inventé. Pas « le meilleur GPU 2026 ».

En une phrase

Self-hoster un LLM, pour une PME, c’est faire tourner l’inférence sur une machine que vous opérez (PC, serveur, ou GPU cloud loué) et en payer le matériel, le temps, et les limites (VRAM, contexte, concurrence), pas le seul zip du modèle.

1. Trois self-host, pas un

Le mot mélange trois meubles.

A. Chez vous, petit modèle. Un PC, parfois une carte grand public. Ollama, sur ollama.com, promet des modèles ouverts sur votre ordinateur et dans le cloud, y compris hors-ligne. Le runtime s’appuie sur llama.cpp (inférence C/C++, local ou cloud). Pratique pour un chat interne. Ce n’est pas « on a un GPT souverain ».

B. Un GPU que vous louez et que vous pilotez. Toujours du self-host logiciel : vLLM, TGI, votre Docker. La machine n’est plus dans l’atelier. AWS décrit ses instances P5 : 1× H100 / 80 Go HBM3 (p5.4xlarge) ou 8× H100 / 640 Go (p5.48xlarge). Les textes passent chez l’hébergeur.

C. Un nœud entier. Mistral documente Large 3 en FP8 sur un nœud de B200 ou H200, en NVFP4 sur un nœud de H100 ou A100, servi avec vLLM et --tensor-parallel-size 8. DeepSeek, dans le README d’inférence V4-Pro relu ce run, part sur MP=8 et torchrun --nproc-per-node ${MP}. Ce n’est plus le portable du comptable.

L’agent et le runtime open source sont un autre étage. Ici, on parle du modèle qui calcule les tokens.

ATELIER Petit modèle local ex. 12 Go VRAM FP8 1 GPU LOUÉ Vous opérez encore 1× H100 · 80 Go NŒUD Large / V4-Pro 8 GPU · vLLM TP=8

2. Ce que les fiches exigent (pas un banc Kervia)

Consultation 21 août 2026. Affirmations éditeurs, pas des mesures faites dans notre local.

Modèle (fiche) Ce qui est écrit Conséquence PME
Ministral 3 8B Instruct (Apache 2.0) Tient en 12 Go de VRAM en FP8, moins si on quantifie encore. Contexte 256k. vLLM recommandé. La card dit aussi que les Instruct 3B / 8B / 14B FP8 peuvent tourner sur 1× H200. Premier self-host plausible. Chat interne, brouillons, description de documents que vous avez le droit de lui montrer.
Llama 4 Scout (Meta, 5 avril 2025) 17 milliards de paramètres actifs, 16 experts, 109 milliards au total. Meta écrit qu’il tient sur un NVIDIA H100. Fenêtre annoncée à 10 millions de tokens (pré-entraîné à 256k). Un H100 n’est pas une carte gaming. Licence communautaire : lire l’article open weights, pas ce billet.
Mistral Large 3 675 B au total, 41 B actifs. On-prem : FP8 nœud B200/H200 ; NVFP4 nœud H100/A100. Serveur vLLM : --tensor-parallel-size 8. L’éditeur note un déploiement complexe sur ressources contraintes. Projet infra. Pas le premier mois.
DeepSeek-V4-Pro 1,6 T totaux, 49 B activés, contexte 1 M. Le dossier inference de ce run lance avec MP=8. Même étage que Large 3 : plusieurs GPU, pas un plugin.

vLLM se présente comme un moteur d’inférence à haut débit, avec PagedAttention pour gérer la mémoire des clés/valeurs, plus des quantifs (FP8, INT8, INT4, GGUF…). Hugging Face TGI documente une image Docker optimisée sur H100, A100, A10G, T4 (CUDA 12.2+) ; sur les autres NVIDIA, le batching continue, pas forcément flash / paged attention.

Ollama, côté matériel, liste les GPU NVIDIA à compute capability 5.0+ et driver 550 ou plus (doc GPU). Sa FAQ : contexte par défaut 4096 tokens ; un modèle peut être 100 % GPU, 100 % CPU, ou coupé. Exemple affiché : llama3:70b à 42 Go. Le cache K/V peut passer en 8 bits (~½ mémoire) ou 4 bits (~¼) si Flash Attention est actif : qualité à tester, dit Ollama, pas nous.

Le plafond « 256k » ou « 10 M » de la card n’est pas le contexte que vous servirez demain matin. Mistral le dit pour vLLM : --max-model-len vaut 262144 par défaut, « quite large but not necessary for most scenarios ». Baisser, ça préserve la mémoire.

3. Cartes et instances : capacités, pas des prix boutique

Encore des fiches, pas le ticket d’un magasin de Nyon.

NVIDIA, page GeForce RTX 4090 : 24 Go de mémoire G6X, 450 W de Total Graphics Power, alimentation système 850 W. Architecture Ada Lovelace. C’est une carte gaming / création, documentée comme telle.

NVIDIA, blog Hopper (2022, toujours la référence architecture) : le H100 SXM5 « supports 80 GB of HBM3 ». La table de comparaison A100/H100 du même article liste un TDP à 700 Watts pour un H100 (à côté de 400 W / 350 W selon la variante). AWS, sur P5, aligne : 80 Go HBM3 par H100, 640 Go sur 8 GPU, 1128 Go HBM3e sur 8× H200 (p5e / p5en).

4. Un prix cloud sourcé : et ce qu’il n’est pas

Les prix boutique GPU et le kWh romand : non extraits ce run, donc non inventés.

En revanche AWS publie des tarifs Capacity Blocks for ML (réservation de capacité GPU, pas la grille On-Demand). Page relue le 21 août 2026 : aws.amazon.com/ec2/capacityblocks/pricing.

Instance Accélérateur Région citée Tarif horaire (fourni AWS) × 24 h (calculé)
p5.4xlarge 1× H100 Europe (Londres) 4,720 USD/h 113,28 USD
p5.4xlarge 1× H100 US East (N. Virginia) 5,191 USD/h 124,58 USD
p5.48xlarge 8× H100 Europe (Londres) 37,76 USD/h 906,24 USD
p5e.48xlarge 8× H200 Europe (Londres) 47,76 USD/h 1 146,24 USD

Étiquette : horaire = fourni par AWS Capacity Blocks. Colonne 24 h = calculée (horaire × 24), pour un ordre de grandeur « une journée machine allumée ». Ce n’est pas un forfait mensuel, pas du franc suisse, pas l’On-Demand, pas un devis Kervia. Pas de région Suisse dans le tableau P5 relu ce run (Londres / Stockholm côté Europe).

À 4,72 USD de l’heure, un H100 n’est pas « moins cher qu’un abonnement chat » en soi. Ça dépend si vous le faites tourner deux heures pour un batch, ou 24 h/24 pour un agent. La facture API, elle, suit les tokens. On ne les additionne pas ici : jetons API non tarifés dans ce billet (autre article de file, plus tard).

L’électricité existe. NVIDIA documente 450 W (TGP 4090) et jusqu’à 700 W (TDP H100 dans la table Hopper). On s’arrête là. Aucun CHF/an : le tarif du réseau romand n’a pas été lu ce run.

5. Les limites que la VRAM ne dit pas

Rentrer les poids ≠ servir l’équipe. La VRAM avale les paramètres et le cache d’attention. Plus le contexte et le batch montent, plus ça gonfle. Ollama le montre : contexte défaut 4096, pas 256k. vLLM : raccourcir --max-model-len pour garder de la mémoire. Un Scout « 10 M de tokens » sur la plaquette Meta n’est pas le budget d’une PME le lundi.

Quantifier n’est pas gratuit. Ministral : « less if further quantized ». Ollama : 8 bits ≈ ½, 4 bits ≈ ¼ sur le cache K/V, si Flash Attention, et « you may need to experiment ». Moins de mémoire, qualité à vérifier sur vos textes, pas sur un tweet.

CPU possible, lent. Ollama charge en 100 % CPU si besoin (ou GPU invalide). Ça démarre. Ça ne fait pas un nœud H200.

Pilotes, Docker, mises à jour. TGI veut le NVIDIA Container Toolkit. Ollama NVIDIA : driver 550+. Après une veille Linux, Ollama documente même un fallback CPU si le GPU disparaît (nvidia_uvm). Quelqu’un doit relancer. Ce quelqu’un a un coût, même sans facture GPU.

Cloud GPU ≠ atelier suisse. Louer un p5.4xlarge à Londres, c’est self-host du logiciel, pas « les données restent à Vevey ». Open weights + API étrangère, on l’a déjà dit : ce n’est pas un coffre-fort local.

Le modèle n’est pas l’agent. Un Ministral local qui bavarde n’ouvre pas vos mails tout seul. Pour l’étage outils / mémoire / canaux : panorama agents OSS.

6. Grille PME, sans théâtre

Aucun % d’adoption romande ici : inconnu.

Situation Piste honnête Ce qu’on ne promet pas
Premier essai, documents internes peu sensibles, une personne qui bricole Petit modèle local (ordre Ministral 8B / 12 Go FP8, Ollama ou vLLM). Cadre : par où commencer. « On a ChatGPT chez nous. »
Besoin d’un plus gros modèle, quelques heures par semaine, cadre données OK hors atelier Location Capacity Blocks (horaire sourcé ci-dessus) ou équivalent que vous opérez. 1× H100 si la fiche le permet (Scout : 1× H100 selon Meta). Un prix annuel. Une souveraineté suisse.
Large 3, V4-Pro, plusieurs utilisateurs, SLA Nœud 8 GPU, vLLM, astreinte. Rarement le premier chantier. Un plugin Chrome.
Les devis n’ont pas le droit de quitter le pays, et personne n’a le temps GPU API cadrée ou pas de LLM. Le self-host mal tenu fuit autant qu’une API mal choisie. Que le mot « local » suffise au RGPD / LPD. Voir données clients et IA.

Trois questions, dans l’ordre, avant d’acheter une carte :

  1. Ai-je le droit ? Licence : article open weights.
  2. Où va le texte, vraiment ? Machine nommée, pays nommé.
  3. Est-ce que ça tient : poids et contexte et deux utilisateurs en parallèle ? La fiche 12 Go ne dit pas le troisième.

Si la réponse à 3 est « on verra bien », vous n’êtes pas en self-host. Vous êtes en démo.

Ce qu’il faut retenir

Idée Formule
Self-host Vous opérez l’inférence. Pas un synonyme d’open weights.
Petit Ministral 8B : 12 Go VRAM FP8 (éditeur)
Carte gaming RTX 4090 : 24 Go G6X, 450 W TGP (NVIDIA)
Datacenter H100 : 80 Go HBM3 ; P5 8× : 640 Go (AWS / NVIDIA)
Gros Large 3 / V4-Pro : nœud, TP=8 / MP=8 (fiches)
Prix lu ici Capacity Blocks, USD/h, 21 août 2026, pas On-Demand, pas CHF
Limite VRAM ≠ contexte ≠ utilisateurs ≠ maintenance

Limites

  • Sources relues le 21 août 2026. Une card, un tarif AWS, un driver, ça bouge.
  • Pas de prix magasin GPU, pas de kWh romand, pas de jetons API : absents de l’extraction, donc absents du texte comme faits.
  • Capacity Blocks ≠ On-Demand ≠ Spot. On cite la page relue, pas « le prix AWS du H100 » en général.
  • 12 Go, 1× H100, nœud H200 : affirmations éditeurs, pas un labo Kervia.
  • Superlatifs Meta / Mistral / DeepSeek : pas repris comme médaille.
  • TDP 700 W : table du blog Hopper A100/H100 ; on n’en déduit pas une facture.
  • Ce n’est pas un avis d’avocat, ni un dimensionnement pour votre dossier.

Sources

  1. Mistral : Ministral 3 8B Instruct 2512 · Mistral Large 3 675B Instruct 2512 · Models overview · Self-deploy vLLM · consultation 21 août 2026
  2. Meta : The Llama 4 herd (5 avril 2025)
  3. DeepSeek : V4-Pro README · inference/README.md
  4. NVIDIA : RTX 4090 · Hopper architecture in-depth
  5. AWS : EC2 P5 instances · Capacity Blocks pricing
  6. Ollama : ollama.com · Hardware / GPU · FAQ · README
  7. vLLM : README · Hugging Face TGI + NVIDIA
  8. llama.cpp : README
  9. Kervia : open weights · agents OSS · chat vs agent

QUESTIONS FRÉQUENTES

Pour aller à l’essentiel.

Combien de VRAM faut-il pour self-host un LLM ?

Ça dépend du modèle, pas du mot « self-host ». Mistral documente Ministral 3 8B Instruct comme tenant en 12 Go de VRAM en FP8 (moins si on quantifie encore). Meta écrit que Llama 4 Scout tient sur un NVIDIA H100. Mistral Large 3 se déploie en FP8 sur un nœud de B200 ou H200, en NVFP4 sur un nœud de H100 ou A100. Un chiffre unique n’existe pas.

Self-host un LLM, est-ce moins cher qu’une API ?

Pas automatiquement. Le self-host déplace le coût : carte ou location GPU, électricité, drivers, mises à jour, supervision. AWS Capacity Blocks (pas l’On-Demand) liste un p5.4xlarge (1× H100) à 4,720 USD/h en Europe (Londres), consulté le 21 août 2026. Une API facture des jetons. Les deux factures ne se comparent pas sans le volume, le cadre données, et qui maintient la machine.

Un PC avec RTX 4090 suffit-il ?

NVIDIA documente la GeForce RTX 4090 avec 24 Go de mémoire G6X et 450 W de « Total Graphics Power ». C’est une carte grand public, pas un nœud datacenter. Elle peut accueillir un petit modèle (l’ordre de grandeur 12 Go de Ministral 8B FP8 rentre). Elle ne fait pas un Mistral Large 3 ni un DeepSeek-V4-Pro tels que leurs fiches les déploient.

Si je loue un GPU dans le cloud, mes textes restent-ils en Suisse ?

Non, pas par magie. Self-host veut dire que *vous* opérez l’inférence. Si la machine est à Londres, en Virginie ou chez un hébergeur, les textes y passent. Licence open weights et lieu du traitement sont deux questions. Voir aussi open weights vs self-host.

CONTINUER À EXPLORER

Articles liés