EN
en direct

Votre propre ChatGPT tourne dans votre salon pour le prix de deux ans d’abonnement

En 2026, Ollama et Open WebUI permettent de faire tourner un LLM chez soi sans diplôme d’ingénieur. Un Mac Mini M4 avec 24 Go de RAM unifiée fait tourner du 32B en Q4, et le point mort face à un abonnement ChatGPT Plus se situe entre 18 et 36 mois selon la machine choisie.

Votre propre ChatGPT tourne dans votre salon pour le prix de deux ans d’abonnement — illustration ETTAYEB

Février 2026, Ollama franchit 166 000 étoiles GitHub et devient le plus gros projet open-source d’IA au monde. Mars 2026, le moteur MLX débarque dans Ollama et double les performances sur les puces Apple Silicon. Avril 2026, un Llama 4 quantifié en Q4 tourne sur un Mac Mini M4 à 1 229 € et répond mieux qu’un ChatGPT Plus à 20 $ par mois sur les tâches courantes. La question n’est plus « est-ce que ça marche ? » mais « est-ce que ça vaut le coût ? ».

La réponse dépend du matériel que vous êtes prêt à acheter. Un Mac Mini M4 avec 24 Go de RAM unifiée coûte 1 229 € chez Apple et fait tourner confortablement des modèles jusqu’à 32 milliards de paramètres en quantification Q4_K_M. Avec un abonnement ChatGPT Plus à 20 $/mois (environ 18 €/mois en France) et Claude Pro au même tarif, le point mort se situe entre 18 et 36 mois selon que vous couplez ou non les deux abonnements. Passé ce seuil, le self-hosting devient moins cher — et vos données ne quittent plus votre réseau local.

Ollama — le standard qu’on n’attendait pas

Ollama est un moteur d’inférence écrit en Go, distribué sous licence MIT, qui fait tourner des LLM en une seule commande. Pas d’environnement Python, pas de dépendances CUDA, pas de fichier de configuration. L’installation tient en une ligne, le lancement d’un modèle en une autre :

bash
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3.2

Le projet s’appuie sur llama.cpp, le moteur C/C++ de Georgi Gerganov qui a démocratisé l’inférence sur matériel grand public via la quantification. En février 2026, l’équipe ggml/llama.cpp a rejoint Hugging Face, ce qui garantit une maintenance de long terme au format GGUF — le seul que la quasi-totalité de l’écosystème local utilise.

Ollama expose une API compatible OpenAI sur localhost:11434. Concrètement, n’importe quel code écrit pour l’API OpenAI fonctionne avec Ollama en changeant l’URL de base. Claude Code et OpenAI Codex CLI peuvent l’utiliser comme backend local, et l’API Anthropic est également émulée depuis 2026. Le registre de modèles intégré dépasse la centaine de modèles prêts à l’emploi (ollama pull), et les fonctionnalités de recherche web et de sorties structurées ont été ajoutées courant 2026.

Un bémol : Ollama ne gère nativement que le format GGUF. Les modèles au format safetensors ou PyTorch nécessitent un Modelfile pour la conversion, ce qui ajoute une étape. Et il n’y a pas d’interface graphique : c’est là qu’Open WebUI entre en jeu.

Le matériel qui fait vraiment la différence

Le seul paramètre qui détermine ce que vous pouvez faire tourner, c’est la mémoire — VRAM sur une carte NVIDIA, mémoire unifiée sur Apple Silicon. Le reste (fréquence CPU, bande passante mémoire) joue sur la vitesse. La mémoire joue sur le fait que le modèle démarre ou non.

En quantification Q4_K_M (4,5 bits par paramètre en moyenne), la règle est simple : 0,56 Go par milliard de paramètres, plus 1 à 2 Go de marge pour le cache KV et le système. Voici ce que ça donne en pratique :

Mémoire disponibleTaille max (Q4_K_M)Modèles représentatifsUsage8 Go7-8BLlama 3.1 8B, Gemma 4 12B (limite)Chat, RAG, code simple16 Go14-20BQwen3 14B, Mistral Small 22B (Q4 serré)Développement quotidien24 Go32BQwen3 32B, Llama 3 32BTravail sérieux, refactoring48 Go70BLlama 3.1 70B, Qwen2.5 72BStation de travail64 Go+70B + contexte longLlama 3.1 70B avec 32K tokens de contexteApple Silicon haut de gamme

Trois écosystèmes matériels comptent en 2026.

Apple Silicon — le meilleur rapport qualité/prix au-dessus de 32B. La mémoire unifiée permet au GPU et au CPU de partager le même pool physique sans goulet PCIe. Le Mac Mini M4 avec 24 Go à 1 229 € fait tourner un 32B en Q4 sans broncher. Le Mac Mini M4 Pro 48 Go à 2 429 € monte jusqu’au 70B. Avec le moteur MLX intégré à Ollama depuis mars 2026, les performances sur Apple Silicon ont doublé par rapport au chemin GGUF/llama.cpp historique — on atteint 40 à 70 tokens/seconde sur un 7B.

NVIDIA — le choix par défaut sous les 32B. La gamme RTX 50xx Blackwell est intégralement supportée par Ollama. La RTX 4060 Ti 16 Go (~449 $) fait tourner du 14B, la RTX 4090 24 Go (~1 599 $) du 32B, la RTX 5090 32 Go (~1 999 $) du 45B+. Deux RTX 4090 en parallèle atteignent 48 Go pour un Llama 70B en Q4, mais la communication inter-cartes ajoute de la latence.

CPU seul — le plan B. Un processeur récent avec 32 à 64 Go de RAM DDR5 peut faire tourner un 7B-13B à 5-10 tokens/seconde. C’est lent mais ça fonctionne, et c’est le seul scénario qui ne nécessite aucun achat si vous avez déjà une machine avec suffisamment de RAM.

Open WebUI — l’interface qui transforme Ollama en ChatGPT

Open WebUI est une application web open-source qui se place devant Ollama et fournit une interface ChatGPT-like complète : fils de discussion persistants, changement de modèle à la volée, RAG sur documents, reconnaissance vocale, comptes multi-utilisateurs. Un conteneur Docker suffit :

bash
docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui --restart always \
  ghcr.io/open-webui/open-webui:main

Premier point d’attention : le premier compte créé devient administrateur. Sur un réseau partagé, créez-le immédiatement. Deuxième point : Ollama n’a aucune authentification. N’exposez jamais le port 11434 sur Internet ; passez par Open WebUI, qui gère ses propres comptes et rôles, et placez un reverse proxy avec TLS devant.

Le RAG (retrieval-augmented generation) intégré est le vrai facteur différenciant : chargez des PDF, des notes, de la documentation dans un espace Workspace → Knowledge, puis interrogez-les en conversation avec #nom-collection. L’embedding se fait par défaut avec nomic-embed-text (à récupérer via ollama pull nomic-embed-text). Le tout reste local — rien ne sort de votre machine.

Le vrai coût face aux abonnements

Prenons trois configurations réalistes et comparons-les à la facture mensuelle d’un utilisateur qui paie ChatGPT Plus (20 $/mois, soit environ 216 €/an) et éventuellement Claude Pro (20 $/mois supplémentaires).

Configuration 1 — entrée de gamme (CPU). Un PC existant avec 32 Go de RAM DDR5. Coût additionnel : 0 €. Modèles : 7B-13B en Q4, 5-10 tok/s. Point mort : immédiat. Mais l’expérience reste frustrante pour du travail sérieux.

Configuration 2 — Mac Mini M4 24 Go. 1 229 €. Modèles : jusqu’à 32B en Q4, 40-70 tok/s sur 7B. Point mort : 68 mois face à un seul abonnement ChatGPT Plus, 34 mois si vous couplez ChatGPT et Claude. En pratique, le Mac Mini sert aussi de machine de bureau — son coût n’est pas entièrement imputable au LLM.

Configuration 3 — Mac Mini M4 Pro 48 Go. 2 429 €. Modèles : jusqu’à 70B en Q4. Point mort : 135 mois (11 ans) face à ChatGPT seul, 68 mois (5,7 ans) face aux deux abonnements. Cette machine n’a de sens que si vous avez besoin des 70B pour du travail avancé — codebase entière, analyse de longs documents, tâches agentiques complexes.

Le calcul brut cache une donnée importante : ChatGPT Plus plafonne l’usage (environ 160 messages GPT-5.5 toutes les 3 heures en 2026). En local, vous n’avez aucune limite de requêtes. Pour un développeur qui envoie plusieurs centaines de prompts par jour via l’API ou l’interface, la contrainte de quota est au moins aussi pesante que le coût.

Ajoutez l’électricité : un Mac Mini M4 consomme environ 25 watts en charge, soit une vingtaine d’euros par an en France au tarif réglementé. C’est négligeable.

Le verdict

Prenez un Mac Mini M4 24 Go si vous voulez remplacer ChatGPT pour des tâches de développement quotidiennes — complétion de code, explication de logs, rédaction de mails techniques, recherche documentaire locale — et que vous êtes prêt à investir 1 200 € maintenant plutôt que de payer 20 $/mois indéfiniment. Le point mort est à moins de 3 ans avec un seul abonnement, moins de 2 ans si vous en avez deux.

Montez sur le M4 Pro 48 Go si vous travaillez avec des codebases complètes (plusieurs centaines de milliers de lignes), avez besoin d’un contexte de 32K tokens ou plus, ou voulez faire tourner du 70B. Le surcoût se justifie uniquement si votre usage dépasse ce qu’un 32B peut absorber.

Restez sur abonnement si vous utilisez un LLM moins de 10 heures par semaine, avez besoin de la recherche web native de ChatGPT, générez des images, ou voulez le modèle le plus performant à chaque instant. Claude Pro et ChatGPT Plus donnent toujours accès aux modèles frontier — Claude 4, GPT-5.5 — qu’aucun modèle local n’égale en raisonnement pur. Le self-hosting est un compromis entre confidentialité, coût à long terme et absence de limites ; ce n’est pas un remplacement à capacité égale.

Un dernier chiffre pour relativiser : Ollama a été téléchargé plus de 100 millions de fois en 2026. Le self-hosting de LLM n’est plus un hobby de niche. C’est une option que tout RSSI ou responsable infrastructure doit avoir évaluée, ne serait-ce que pour savoir à quel moment la bascule devient rentable.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Immich remplace Google Photos dès qu’on a un NAS et une sauvegarde hors site

Immich publie sa version 3.0 le 2 juillet 2026, neuf mois après sa première version stable et un mois après le bilan de ses deux ans sous l’aile de FUTO. Il remplace Google Photos à condition d’investir dans un mini PC et d’organiser une vraie sauvegarde hors site : sans cette discipline, la bascule est un pari perdant.

Coolify met un Vercel gratuit sur votre serveur en une commande

Coolify publie sa version 4.2.0 le 21 juillet 2026, trois jours avant cet article. Ce PaaS open-source déploie vos apps, vos bases de données et 280 services en un clic sur n’importe quel serveur Linux — sans facture au Go ni limite de bande passante.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer