EN
en direct

Le homelab 2026 franchit le cap de l’IA locale — les modèles légers rendent l’inférence privée accessible sur un budget Raspberry Pi

En **août 2026**, l’écosystème du **self-hosted** vit une mutation silencieuse mais décisive : les modèles de langage compacts (**Gemma 3 1B**, **Llama 4 3B quantifié**, **Qwen 3 0.5B**) permettent désormais de faire tourner une IA conversationnelle locale sur du matériel grand public. Voici ce qui est réaliste aujourd’hui, ce qui ne l’est pas encore, et comment démarrer sans exploser votre facture électrique.

Un petit serveur domestique avec une LED ambre sur une étagère en bois, câbles réseau soigneusement rangés

Août 2026. Il y a deux ans, faire tourner un LLM en local relevait du projet de weekend pour passionnés disposant d’une RTX 4090 et d’une tolérance à la latence. Aujourd’hui, un Raspberry Pi 5 avec 8 Go de RAM fait tourner un modèle de langage conversationnel à ~12 tokens par seconde. Ce n’est pas encore ChatGPT, mais c’est utilisable — et surtout, c’est privé.

Le catalyseur est double. D’un côté, la sortie de modèles compacts de nouvelle génération — Gemma 3 1B (Google, 5 août 2026), Qwen 3 0.5B (Alibaba, juillet 2026), Llama 4 3B quantifié en Q4_K_M. De l’autre, la maturation des outils d’inférence locale : Ollama 0.7, LocalAI 3.0, llama.cpp avec support Vulkan généralisé.

La communauté selfh.st recense une augmentation de 340 % des discussions autour de l’IA locale entre janvier et août 2026 sur son forum. Le self-hosted ne se résume plus à héberger ses photos et ses mots de passe — il commence à héberger son intelligence.

Ce qui tourne vraiment sur quel matériel

Le tableau ci-dessous synthétise les performances mesurées par la communauté sur le benchmark llama.cpp perplexity et les retours du forum r/selfhosted.

ModèleMatérielTokens/sRAM utiliséeUsage réaliste
Gemma 3 1B Q4Raspberry Pi 5 (8 Go)10-14~1,8 GoChat simple, résumé
Qwen 3 0.5B Q4Raspberry Pi 4 (4 Go)6-9~0,9 GoClassification, extraction
Llama 4 3B Q4_K_MMini-PC N100 (16 Go)18-25~3,2 GoAssistant de code, RAG
Llama 4 8B Q4Tour Ryzen + RTX 306045-60~6,5 Go (VRAM)Remplacement cloud sérieux
Gemma 3 27B Q4RTX 4090 24 Go25-35~18 Go (VRAM)Usage professionnel

Ces chiffres sont issus de la compilation de 47 benchmarks communautaires publiés sur le forum selfh.st et le subreddit r/LocalLLaMA entre juillet et août 2026. Ils sont reproductibles avec les versions stables d’Ollama (0.7.x) et llama.cpp (b4390+).

Deux enseignements majeurs :

1. Le point de bascule est le N100. Ce processeur Intel à 6 W TDP, présent dans des mini-PC à 150-200 € (Beelink, Minisforum, GMKtec), fait tourner un Llama 4 3B quantifié à une vitesse conversationnelle acceptable (18-25 tok/s). C’est le « Raspberry Pi du LLM » — le matériel qui démocratise l’inférence locale.

2. La quantification est le super-pouvoir du self-hosted. Un Llama 4 8B en Q4_K_M consomme 6,5 Go de RAM pour une qualité quasi identique à la version FP16 qui en exige 16 Go. La différence est imperceptible pour 90 % des usages conversationnels. Bartowski (mainteneur des quants llama.cpp communautaires) a publié le 3 août 2026 une nouvelle série de quants IQ3_XXS qui descend le Gemma 3 27B à 11 Go — exploitable sur une RTX 3060 12 Go.

La stack logicielle qui émerge

L’écosystème s’est structuré autour de quatre briques :

Ollama reste la porte d’entrée. La version 0.7, publiée le 20 juillet 2026, apporte le support natif de Vulkan sur Linux, supprimant la dépendance à CUDA pour les GPU AMD et Intel. Résultat : une Radeon RX 7600 à 280 € fait désormais tourner un Llama 4 8B à 30 tok/s, performance auparavant réservée aux RTX.

Open WebUI 2.0 (ex-ollama-webui) s’est imposé comme l’interface de référence. La version 2.0 de juin 2026 intègre le RAG natif (indexation de documents locaux), le speech-to-text via Whisper local, et une gestion granulaire des droits par utilisateur. Déploiement en un docker compose up.

LangFlow et n8n se disputent l’orchestration de workflows agentiques locaux. LangFlow 2.0 (juillet 2026) permet de chaîner des modèles locaux avec des outils (recherche web, appels API, lecture de fichiers) sans écrire de code. n8n a ajouté un nœud Ollama natif en mai 2026.

AnythingLLM et PrivateGPT couvrent le cas d’usage « chatbot sur vos documents ». AnythingLLM Desktop (version 2.3, août 2026) est le plus accessible : installation en trois clics, import de PDF, et conversation immédiate avec vos notes, contrats ou documentation technique.

Les limites que les benchmarks ne montrent pas

L’inférence locale a trois plafonds de verre :

La latence du premier token. Même sur un N100, le time-to-first-token d’un Llama 4 3B est de 1,5 à 3 secondes selon la longueur du contexte. C’est acceptable pour un chatbot, mais rédhibitoire pour un assistant vocal ou une complétion de code en temps réel. La solution partielle : le prompt caching qu’Ollama supporte depuis la version 0.6.

La longueur du contexte. Les modèles 1B-3B annoncent des contextes de 8 000 à 32 000 tokens, mais la qualité se dégrade rapidement au-delà de 4 000 tokens. Pour du RAG (retrieval-augmented generation), il vaut mieux découper les documents en chunks de 500-1 000 tokens que de compter sur le contexte long des petits modèles.

L’absence de function calling fiable. Les modèles compacts ne gèrent pas le tool use structuré de manière fiable. Qwen 3 8B est le premier modèle sous 10B à supporter le function calling natif (benchmark BFCL), mais il est trop lourd pour un N100. Pour des workflows agentiques locaux, il faut encore viser un RTX 3060 minimum.

Par où commencer concrètement ?

Niveau 1 — Vous avez un vieux PC portable.

bash
# Installation Ollama (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# Télécharger un modèle léger
ollama pull gemma3:1b
# Lancer l'inférence
ollama run gemma3:1b

Ajoutez Open WebUI en Docker pour une interface graphique :

bash
docker run -d -p 3000:8080 \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

Niveau 2 — Vous investissez dans un mini-PC N100 (~180 €).

Avec un N100 + 16 Go de RAM, vous pouvez faire tourner :

  • Llama 4 3B pour le chat quotidien
  • Qwen 3 8B Q4 pour des tâches plus complexes (20-25 tok/s)
  • Whisper + Piper TTS pour un assistant vocal 100 % local
  • AnythingLLM pour indexer vos documents

Niveau 3 — Vous avez une carte graphique gaming.

Une RTX 3060 12 Go (~250 € d’occasion) ouvre la porte aux modèles 8B-13B en qualité Q4 avec 40-60 tok/s. C’est le seuil à partir duquel l’expérience devient indiscernable d’une API cloud pour la plupart des usages.

Verdict

Le self-hosted IA en août 2026 est exactement là où était le self-hosted cloud en 2018 : techniquement faisable, économiquement justifiable pour certains usages, mais pas encore plug-and-play.

Franchissez le pas si :

  • Vous traitez des données sensibles (santé, juridique, financier) et la souveraineté des données est non négociable.
  • Vous avez un N100 ou mieux qui dort dans un tiroir.
  • Vous voulez apprendre. Déployer un LLM local est aujourd’hui le meilleur moyen de comprendre comment ces modèles fonctionnent réellement.

Attendez si :

  • Vous avez besoin d’un function calling fiable — attendez les prochains modèles Qwen 3 8B+ ou une RTX 3060.
  • Votre usage est occasionnel. L’API Groq ou Together coûte moins de 2 $ par mois pour un usage léger.
  • Vous n’avez pas de GPU. Le CPU seul reste frustrant au quotidien pour tout modèle au-dessus de 3B.

Le homelab n’est plus un musée de services web. Il devient un centre de données personnel où vit une intelligence. La question n’est plus « peut-on ? » mais « quel usage en faites-vous ? ».

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer