EN
en direct
tag

#inference

OpenRouter garantit la résidence américaine des requêtes vers les modèles chinois

Les modèles open-weight représentent 60 % de la consommation de tokens d’OpenRouter aux États-Unis, pour la plupart chinois. La place de marché lance en disponibilité générale le routage in-region américain, qui garantit que les requêtes sont déchiffrées, traitées et servies sur le sol américain — ou rejetées.

OpenAI lance l’API Agents et fait du harnais de Codex un service

OpenAI a ouvert en bêta publique le 10 septembre 2026 une API Agents qui vend le backend de Codex comme service, pour faire tourner des agents sans surveillance pendant des jours. Le même jour, l’éditeur gelait les inscriptions à son plan Pro face à la demande de GPT-6 Astra : le goulot d’étranglement se déplace des modèles vers l’infrastructure.

AWS signe avec Qualcomm pour des puces d’inférence custom et des optiques à 1,6 Tbps

Le 8 septembre 2026, Amazon Web Services annonce un partenariat avec Qualcomm pour du silicium custom d’inférence IA et des interconnexions optiques à 1,6 Tbps, pour un engagement commercial pouvant atteindre 60 milliards de dollars d’ici septembre 2036. Un signal fort sur la diversification de la chaîne d’approvisionnement silicium d’AWS — et sur le goulot d’étranglement réel des clusters d’IA : le réseau.

Stripe rachète OpenRouter pour plus de 7 milliards et prend le contrôle du péage de l’IA

Le 16 août 2026, Bloomberg rapporte que Stripe a conclu le rachat d’OpenRouter, la passerelle qui donne accès à plus de 400 modèles d’IA, pour plus de 7 milliards de dollars. L’acquisition place le routage et la facturation de l’inférence entre les mains d’un acteur de paiement — un signal de consolidation à surveiller pour qui construit sur de multiples modèles.

Le homelab 2026 franchit le cap de l’IA locale — les modèles légers rendent l’inférence privée accessible sur un budget Raspberry Pi

En août 2026, l’écosystème du self-hosted vit une mutation silencieuse mais décisive : les modèles de langage compacts (Gemma 3 1B, Llama 4 3B quantifié, Qwen 3 0.5B) permettent désormais de faire tourner une IA conversationnelle locale sur du matériel grand public. Voici ce qui est réaliste aujourd’hui, ce qui ne l’est pas encore, et comment démarrer sans exploser votre facture électrique.

Tapez au moins deux caractères.

↑ ↓ naviguer ↵ ouvrir esc fermer