EN
en direct
IA

Perplexity lance son agent local sur Windows et exige 24 Go de VRAM

Perplexity porte son agent Portable Computer sur Windows après Linux et macOS, mais le réserve aux cartes NVIDIA RTX dotées d’au moins 24 Go de VRAM. Les tâches simples tournent en local, le modèle bascule vers le cloud quand il en a besoin — et les données sensibles peuvent rester sur la machine.

Une carte graphique de bureau logée dans une tour sombre, une seule LED d’état ambre allumée sur son tranchant.

25 août 2026. Perplexity lance Portable Computer, la version locale de son agent Computer, sur Linux et sur la station NVIDIA DGX Spark. Début septembre. Une variante hybride arrive sur les Mac Apple Silicon, partageant les tâches entre modèle local et cloud. 14 septembre 2026. La version Windows sort, disponible dans l’application Perplexity sur les GPU NVIDIA GeForce RTX et RTX PRO. Pourquoi c’est important : c’est la première fois qu’un agent conversationnel grand public à autonomie multi-étapes s’installe sur un PC de bureau, avec une contrainte qui change tout — il faut 24 Go de VRAM.

Ce que fait réellement Portable Computer

Portable Computer n’est pas un simple lanceur de modèle. Des outils comme LM Studio ou Ollama font tourner un LLM en local, mais s’arrêtent avant de lui confier un travail en plusieurs étapes. Perplexity emballe, lui, tout ce qu’il faut pour qu’un agent agisse : un modèle post-entraîné, un navigateur intégré, l’appel d’outils et son bac à sable propriétaire SPACE.

Sur Windows, l’application embarque deux modèles optimisés pour les GPU RTX : PPLX 27B, le modèle post-entraîné maison de Perplexity, et Qwen 3.8 27B. L’agent peut ouvrir des fichiers, naviguer, déclencher des outils et enchaîner les étapes sans intervention humaine — tant que la carte graphique tient la charge.

Le prérequis matériel est sévère. Il faut une carte NVIDIA avec au moins 24 Go de VRAM, ce qui exclut la majorité des cartes grand public et réserve la version locale aux RTX 3090, RTX 4090, aux RTX PRO et aux stations de travail. Sur une RTX 4060 à 8 Go, Portable Computer ne se lance pas.

Trois plateformes en moins de trois semaines

La vitesse du déploiement mérite qu’on s’y arrête. En moins de vingt jours, Perplexity a couvert trois cibles très différentes :

  • Linux + DGX Spark, le 25 août, pour les développeurs et les stations dédiées ;
  • Apple Silicon, une semaine plus tard, avec un mode hybride qui répartit les tâches entre le moteur local et les modèles cloud sur Mac ;
  • Windows, le 14 septembre, le plus gros réservoir d’utilisateurs grand public.

Chaque portage a exigé plus qu’une recompilation. Perplexity a dû adapter le moteur d’inférence, l’orchestration, la sécurité et l’intégration matérielle à chaque plateforme tout en gardant une expérience identique. Le fait que l’équipe y soit parvenue en trois semaines indique que l’infrastructure d’agents est devenue le vrai champ de bataille — un point que confirme DeepSeek, qui recrute depuis peu environ 150 postes, presque tous dédiés à l’infrastructure d’agents plutôt qu’au modèle lui-même.

« Local » ne veut pas dire « isolé »

Le terme « local » est trompeur si on le lit mal. Portable Computer n’est pas un système air-gapped. L’agent peut se connecter à des services distants parce qu’il embarque des connecteurs pour Microsoft Outlook, OneDrive, Word, Google Drive, Gmail, Slack et GitHub. Une tâche menée localement peut traiter des fichiers sans les envoyer à un modèle cloud, mais dès que l’agent a accès à la fois aux fichiers locaux et aux API distantes sur la même machine, la frontière devient floue.

C’est là qu’intervient l’architecture hybride. Perplexity n’affirme pas qu’un modèle de 27 milliards de paramètres sur un GPU de bureau peut tout faire. Quand l’agent estime qu’une tâche exige plus de raisonnement que le modèle local ne peut en fournir, il bascule vers les modèles cloud de Perplexity. Selon NVIDIA, l’agent signale quand un passage au cloud serait utile et demande la permission à l’utilisateur avant d’envoyer la moindre donnée hors de la machine.

Pour une organisation qui manipule des données sensibles ou réglementées, cette séparation change la donne. L’agent peut dépouiller du code source ou des états financiers sans les téléverser vers un modèle hébergé pour un traitement de base. Et il y a un argument de coût : les tâches réalisées en local ne consomment pas de crédits Computer de Perplexity.

Le modèle économique et la suite

Portable Computer est inclus dans Perplexity Pro à 20 dollars par mois et dans Max à 200 dollars par mois, en offres individuelles comme entreprise. Le support de la station NVIDIA DGX Station est annoncé pour plus tard. La vraie difficulté n’est pas technique, elle est de transformer les agents locaux de projets de passionnés en outils fiables pour l’entreprise — et en les intégrant directement dans Windows, Perplexity les met d’emblée devant la masse d’utilisateurs nécessaire pour y parvenir.

Le signal à retenir dépasse Perplexity. DeepSeek embauche massivement sur l’infrastructure d’agents, OpenAI pousse son API Agents, et maintenant un agent local autonome arrive sur le système d’exploitation le plus répandu au monde. La course ne porte plus sur la taille des modèles, mais sur la couche qui leur donne les moyens d’agir.

Un terrain disputé entre lanceurs et orchestrateurs

Le positionnement de Portable Computer se comprend mieux si on le place entre deux familles d’outils. D’un côté, les lanceurs de modèles — LM Studio, Ollama — font tourner un LLM en local sans jamais lui confier d’autonomie. De l’autre, les plateformes d’agents cloud — l’API Agents d’OpenAI, les agents Claude d’Anthropic — offrent l’autonomie multi-étapes mais conservent l’exécution et les données côté serveur. Portable Computer tente de prendre le meilleur des deux : enchaîner les tâches sans faire sortir le contenu des fichiers de la machine.

Le recrutement de DeepSeek confirme que la difficulté n’est plus le modèle. Les quelque 150 postes ouverts visent presque tous l’infrastructure d’agents — orchestration, mémoire, outils, bac à sable — et non le LLM lui-même. C’est un signal fort : la valeur se déplace du poids du modèle vers la couche qui lui donne les moyens d’agir.

Un exemple rend la promesse tangible. Imaginons une analyse de données sur un tableur confidentiel. En local, l’agent ouvre le fichier, nettoie les colonnes et calcule des agrégats — le document ne quitte jamais la machine. Si une étape exige un raisonnement plus lourd, l’agent signale qu’il souhaite basculer vers le cloud et demande l’autorisation. L’utilisateur peut refuser et garder la tâche en local, au prix d’une réponse plus limitée.

Verdict

Portable Computer sur Windows est une démonstration sérieuse de ce que devient un agent local, mais son prérequis de 24 Go de VRAM en fait pour l’instant un produit de stations de travail et de machines haut de gamme.

Si vous possédez une RTX 3090, 4090 ou une carte PRO, la version locale vaut l’essai : les tâches simples restent sur votre machine et ne brûlent pas de crédits, avec bascule explicite vers le cloud quand c’est nécessaire. Si votre parc est constitué de machines à 8 ou 12 Go de VRAM, n’espérez rien : la porte est fermée, et il faudra soit passer par le mode hybride Mac, soit attendre un modèle plus compact. Si vous traitez des données réglementées, le point décisif n’est pas la puissance, c’est la règle de permission : vérifiez que l’escalade vers le cloud est bien bloquée par défaut avant de laisser un agent toucher vos fichiers.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Qwen3.8-Max publie ses poids, mais pas sous licence Apache 2.0

Le 12 août 2026, Alibaba a mis en ligne les poids de Qwen3.8-Max, un modèle MoE de 2,4 billions de paramètres, sous une licence maison à seuils de revenus plutôt que sous Apache 2.0. Avant de déployer, lisez les clauses : le checkpoint est textuel et la revente au-delà d’un seuil devient payante.

OpenAI ouvre GPT-Live-1, la voix full-duplex qui délègue le raisonnement à un autre modèle

Le 10 septembre, OpenAI a porté GPT-Live-1 dans son API : un modèle vocal full-duplex qui tient la conversation et délègue les questions lourdes à un backend de raisonnement. Pour les équipes qui construisent des agents vocaux, le gain est mesurable — moins 80 % de code chez un client — mais il se paie en dépendance à la plateforme.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer