EN
en direct
IA

Nemotron 3.5 Lightning atteint la performance d’un modèle 120B avec 3,6 Md de paramètres actifs

Le 11 août 2026, NVIDIA a publié Nemotron 3.5 Lightning, un modèle MoE ouvert de 31,6 Md de paramètres (3,6 Md actifs) qui atteint l’Intelligence Index d’un modèle 120B tout en servant près de 670 tokens par seconde. Pour les charges agentiques à fort volume, c’est un levier concret de réduction de coût.

Un petit serveur compact avec une seule LED ambre posé au milieu de hautes armoires serveur gris anthracite.

11 août 2026. NVIDIA publie Nemotron 3.5 Lightning, le premier modèle de la famille Nemotron 3.5. 31,6 milliards de paramètres au total, 3,6 milliards actifs, un Intelligence Index de 24 — le même que gpt-oss-120b, un modèle quatre fois plus gros — et près de 670 tokens par seconde sur un endpoint DeepInfra de pré-sortie.

La thèse de NVIDIA est limpide : on n’a plus besoin d’un modèle frontal pour chaque appel d’un agent. Un petit modèle spécialisé, routé intelligemment, suffit pour la majorité des tâches à fort volume.

Un bond de +9 points sans changer l’architecture

Nemotron 3.5 Lightning succède à Nemotron 3 Nano 30B A3B et en conserve l’ossature : l’architecture hybride Mamba-Transformer en mixture-of-experts (MoE), avec 3,6 milliards de paramètres actifs sur 31,6 milliards au total. Rien de neuf côté structure — tout le gain vient du post-entraînement.

Le résultat est pourtant net. Sur l’Intelligence Index d’Artificial Analysis, le modèle passe de 15 (Nano) à 24, un bond de +9 points, se hissant au niveau de gpt-oss-120b (24) et juste derrière Nemotron 3 Super (26), un modèle environ quatre fois plus gros. La quantification NVFP4 est quasi sans perte : 24 sur l’index contre 24 en BF16.

C’est le signal le plus intéressant du moment pour l’IA ouverte : le progrès ne vient plus de la taille brute, mais de la qualité du post-entraînement sur une base compacte et efficace.

Le saut agentique

Le gain le plus spectaculaire se mesure sur les tâches agentiques. Sur GDPval-AA v2, le modèle atteint un Elo de 824, dépassant à la fois Nemotron 3 Super et gpt-oss-120b. Sur Terminal-Bench v2.1, il passe à 24 %, soit plus de trois fois les 7 % de Nemotron 3 Nano, et presque au niveau de gpt-oss-120b.

Concrètement : un modèle de la taille d’un « petit » exécute des séquences de code review, d’appels d’outils, de tri d’alertes de sécurité et de réponses de facturation avec la fiabilité qu’on réservait aux modèles frontaux. NVIDIA a post-entraîné la version avec des partenaires comme CodeRabbit et Harvey pour renforcer les domaines métier — la facilité d’entraînement étant précisément l’argument de la famille.

La fenêtre de contexte atteint 1 million de tokens, ce qui ouvre les charges longues : revue de dépôts entiers, sessions d’agent multi-étapes, suivi de logs volumineux.

La vitesse change l’économie

Le critère qui sépare un modèle de démonstration d’un modèle de production, c’est le temps par tâche. Nemotron 3.5 Lightning traite une tâche de l’Intelligence Index en environ 0,5 minute — contre ~3,5 minutes pour Qwen3.6 35B A3B, ~3,4 minutes pour gpt-oss-120b et ~5,8 minutes pour Gemma 4 31B.

Le moteur de cette vitesse est double : un débit de sortie élevé — près de 670 tokens/s mesurés sur l’endpoint DeepInfra de pré-sortie — et une efficacité token comparable à celle de Nano. Le modèle produit autant de tokens par tâche que son prédécesseur, tout en délivrant +9 points d’intelligence.

Pour un opérateur qui facture à l’usage, l’équation est directe : un modèle qui répond sept fois plus vite qu’un concurrent de taille comparable, à qualité égale ou supérieure, divise la facture de la charge par un facteur du même ordre. La licence OpenMDW-1.1, permissive et sans restriction commerciale matérielle, lève le dernier frein à l’auto-hébergement.

Pour un auto-hébergeur, le calcul se précise encore. Un modèle NVFP4 de cette taille tient sur un GPU de capacité modeste, là où un 120B exige plusieurs accélérateurs. Le gain ne se limite pas au coût par token : il porte aussi sur le matériel nécessaire pour servir la charge en local, et donc sur le seuil à partir duquel l’auto-hébergement devient rentable face au serverless.

Où se situe Lightning dans la famille Nemotron

Nemotron 3 se décline en trois tailles : Nano (petit), Super (moyen) et Ultra (grand). Lightning s’insère comme une variante spécialisée du bas de gamme : il reprend le gabarit de Nano mais vise un usage précis — l’exécution de tâches spécialisées à fort volume dans des agents de longue durée.

La logique du MoE est au cœur de l’argument. Sur 31,6 Md de paramètres, seuls 3,6 Md sont actifs à chaque token. Le modèle stocke donc la connaissance d’un gros modèle, mais n’en calcule qu’une fraction à chaque inférence. C’est ce qui permet à la fois un coût d’inférence faible et un débit élevé, sans sacrifier la capacité de connaissance.

NVIDIA pousse cette logique jusqu’au bout en publiant des quantifications FP8 et NVFP4 quasi sans perte, et en fournissant les recettes d’entraînement — pas seulement les poids. L’objectif affiché : laisser chaque équipe post-entraîner le modèle sur ses propres tâches, pour en faire un executor sur mesure.

Switchyard : router vers le bon modèle

NVIDIA ne positionne pas Lightning comme un modèle unique. Il s’intègre dans NeMo Switchyard, un mécanisme de routage intelligent entre modèles : les tâches à fort volume — exécution spécialisée, revue de code, surveillance d’alertes — partent vers Lightning, tandis que la planification complexe reste réservée aux modèles frontaux.

C’est le motif architectural qui se généralise dans l’agentique : un planner cher et puissant, un executor compact et rapide, et un routeur qui répartit. Lightning occupe précisément la case de l’executor — celle où le volume d’appels domine et où le coût marginal compte le plus.

Les poids sont disponibles immédiatement, en BF16, FP8 et NVFP4, avec une inférence serverless chez DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius et Crusoe.

Des limites assumées

Le modèle reste textuel — pas d’image ni d’audio — et sur l’intelligence pure, des concurrents de taille comparable le devancent : Qwen3.6 35B A3B (32) et Muse Glimmer (35) sur l’Intelligence Index. Les modèles propriétaires conservent aussi l’avantage sur la frontière d’efficacité globale : Gemini 3.5 Flash-Lite atteint 37 pour un temps par tâche comparable.

Lightning ne cherche pas à gagner le classement d’intelligence brute. Il optimise un point précis de la frontière : l’intelligence par dollar et par seconde sur des tâches agentiques spécialisées. C’est un choix de positionnement, pas une faiblesse — mais il faut le lire comme tel avant de l’adopter pour des charges de raisonnement généraliste.

Verdict

Si vous exploitez des charges agentiques à fort volume — revue de code, appels d’outils, tri d’alertes, questions métier répétitives — Nemotron 3.5 Lightning mérite un essai immédiat via un fournisseur serverless, avant même d’envisager l’auto-hébergement. Le rapport qualité/vitesse/coût sur ces tâches est aujourd’hui l’un des meilleurs du marché ouvert.

Si vous avez besoin de raisonnement généraliste ou multimodal, restez sur des modèles plus gros ou multimodaux : Lightning est un executor spécialisé, pas un planner généraliste. Couplé à Switchyard, il prend tout son sens ; isolé, il vous laissera sur votre faim hors de son domaine de prédilection.

Le signal de fond : la course ne se joue plus sur le nombre de paramètres, mais sur le post-entraînement et le routage. Un modèle de 3,6 Md de paramètres actifs qui égale un 120B sur les tâches agentiques, à un septième du temps, redessine la carte de ce qu’il est rentable d’auto-héberger.

Références

Le brief cyber, chaque mardi

Les failles qui comptent, les correctifs à appliquer, en dix minutes de lecture.

Pas de spam. Désinscription en un clic.
à lire ensuite

Sur le même sujet

Qwen est devenu le socle de l’open source et les likes ne prédisent plus l’adoption

Le rapport d’été de Hugging Face documente un écosystème à deux vitesses : les laboratoires chinois dominent le plafond des tailles pendant que Qwen accumule 151 448 modèles dérivés et que les petits modèles portent l’essentiel des téléchargements. Pour choisir un modèle en 2026, mesurez l’adoption, pas l’attention.

Stripe rachète OpenRouter pour plus de 7 milliards et prend le contrôle du péage de l’IA

Le 16 août 2026, Bloomberg rapporte que Stripe a conclu le rachat d’OpenRouter, la passerelle qui donne accès à plus de 400 modèles d’IA, pour plus de 7 milliards de dollars. L’acquisition place le routage et la facturation de l’inférence entre les mains d’un acteur de paiement — un signal de consolidation à surveiller pour qui construit sur de multiples modèles.

← Retour au fil

Tapez au moins deux caractères.

naviguer ouvrir esc fermer