NeuralOS
Modelos

Inkling : Thinking Machines Lab ouvre son premier modèle, un MoE multimodal de 975 milliards de paramètres

Thinking Machines Lab a publié Inkling, son premier modèle : un Mixture-of-Experts multimodal de 975 milliards de paramètres au total qui n'en active que 41 milliards par token, avec 1M de contexte et entraîné sur 45 000 milliards de tokens de texte, image, audio et vidéo. Des poids open-weights sur Hugging Face et un cadran d'« effort de réflexion » réglable qui décide, pour chaque requête, combien le modèle raisonne et combien cela coûte.

EN
Equipo NeuralOS
Radar de IA
Jul 15, 20265 min read
In short

Thinking Machines Lab a publié Inkling, son premier modèle ouvert : un Mixture-of-Experts multimodal de 975B paramètres au total / 41B actifs, avec 256 experts routés (6 actifs par token), 1M de contexte et un entraînement sur 45 000 milliards de tokens de texte, image, audio et vidéo. Les poids sont en open-weights sur Hugging Face, il tourne sur la plateforme Tinker, et il intègre un « effort de réflexion » réglable pour équilibrer qualité et coût par token.

Pendant des années, l'expression « modèle ouvert vraiment puissant » venait avec ses réserves : soit c'étaient de tout petits modèles qui faisaient la queue loin derrière les modèles fermés, soit c'étaient des poids cachés derrière une API et une liste d'attente. C'est pourquoi le 15 juillet a fait lever tant de sourcils quand Thinking Machines Lab — le laboratoire de recherche fondé par Mira Murati, ex-CTO d'OpenAI, avec l'une des équipes techniques les plus chères de la planète — a publié Inkling, son premier modèle, et a lâché les poids complets sur Hugging Face en open-weights, en plus de le faire tourner sur sa plateforme Tinker et sur les API de partenaires. Pas une démo avec une jolie capture d'écran : les poids, à télécharger et à faire tourner sur votre propre infrastructure. Quand un laboratoire de ce calibre choisit de commencer par l'ouvert, le geste en lui-même est déjà l'événement.

## Un quasi-billion de paramètres qui tient dans votre budget

Inkling est un Mixture-of-Experts (MoE) multimodal de 975 milliards de paramètres au total, mais — et c'est là toute la magie du MoE — il n'en active que 41 milliards pour chaque token qu'il traite. L'analogie utile : chaque couche dispose de 256 spécialistes routés sous contrat (plus quelques-uns toujours de garde), mais pour chaque token elle n'en réveille que les six nécessaires ; vous payez le calcul de six, pas de deux cent cinquante-six. Ajoutez un contexte allant jusqu'à 1 million de tokens, un entraînement sur 45 000 milliards de tokens de texte, images, audio et vidéo, et une variante en preview plus légère — Inkling-Small, 276B au total / 12B actifs — pour ceux qui n'ont pas besoin du vaisseau amiral. C'est le genre d'architecture qui rend un modèle énorme, paradoxalement, exploitable en pratique.

## Le levier que presque personne ne regarde : l'effort réglable

Ce qu'il y a de plus intéressant pour qui construit, ce ne sont pas les paramètres, c'est un détail plus subtil : Inkling permet de contrôler combien il « réfléchit » avant de répondre, pour équilibrer performance et consommation de tokens. Ses créateurs eux-mêmes l'illustrent avec une donnée concrète : il égale Nemotron 3 Ultra sur Terminal Bench 2.1 en utilisant environ un tiers des tokens. Traduit en facture : chaque token que le modèle raisonne en trop, c'est de l'argent qui sort de votre compte, et ici vous pouvez décider pour chaque requête si la tâche mérite le mode profond ou si la réponse rapide suffit. C'est un cadran qualité-contre-coût placé entre vos mains. Et le laboratoire ne cache pas la nuance honnête : ils disent sans détour qu'Inkling « n'est pas le modèle le plus puissant disponible aujourd'hui, ouvert ou fermé », mais une bonne base ouverte à personnaliser et affiner. Cette sincérité, sur un marché accro à proclamer sa supériorité à chaque benchmark, fait du bien.

## Pourquoi l'« open-weights » change le point de départ

Que les poids soient disponibles au téléchargement, c'est la différence qui fait le titre. Combinez cela avec un MoE qui n'active « que » 41B de paramètres par token et avec des checkpoints prêts pour le matériel moderne — dont une version NVFP4 pour une inférence efficace sur les systèmes NVIDIA Blackwell — et soudain une petite équipe peut envisager de faire tourner un modèle quasi-billion sur sa propre infrastructure, ou de l'affiner sur son domaine via Tinker, sans rester attachée à une API fermée. Cela ne remplace pas les modèles de frontière pour tout — les auteurs eux-mêmes l'admettent — mais cela redéfinit le point de départ de ce qu'une équipe modeste peut avoir sous son contrôle et dans son budget. Il convient toutefois de vérifier les conditions d'utilisation exactes sur la fiche du modèle sur Hugging Face avant de le porter en production commerciale.

## Ce que cela signifie pour qui construit avec l'IA

La leçon de fond d'Inkling, c'est que l'avantage concurrentiel se déplace du « quel modèle j'ai » vers le « comment je le gouverne ». Un effort de réflexion réglable n'est pas un truc de benchmark : c'est exactement le genre de levier dont dépend qu'un produit avec IA soit rentable ou qu'il se dévore ses marges token après token. Chez NeuralOS, nous pensons à partir de cette arithmétique silencieuse — c'est pourquoi les cost guardrails (budgets par utilisateur, plafonds par workspace, streaming pour interrompre tôt) font partie de la conception et non d'un extra optionnel. Et par conviction nous sommes model-agnostic : un modèle ouvert comme Inkling entre dans la même conversation qu'un modèle fermé de frontière, parce qu'on choisit le moteur par tâche sans se marier à aucun. Sans fumée : nous ne promettons pas de servir Inkling clé en main aujourd'hui. Ce qui fait bel et bien partie de la conception, c'est la discipline de décider combien réfléchit — et combien coûte — chaque requête.

Share
Ready to build?

Start building in
under 3 minutes

Join 4,200+ builders. No credit card. Build your first app with AI in minutes.