PublicationsNews · Marché AI

Le prix d'un token dépend désormais de l'heure qu'il est — et le droit d'en changer vient d'être vendu 7 milliards

Le 16 août à 16 h UTC, DeepSeek a remplacé son tarif unique par une grille horaire : le million de tokens de sortie y passe de 1,98 à 3,96 dollars aux heures pleines. Trois jours plus tôt, Google lançait Gemini 3.7 Flash à moitié prix jusqu'au 31 décembre et plein tarif au 1er janvier. Et Stripe a racheté OpenRouter — le péage de 5,5 % que l'on acquitte précisément pour garder la liberté de passer d'un modèle à l'autre.

Gravure noir et blanc : un cadran solaire de pierre colossal dont le style projette une ombre dure sur des lignes horaires gravées, et à son pied un étroit portail de pierre par lequel un large fleuve de grains cristallins lumineux est forcé de passer en un seul filet.

Le 16 août 2026 à 16 h UTC, DeepSeek a cessé d’avoir un prix. L’entreprise a remplacé son tarif unique par une grille horaire : le million de tokens de sortie de V4-Pro est facturé 1,98 $ en heures creuses et 3,96 $ en heures pleines, contre 1,10 $ à plat la veille. Trois jours plus tôt, le 13 août, Google lançait Gemini 3.7 Flash à 0,75 $/3,75 $ — un tarif dont la documentation précise qu’il expire le 31 décembre 2026 pour doubler le 1er janvier 2027. Et le 16 août également, Bloomberg révélait que Stripe rachète OpenRouter pour plus de 7 milliards de dollars : la passerelle qui permet de router une requête vers l’un ou l’autre de 400 modèles, et qui prélève 5,5 % au passage. Trois faits, une même semaine, une même conclusion. Nous écrivions le 10 août que le prix affiché avait cessé d’être une unité de comparaison. Il vient de cesser d’être une constante — et la capacité d’arbitrer entre les grilles vaut désormais plus cher que les grilles elles-mêmes.

Le 16 août à 16 h UTC, DeepSeek a cessé d’avoir un prix

Le préavis datait du 6 août. DeepSeek publiait alors sur sa documentation d’API une notice sans chiffre, sans périmètre et sans date, invitant les développeurs à « planifier leur usage en conséquence » avant une hausse qualifiée de « significative ». Dix jours plus tard, la grille est tombée, et elle ne ressemble à aucune de celles qui l’ont précédée.

Le principe n’est plus un prix par million de tokens, mais deux prix selon l’heure de la journée. Les heures pleines couvrent 01:00–04:00 et 06:00–10:00 UTC, soit sept heures sur vingt-quatre ; le reste du temps s’applique un tarif creux fixé à la moitié du tarif plein.

Modèle DeepSeek Ancien tarif (à plat) Heures creuses Heures pleines
V4-Flash — entrée 0,14 $ 0,22 $ 0,44 $
V4-Flash — sortie 0,28 $ 0,66 $ 1,32 $
V4-Pro — entrée 0,55 $ 0,66 $ 1,32 $
V4-Pro — sortie 1,10 $ 1,98 $ 3,96 $

Les multiples méritent d’être posés, parce qu’ils ne sont pas ceux que les titres retiennent. Sur V4-Flash en sortie, le passage de 0,28 $ à 1,32 $ en heures pleines représente un facteur 4,7. Sur V4-Pro en sortie, le facteur est de 3,6. Même en heures creuses, aucun tarif ne baisse : l’entrée de V4-Flash augmente de 57 %, sa sortie de 136 %, la sortie de V4-Pro de 80 %. Autrement dit, le tarif dit « creux » de la nouvelle grille est supérieur au tarif plein de l’ancienne, dans tous les cas. Un relevé de presse a titré sur une hausse « jusqu’à 1 100 % » ; nous ne reprenons pas ce chiffre, que nous n’avons pas pu rattacher à un couple de prix avant/après vérifiable. Les facteurs ci-dessus, eux, se recalculent ligne à ligne.

La cause avancée est un problème de capacité, et elle est instructive. Un relevé tiers indique que V4-Flash a traité 8 000 milliards de tokens en une seule journée le 1er août — un volume qui a saturé le compute disponible. C’est la mécanique classique d’un bien dont le prix d’appel a dépassé la capacité de production : la file d’attente se forme, et le prix redevient l’instrument qui la régule. DeepSeek n’a pas simplement augmenté ses tarifs ; l’entreprise a introduit le mécanisme par lequel les réseaux électriques et les opérateurs de télécommunication gèrent depuis toujours leurs pointes de charge.

Un point concerne directement une organisation suisse, et il ne figure dans aucun commentaire que nous ayons lu. Les fenêtres sont publiées en temps universel. En août, la Suisse est à UTC+2. La seconde fenêtre de pointe, 06:00–10:00 UTC, correspond donc à 08:00–12:00 en heure suisse — c’est-à-dire, exactement, la matinée de travail. Une organisation qui déclenche ses traitements par lots en arrivant au bureau paie le tarif plein sur toute la plage. La même charge lancée après midi tombe en heures creuses, à moitié prix, jusqu’au petit matin. Sur un poste d’inférence conséquent, le fait de décaler un batch de deux heures n’est plus une optimisation d’ingénieur : c’est une ligne budgétaire.

Un prix qui expire : Gemini 3.7 Flash

Le 13 août, Google publiait Gemini 3.7 Flash, trois semaines seulement après 3.6 Flash. Les gains annoncés sur le périmètre agentique et logiciel sont substantiels : FrontierCode 1.1 à 43,6 % contre 34,4 %, DeepSWE v1.1 à 65,3 % contre 49,0 %, AutomationBench à 30,4 % contre 17,0 %, compréhension documentaire GDP.pdf à 34,0 % contre 22,0 %, et un Elo de 1588 contre 1538 sur Arena.ai WebDev. Sur trois semaines d’écart entre deux versions d’un même modèle de milieu de gamme, la progression est réelle.

Le prix est de 0,75 $ à l’entrée et 3,75 $ en sortie le million de tokens — la moitié du tarif de lancement de 3.6 Flash, et nettement sous Claude Sonnet 5 (2 $/10 $) comme sous GPT-5.6 Terra (2 $/12 $). Mais ce tarif porte une mention que l’on ne trouvait pas, il y a encore un an, sur les pages de prix des fournisseurs : il s’agit d’un tarif d’introduction valable jusqu’au 31 décembre 2026. Au 1er janvier 2027, la grille standard s’applique : 1,50 $ et 7,50 $, soit exactement le double.

L’annonce est honnête — l’échéance est écrite, la valeur future est publiée, personne ne pourra dire qu’il n’était pas prévenu. C’est précisément ce qui la rend intéressante. Une organisation qui sélectionne aujourd’hui Gemini 3.7 Flash sur un critère de coût, qui l’intègre à ses traitements et qui bâtit son budget 2027 sur la ligne qu’elle constate en août se trompe d’un facteur deux, non par erreur d’appréciation, mais parce que le prix qu’elle observe n’est pas celui qu’elle paiera. La décision d’architecture, elle, aura été prise. Et le coût de sortie d’un modèle intégré ne se mesure pas en dollars par million de tokens.

Il faut noter que le mouvement inverse existe aussi. Anthropic avait positionné Claude Sonnet 5 à 2 $/10 $ au titre d’un tarif d’introduction expirant le 31 août 2026 ; ce tarif a été confirmé comme définitif. Le point n’est donc pas que les prix d’appel montent toujours : c’est qu’un prix affiché s’accompagne désormais d’une date de validité, et que cette date fait partie de l’information tarifaire au même titre que le montant.

Stripe paie 7 milliards pour un péage de 5,5 %

C’est l’opération de la semaine, et elle éclaire les deux précédentes. Selon Bloomberg le 16 août, confirmé par plusieurs titres le 17, Stripe a finalisé le rachat d’OpenRouter pour plus de 7 milliards de dollars.

OpenRouter n’entraîne aucun modèle. L’entreprise exploite une API unique donnant accès à plus de 400 modèles de la quasi-totalité des fournisseurs, revendique plus de 8 millions de développeurs, et affichait fin mai un rythme de l’ordre de 1,5 quadrillion de tokens par an. Son revenu annualisé atteignait 140 millions de dollars en juillet 2026, contre 50 millions fin 2025. Son modèle économique tient en une ligne : le prix du modèle est répercuté tel quel, et OpenRouter prélève 5,5 % sur les achats de crédits — 5,0 % en mode « clé propre » au-delà de 25 000 $ mensuels.

Le rapport de valorisation mérite d’être posé sans arrondi. En mai 2026, une série B de 113 millions valorisait OpenRouter 1,3 milliard. Trois mois plus tard, le prix payé dépasse 7 milliards : un facteur 5,4 sur un trimestre. Rapporté au revenu annualisé de juillet, cela représente environ 50 fois le chiffre d’affaires. Nous signalons ici un écart entre sources : plusieurs titres retiennent un multiple de 70×, ce qui suppose une base de revenu proche de 100 millions plutôt que 140. Nous n’avons pas pu trancher entre les deux bases ; l’ordre de grandeur — entre cinquante et soixante-dix fois le revenu — est en revanche cohérent d’une source à l’autre.

La comparaison qui donne son sens à l’opération est ailleurs. Stripe a traité 1 900 milliards de dollars de paiements en 2025 et en a conservé 0,36 %. OpenRouter prélève 5,5 %. Le spécialiste du paiement vient donc d’acheter un taux de prise plus de quinze fois supérieur au sien, sur un flux environ 750 fois plus petit. Une analyse tierce — que nous rapportons comme telle et non comme un chiffre officiel — estime qu’au multiple de revenu de Stripe lui-même (23,4×), justifier 7 milliards suppose environ 299 millions de revenu de commission, soit près de 5,4 milliards de dépense d’inférence annuelle transitant par la plateforme, contre de l’ordre de 2,5 milliards aujourd’hui. Le pari est explicite : le flux doit à peu près doubler.

Ce qu’il faut retenir n’est pas le montant, c’est la nature de ce qui a été acheté. OpenRouter ne vend pas de l’intelligence : il vend la faculté de changer d’avis. Sa valeur d’usage croît exactement dans la mesure où les prix des modèles divergent, se compliquent, expirent et s’indexent sur l’heure. Les trois nouvelles de cette semaine décrivent donc le même objet sous deux angles : d’un côté, des grilles qui deviennent trop mouvantes pour être suivies à la main ; de l’autre, la valorisation à 7 milliards de l’intermédiaire qui les suit à votre place. L’arbitrage entre les modèles est devenu un actif plus rentable que les modèles. Et il vient de changer de propriétaire.

Ce qui n’a pas de prix du tout

Deux annonces de la même semaine complètent le tableau, en rappelant que tout ce qui engage un budget ne s’écrit pas sur une page de tarifs.

Le 13 août, OpenAI a ouvert en préversion Ultrafast, un mode d’exécution de GPT-5.6 Sol adossé aux processeurs wafer-scale de Cerebras, annoncé à environ 750 tokens par seconde — de l’ordre de quatorze fois le débit standard, mesuré autour de 53 tokens par seconde. Pour du vocal temps réel, de la recherche financière interactive ou de la réponse à incident, l’écart change la nature de ce qui est faisable. Mais l’annonce s’arrête là : aucun prix publié, aucune date de disponibilité générale, aucun identifiant de modèle, et un accès sur liste d’attente. Le tarif de Sol reste affiché à 5 $/30 $. Une capacité dont on ignore le prix n’est pas une option d’achat : c’est une intention.

Le 11 août, Anthropic a annoncé le filigranage des sorties textuelles de Claude, en réponse à l’article 50 du règlement européen sur l’IA, entré en application le 2 août 2026. Le marquage biaise subtilement les choix lexicaux du modèle — détectable sur un volume suffisant, et il survit au copier-coller ; les fichiers reçoivent en complément des métadonnées de provenance signées au standard ouvert C2PA. La mesure s’applique mondialement et à l’ensemble des services : application grand public, API, Claude Code, Cowork, ainsi que les accès via AWS, Google Cloud et Microsoft Foundry. Aucun effet annoncé sur la qualité, la vitesse ou le prix. C’est bien là le point : voici une contrainte de conformité qui modifie la nature du livrable produit, et qui n’apparaît sur aucune grille tarifaire.

Enfin, le socle matériel continue d’aller à contre-courant du discours sur la déflation. Le H200 se loue autour de 3,99 $/heure à la demande et 1,99 $ en spot chez un fournisseur de référence, avec un plancher de marché à 1,34 $ et des points hauts jusqu’à 13,78 $ selon l’opérateur. Le B200 s’établit entre 7 et 10 $ le GPU-heure chez la plupart des clouds — et 16,11 $ sur l’offre publique à la demande de Google Cloud. Surtout, la médiane à la demande a progressé d’environ 34 % en un an, de 5,75 à 7,67 $ le GPU-heure. Le prix du token de texte baisse pour certains modèles ; le prix de l’heure de calcul qui le produit, lui, monte.

Tableau comparatif des prix

Modèle Input ($/M tokens) Output ($/M tokens) Note
GPT-5.6 Sol (OpenAI) 5.00 30.00 mode Ultrafast (Cerebras, ~750 tok/s) en préversion depuis le 13.08 — sans prix publié
GPT-5.6 Terra (OpenAI) 2.00 12.00 −20 % le 30.07
GPT-5.6 Luna (OpenAI) 0.20 1.20 −80 % le 30.07
Claude Opus 5 (Anthropic) 5.00 25.00 filigranage des sorties depuis le 11.08, sans effet tarifaire annoncé
Claude Sonnet 5 (Anthropic) 2.00 10.00 tarif d’introduction confirmé définitif ; échéance du 31.08 levée
Claude Haiku 4.5 (Anthropic) 1.00 5.00
Gemini 3.7 Flash (Google) 0.75 3.75 lancé le 13.08 · tarif d’introduction jusqu’au 31.12.2026 → 1.50 / 7.50 au 01.01.2027
Grok 4.6 (xAI) 2.00 6.00 lancé le 12.08 · contexte 500K · 4.00 / 12.00 au-delà de 200K tokens, facturés sur la requête entière ; variante Fast au double
Mistral Large 2.00 6.00
DeepSeek V4-Pro 0.66 creux · 1.32 pleines 1.98 creux · 3.96 pleines grille horaire depuis le 16.08 16:00 UTC · pointes 01–04 h et 06–10 h UTC
DeepSeek V4-Flash 0.22 creux · 0.44 pleines 0.66 creux · 1.32 pleines idem · antérieurement 0.14 / 0.28 à plat

Prix vérifiés le 18 août 2026 — sources : pages tarifaires officielles et relevés datés des deux dernières semaines. Les tarifs DeepSeek dépendent de l’heure UTC de la requête ; les tarifs Gemini 3.7 Flash et les modes Ultrafast sont susceptibles de changer à une date déjà annoncée ou non encore publiée.

Ce que cela signifie pour une organisation suisse

Trois lectures, dans l’ordre où elles engagent une décision.

D’abord, un budget bâti sur un prix affiché est un budget bâti sur une variable. La semaine écoulée fournit trois mécanismes distincts par lesquels la ligne que vous constatez aujourd’hui cessera d’être celle que vous paierez : l’heure de la requête chez DeepSeek, le calendrier chez Google, et l’absence pure et simple de tarif chez OpenAI pour une capacité déjà démontrée. Aucun de ces trois mécanismes n’est une hausse déguisée ; tous sont publiés. Mais aucun ne se laisse capturer par une comparaison de grilles à un instant donné. La conséquence pratique est modeste et immédiate : dans toute évaluation de fournisseur, la question « combien » doit être doublée de « jusqu’à quand, et à quelles heures ». Et pour une organisation suisse, la vérification la plus rentable de la semaine tient en une conversion horaire — la fenêtre chère de DeepSeek, ce sont vos matinées.

Ensuite, la portabilité est devenue un actif que quelqu’un peut vous facturer. Le raisonnement qui consiste à passer par une passerelle pour ne dépendre d’aucun fournisseur est juste, et il a un prix : 5,5 % de la dépense d’inférence, soit un multiple de quinze du taux que le même acquéreur prélève sur les paiements. Ce péage n’est pas illégitime — il rémunère un service réel, et il coûte moins cher que de réécrire une intégration. Mais il vient d’être valorisé 7 milliards par un acteur du paiement, ce qui indique assez clairement dans quel sens la marge est appelée à évoluer. Pour une fiduciaire, une étude d’avocats ou un gestionnaire de fortune, deux questions en découlent : qui détient concrètement votre capacité de changer de modèle, et par quelles mains transitent vos requêtes avant d’atteindre le fournisseur. La seconde n’est pas une question de coût.

Enfin, la seule grandeur restée stable est celle que vous mesurez chez vous. Le prix par million de tokens dépend désormais de l’heure, de la date et de l’intermédiaire ; le débit s’annonce sans tarif ; la conformité impose des marquages qui ne figurent sur aucune facture. Ce qui demeure mesurable est ce qui se passe dans votre système : quelle tâche a été exécutée, par quel modèle, à quelle heure, via quel intermédiaire, pour quel coût réellement constaté. Une organisation qui instrumente cela conserve la faculté de déplacer une charge quand la grille bouge — et de constater qu’elle a bougé. Une organisation qui lit des pages de tarifs compare des nombres dont la durée de validité n’est plus garantie.

Comoto OS · Noyau cognitif souverain

Maîtrisez vos coûts d'IA au lieu de les subir. Comoto OS orchestre les meilleurs modèles du marché depuis un noyau souverain hébergé en Suisse : chaque tâche routée vers le modèle au bon rapport coût/capacité, chaque token tracé et mesuré en coût réel par tâche — et la faculté de déplacer une charge, ou de changer de modèle, qui reste chez vous plutôt que chez un intermédiaire qui la facture.

Découvrir Comoto OS
Accès anticipé

Lisez nos prochains papers en avant-première.

Certains articles sont réservés. Laissez votre e-mail pour débloquer l'accès aux prochaines publications de Meotis Research.