PublicationsNews · Marché AI

Le tarif le moins cher du marché ne se paie plus en argent : Meta facture son agent de code douze fois moins cher contre le droit d'entraîner sur votre code

Le 5 août, Meta a lancé Muse Code avec deux grilles pour le même modèle — 1,25 $/4,25 $ si Meta ne touche pas à vos données, 0,10 $/0,20 $ s'il peut s'en servir pour entraîner ses modèles. La même semaine, le prix de la vidéo générative augmentait de 53 % et le GPU-heure H200 dépassait son niveau de l'an dernier de 25 %. Le prix affiché a cessé d'être une unité de comparaison.

Gravure noir et blanc : une balance de pierre colossale au fléau désaxé, dont un plateau porte un cube de métal massif et l'autre débordé de grains cristallins lumineux qui s'écoulent par-dessus le bord dans l'obscurité.

Le 5 août 2026, Meta a publié en bêta Muse Code, un agent de code en terminal adossé à son modèle Muse Spark 1.2, et s’est ainsi installé face à Claude Code, Codex et Gemini CLI. L’événement n’est pas l’agent : c’est sa grille tarifaire. Meta propose le même modèle à deux prix. Le tarif dit Standard est facturé 1,25 $ à l’entrée et 4,25 $ en sortie le million de tokens, et Meta n’utilise ni les requêtes ni les réponses. Le tarif dit Contributor est facturé 0,10 $ et 0,20 $ — environ douze fois moins cher à l’entrée et vingt et une fois moins cher en sortie — et Meta se réserve le droit d’utiliser vos requêtes et les réponses produites pour entraîner ses futurs modèles. Autrement dit, la ligne la moins chère du marché sur le segment des agents de code n’est pas un prix en argent : c’est un troc. Et pendant la même semaine, deux autres prix partaient dans la direction inverse de celle que tout le monde commente : la vidéo générative de ByteDance augmentait de 53 %, et le GPU-heure H200 s’établissait 25 % au-dessus de son niveau d’août 2025.

Ce que Meta a mis sur le marché le 5 août

Muse Code est un agent de code en ligne de commande, disponible en bêta précoce sur macOS et Linux, dont la caractéristique différenciante annoncée est la gestion d’agents d’arrière-plan asynchrones persistants — des tâches qui survivent à la session qui les a lancées. Le modèle qui l’alimente, Muse Spark 1.2, succède à Muse Spark 1.1, la première API payante de Meta, que nous relevions à 1,25 $/4,25 $ dans notre grille du 2 août. Le tarif Standard de la version 1.2 reprend exactement ces montants, avec l’entrée mise en cache à 0,15 $.

La nouveauté est le second palier. Le point d’accès muse-spark-1.2-contributor est facturé 0,10 $ à l’entrée, 0,002 $ pour l’entrée mise en cache et 0,20 $ en sortie. La contrepartie est explicite dans les conditions publiées : les requêtes et les complétions peuvent être utilisées pour améliorer les modèles de Meta. Le rabais n’est pas marginal — il place Muse Spark 1.2 sous DeepSeek V4 Flash (0,14 $/0,28 $) et à égalité d’entrée avec Ministral 3 3B, c’est-à-dire dans la zone des modèles les moins chers du marché, pour un modèle qui joue dans une autre catégorie de capacité.

Trois restrictions accompagnent ce tarif, et elles comptent autant que le prix. Le débit autorisé est de 60 requêtes par minute contre 3 000 sur le palier Standard, soit un facteur cinquante. Les quotas s’apprécient sur une fenêtre glissante de cinq heures. Et l’accès est limité à une liste de pays sélectionnés, non détaillée dans les documents de lancement. Meta indique par ailleurs commencer à accepter des demandes de rétention de données nulle, présentée comme une fonctionnalité destinée aux entreprises ; les conditions tarifaires entreprise, les remises de volume et les engagements de service ne figurent pas dans les documents de lancement et relèvent d’une négociation commerciale.

Un point mérite d’être signalé pour ce qu’il est : une information rapportée, non confirmée par la documentation que nous avons pu lire directement. Plusieurs guides tiers publiés autour du 5 août affirment que Muse Code s’installe par défaut sur le palier Contributor, et qu’il faut donc une action explicite pour basculer sur Standard. Nous n’avons pas trouvé cette mention dans les supports de lancement eux-mêmes, et nous ne la reprenons pas comme un fait établi. Mais la conséquence pratique est indépendante de sa vérification : toute organisation qui déploie cet outil doit vérifier le palier actif avant d’ouvrir un dépôt de code client, parce que la question ne se pose pas dans l’autre sens. Un réglage qui décide si le code d’un mandant part ou non dans un pipeline d’entraînement n’est pas un paramètre de confort.

Le benchmark a perdu son unité en même temps que le prix

La performance annoncée illustre le même problème de commensurabilité. Meta revendique 82,9 % au Terminal-Bench 2.1 pour Muse Code sur Muse Spark 1.2 — mesuré sur son propre harnais d’évaluation. Au 6 août, Muse Spark 1.2 ne figurait pas sur le classement vérifié de Terminal-Bench. Les évaluations indépendantes de Vals le placent 5ᵉ à l’indice Vals, pour un coût de 0,69 $ par test, mais 14ᵉ au Terminal-Bench mesuré sur harnais commun. Un relevé tiers résume l’écart d’une formule utile : sur les 6,7 points gagnés par Muse Spark 1.2 au Terminal-Bench, deux survivent à un harnais constant.

La comparaison avec la concurrence est à prendre avec la même prudence, parce que les classements publiés ne se recoupent pas. Un relevé donne GPT-5.6 Sol à 89,5 % et Claude Opus 5 à 89,1 % ; un autre, sur données vérifiées, donne Sol à 85,77 %, Opus 5 à 84,64 % et Kimi K3 à 80,90 %. Nous ne tranchons pas : l’écart de près de quatre points sur les mêmes modèles indique que ces chiffres circulent sans harnais commun, et aucun ne doit être cité comme une mesure absolue. Le seul énoncé robuste est celui-ci, et il vient de la lecture des supports de Meta : Claude Opus 5 est devant sur tous les tableaux que Meta a choisi de montrer, y compris sur celui que Meta a construit et contrôle. Un fournisseur qui publie un comparatif où il perd vend autre chose que la performance. Ici, il vend le prix — et le prix, sur le palier qui fait la différence, se paie en données.

À l’autre extrémité, les prix montent

Le récit dominant du marché est celui d’un effondrement continu des prix. Il est exact sur le token de texte, et faux partout ailleurs. Deux contre-exemples datent de cette semaine.

Le premier est la vidéo générative. Seedance 2.5 de ByteDance, dont l’API a ouvert le 7 août 2026, est facturé 52,9 % plus cher par token que Seedance 2.0 sans entrée vidéo, et 48,8 % plus cher avec. Sur des exemples appariés de cinq secondes, l’écart réel ressort à environ +45 % en 480p et +52 % en 720p. Le tarif s’établit à 10,97 $ le million de tokens de sortie, soit, sur la grille du Volcano Engine, 70 yuans le million de tokens facturables sans entrée vidéo et 42 yuans avec. La facturation ne porte que sur la vidéo produite : les requêtes textuelles, l’image de première trame et les images de référence sont gratuites. Et l’éventail de résolutions publié s’est resserré — Seedance 2.0 annonce 480p, 720p, 1080p et 4K, la grille publique de 2.5 ne liste que 480p et 720p. Plus cher, pour moins de résolutions disponibles : la trajectoire inverse de celle du texte.

Le second contre-exemple est le compute. Le prix médian à la demande d’un H200 relevé sur un panel de fournisseurs a augmenté d’environ 25 % depuis août 2025, passant de 3,50 $ à 4,39 $ l’heure par GPU. La dispersion reste extrême — de 2,30 $ à 13,78 $ l’heure selon le fournisseur, pour une médiane de cohorte autour de 4,11 $, un fournisseur spécialisé affichant 3,99 $ à la demande et 1,99 $ en spot. Pour le H100 80 Go, les relevés vont de 1,49 $ à 6,98 $ l’heure, un autre panel donnant 2,19 $ à 11,06 $. Un avertissement accompagne ces chiffres et vaut d’être retenu : sur le H200, l’offre est volatile, et « disponible » signifie fréquemment une demande de capacité ou une réservation de plusieurs semaines. Un prix horaire affiché sur une machine qu’on ne peut pas obtenir avant trois semaines n’est pas un prix.

C’est le contexte dans lequel il faut lire l’annonce d’Anthropic du 5 août : la confirmation de la constitution d’une équipe interne de conception de puces, avec l’ambition de concevoir conjointement le silicium et les modèles Claude, et une cible annoncée de réduction du coût d’inférence par token de l’ordre de 50 % — les puces d’inférence spécialisées étant créditées de gains de 50 à 67 % par token à l’échelle de production. Les partenariats AWS, Google, Nvidia et AMD restent centraux ; l’entreprise recrute des ingénieurs semi-conducteurs jusqu’à 485 000 $ par an. Deux réserves, explicites dans la couverture : aucun calendrier n’est donné, et il n’est pas précisé si Anthropic entend maîtriser la fabrication. Le développement d’une puce d’IA avancée est chiffré par des sources industrielles à près d’un demi-milliard de dollars. Le message envoyé au marché est clair — le coût du token est désormais un problème de silicium, pas de marge commerciale — mais il ne produira aucun effet sur une facture avant plusieurs années.

« Poids ouverts » n’est pas non plus un prix

Le troisième registre où l’unité de compte se dérobe est celui de l’open-weight. Nous relevions le 10 août au matin que les poids de Qwen3.8-Max (2 400 milliards de paramètres, 95 milliards actifs, contexte de 1 million de tokens, 2 $/6 $ à l’API) et de Qwen3.8-27B étaient annoncés pour la semaine du 10 août sur Hugging Face et ModelScope. L’état de cette promesse au moment où nous écrivons mérite d’être noté précisément : Alibaba a rendu Qwen3.8-Max largement accessible aux utilisateurs internationaux en amont de la publication des poids, ce serait le premier modèle de classe Max qu’Alibaba ouvre, et la licence n’est toujours pas annoncée.

Ce dernier point n’est pas un détail administratif. Des poids publiés sous licence Apache 2.0, sous licence MIT, ou sous une licence maison assortie de restrictions d’usage commercial ou de seuils d’utilisateurs actifs ne définissent pas le même actif, ni le même risque juridique, ni la même valeur pour une organisation qui envisage un hébergement souverain. Tant que la licence n’est pas publiée, « poids ouverts » décrit une intention, pas une option d’achat. La règle de lecture est la même que pour le tarif Contributor de Meta : ce qui détermine le coût réel n’est pas le nombre affiché, c’est la clause qui l’accompagne.

Tableau comparatif : les prix API au 10 août 2026

Deux lignes entrent dans la grille depuis notre relevé de ce matin — les deux paliers de Muse Spark 1.2, qui remplacent la ligne Muse Spark 1.1 devenue obsolète. Les prix ci-dessous sont les tarifs standard des fournisseurs, hors cache, hors Batch et hors place de marché.

Modèle Input ($/M tokens) Output ($/M tokens) Note
Claude Fable 5 (Anthropic) 10.00 50.00 frontière ; disponible sur Google Cloud
GPT-5.6 Sol (OpenAI) 5.00 30.00 Batch/Flex 2.50/15.00 ; mode Fast 10.00/60.00
Claude Opus 5 (Anthropic) 5.00 25.00 devant Muse Spark 1.2 sur tous les tableaux publiés par Meta
Kimi K3 (Moonshot, open-weight) 3.00 15.00 contexte 1M sans surcoût ; cache-hit 0.30
GPT-5.6 Terra (OpenAI) 2.00 12.00 Batch/Flex 1.00/6.00 ; mode Fast 4.00/24.00
Gemini 3.1 Pro (Google) 2.00 12.00 4.00/18.00 au-delà de 200k de contexte
Claude Sonnet 5 (Anthropic) 2.00 10.00 tarif de lancement jusqu’au 31.08, puis 3.00/15.00
Qwen3.8-Max (Alibaba) 2.00 6.00 2,4T params / 95B actifs ; poids annoncés cette semaine, licence non publiée
Grok 4.5 (xAI) 2.00 6.00 modèle de code ; accès UE encore restreint
Gemini 3.6 Flash (Google) 1.50 7.50 orienté automatisation multi-étapes
Qwen3.7 Max (Alibaba) 1.475 4.425 relevé place de marché ; pas de paliers de contexte
Muse Spark 1.2 · Standard (Meta) 1.25 4.25 lancé le 05.08 ; cache 0.15 ; Meta n’entraîne pas sur vos données
Grok 4.3 / 4.20 (xAI) 1.25 2.50 contexte 1M
Inkling-Small (Thinking Machines) 0.58 1.20 poids ouverts ; sortie à 1.44 chez des tiers — non recoupé
Mistral Large 3 0.50 1.50 tarif de décembre 2025 ; Batch à −50 %
DeepSeek V4 Pro 0.435 0.87 tarif fournisseur, identique en place de marché
Qwen3.7 Plus (Alibaba) 0.32 1.28 0.96/3.84 au-delà de 256k de contexte
Gemini 3.5 Flash-Lite (Google) 0.30 2.50 très haut débit
GPT-5.6 Luna (OpenAI) 0.20 1.20 −80 % le 30.07 ; par défaut sur Free et Go depuis le 06.08
DeepSeek V4 Flash 0731 0.14 0.28 82,7 au Terminal-Bench 2.1 ; ≈ −37 % en place de marché
Ministral 3 3B (Mistral) 0.10 0.10 tarif plat
Muse Spark 1.2 · Contributor (Meta) 0.10 0.20 cache 0.002 ; Meta peut entraîner sur vos requêtes et réponses ; 60 RPM ; pays sélectionnés
Qwen3.7 Flash (Alibaba) 0.03 0.13 sous 32k de prompt seulement ; 0.10/0.40 jusqu’à 256k ; 0.20/0.80 au-delà

Tarifs Muse Spark 1.2 (deux paliers) vérifiés le 10 août 2026 ; les autres lignes sont reprises de notre relevé du 10 août au matin. Les tarifs de cache, promotionnels et de lancement expirent sans préavis. Sur le plancher du marché, deux relevés ne se recoupent pas : un traqueur donne au 8 août Llama 3.1 8B Instruct à 0,02 $ d’entrée comme modèle de production le moins cher, un autre retient Qwen3.7 Flash à 0,03 $ ; les périmètres (« modèle de production suivi » contre grille fournisseur) diffèrent et ces deux chiffres ne sont pas comparables.

Le tableau ci-dessus ne peut pas accueillir les modèles de média, et c’est précisément l’objet de cet article : ils ne se facturent pas dans la même unité.

Modèle Unité de facturation Prix Note
Seedance 2.5 (ByteDance) la seconde de vidéo 0.09 $/s en 480p · 0.21 $/s en 720p API ouverte le 07.08 ; +52,9 % par token vs 2.0 ; 1080p et 4K absents de la grille publique
Seedance 2.5 (ByteDance) le million de tokens de sortie 10.97 $ entrées gratuites : prompt, première trame, images de référence
Qwen Image 3 Pro (Alibaba) l’image ≈ 0.034–0.04 $ selon fournisseur et palier de résolution ; gratuit pour une durée limitée sur Bailian

Un même clip de cinq secondes en 720p est facturé 1,244 $ avec une référence courte et 4,838 $ avec une référence de trente secondes — un facteur 3,9 pour un livrable identique. Aucune grille au million de tokens ne permet d’anticiper cet écart.

Ce que cela signifie pour une organisation suisse

Trois lectures, dans l’ordre où elles engagent une décision.

D’abord, un rabais payé en données n’est pas un rabais, c’est une cession. Pour une fiduciaire, une étude d’avocats, une banque privée ou un développeur sous mandat, le code et les documents traités ne sont pas la propriété de celui qui les traite. Les faire transiter par un palier tarifaire qui autorise leur usage pour entraîner le modèle d’un tiers n’est pas un arbitrage budgétaire : c’est une question de secret professionnel et d’obligation contractuelle de confidentialité, et elle se tranche avant de regarder le prix, pas après. L’écart de douze à vingt et un fois est réel et attractif ; il est aussi la mesure de ce que valent vos données pour celui qui les demande. Deux règles pratiques en découlent : vérifier le palier actif de tout outil d’agent avant de l’approcher d’un dépôt client, et exiger par écrit le régime applicable — Meta commence à accepter des demandes de rétention nulle, ce qui suppose de les formuler.

Ensuite, la baisse des prix n’est pas une loi de la nature, c’est une politique commerciale par segment. Cette semaine résume la situation : le token de texte baisse, la vidéo générative augmente de 53 %, le GPU-heure H200 dépasse de 25 % son niveau d’il y a un an, et le seul acteur qui annonce une division par deux du coût d’inférence le fait en construisant ses propres puces, sans calendrier. Une organisation qui a bâti son plan budgétaire sur l’hypothèse d’une déflation continue a extrapolé un segment à l’ensemble du marché. La couverture n’est pas de prévoir le prix, elle est de mesurer son coût réel par tâche accomplie et de pouvoir déplacer cette tâche quand la grille bouge.

Enfin, le chiffre affiché a cessé d’être une unité de comparaison, dans les trois registres à la fois. Le prix, parce que la ligne la moins chère se paie en droits d’usage sur vos données. La performance, parce qu’un même modèle perd douze places selon le harnais qui le mesure, et que deux classements publiés écartent Sol et Opus 5 de près de quatre points. Et la disponibilité, parce que « poids ouverts sans licence » et « GPU disponible sous trois semaines » décrivent des intentions, pas des options d’achat. Ce qui reste mesurable est ce qui se passe chez vous : quelle tâche a été exécutée, par quel modèle, sous quel régime de données, pour quel coût constaté. Une organisation qui instrumente cela compare des grandeurs réelles. Une organisation qui lit des grilles compare des unités qui n’ont plus de commune mesure.

Comoto OS · Noyau cognitif souverain

Maîtrisez vos coûts d'IA au lieu de les subir. Comoto OS orchestre les meilleurs modèles du marché, propriétaires ou open-weight, depuis un noyau souverain hébergé en Suisse : chaque tâche routée vers le modèle au bon rapport coût/capacité, chaque token tracé et mesuré en coût réel par tâche, et le régime de données de chaque appel défini par votre politique plutôt que par le palier tarifaire par défaut d'un fournisseur — avec la liberté de déplacer une tâche le jour où la grille change de sens.

Découvrir Comoto OS
Accès anticipé

Lisez nos prochains papers en avant-première.

Certains articles sont réservés. Laissez votre e-mail pour débloquer l'accès aux prochaines publications de Meotis Research.