PublicationsNews · Marché AI

Google casse les prix du tiers « workhorse » pendant que l'open-weight LongCat-2.0 prend la tête d'OpenRouter

Le 21 juillet, Google lance Gemini 3.6 Flash à 1,50 $ / 7,50 $ et un Flash-Lite à 0,30 $ / 2,50 $ le million de tokens et fait miroiter Gemini 4 ; le même marché voit le modèle ouvert LongCat-2.0 s'imposer parmi les plus utilisés d'OpenRouter et Meta ouvrir sa première API payante à un quart du prix des leaders. Le milieu de gamme s'effondre pendant que le frontière se verrouille.

Gravure noir et blanc : dans une halle de marché, un immense tableau de cotation mécanique dont les plaques dégringolent en cascade, surmonté d'une porte de coffre-fort scellée dont la serrure rayonne, tandis que le sol disparaît sous une marée de milliers de caisses de bois identiques et ouvertes

Deux jours après l’ouverture de la tournée d’IPO d’Anthropic, le marché de l’IA s’est déplacé là où il compte vraiment pour une organisation qui paie ses tokens : le milieu de gamme. Le 21 juillet, Google a lancé un trio de modèles Gemini Flash pensés pour le débit et le coût, et a laissé entrevoir Gemini 4. Le même jour, le modèle ouvert chinois LongCat-2.0, entraîné sans aucun GPU Nvidia, figure déjà parmi les modèles les plus consommés d’OpenRouter, et Meta, longtemps champion de l’open-weight gratuit, se met pour la première fois à facturer son API. Trois signaux qui pointent dans la même direction : le prix du travail courant s’effondre et s’ouvre, pendant que le frontière, lui, se verrouille derrière des compteurs.

Google rouvre la guerre des prix sur le tiers « workhorse »

Le 21 juillet 2026, Google a mis en ligne trois modèles d’un coup : Gemini 3.6 Flash, Gemini 3.5 Flash-Lite et Gemini 3.5 Flash Cyber, tous positionnés sur l’efficacité, la faible latence et la fiabilité pour faire tourner des agents à l’échelle. Le « cheval de trait » de la gamme, Gemini 3.6 Flash, est tarifé 1,50 $ / 7,50 $ le million de tokens (entrée / sortie), l’output passe sous les 9,00 $ de l’ancien 3.5 Flash. À côté, Flash-Lite descend à 0,30 $ / 2,50 $ pour le très haut débit, tandis que Flash Cyber, dédié à la détection et au correctif de vulnérabilités via l’agent CodeMender de Google, reste en pilote restreint réservé aux gouvernements et partenaires de confiance pour raisons de double usage.

L’essentiel n’est pas seulement le prix affiché. Google met en avant un gain d’efficacité par tâche : 3.6 Flash consommerait environ 17 % de tokens de sortie en moins que 3.5 Flash à travail égal, avec moins d’étapes de raisonnement et d’appels d’outils sur les enchaînements multi-étapes, ce qui, cumulé à la baisse du tarif, ramène le coût effectif d’une tâche à la baisse bien au-delà de ce que dit le sticker (jusqu’à ~71 % revendiqués sur les charges de code agentique). Sa date de connaissance passe enfin de janvier 2025 à mars 2026. En creux, Google a fait miroiter Gemini 4 sans calendrier précis, et son 3.5 Pro promis pour juin reste, lui, absent. Le message au marché est clair : la bataille se gagne désormais au coût par tâche accomplie, pas seulement au coût par million de tokens.

LongCat-2.0 : l’open-weight s’installe en tête d’OpenRouter

La deuxième secousse vient de Chine, et elle est structurelle. LongCat-2.0, publié par Meituan le 30 juin 2026 sous licence MIT, est un modèle Mixture-of-Experts de 1,6 mille milliards de paramètres (≈ 48 milliards actifs par token) doté d’un contexte natif d’un million de tokens. Deux faits le rendent notable au-delà de ses bancs d’essai (SWE-bench Pro à 59,5, devant les 58,6 de GPT-5.5 selon les chiffres de l’éditeur). D’abord, après avoir tourné anonymement sous le nom « Owl Alpha » pendant près de deux mois, il s’est hissé parmi les modèles les plus utilisés d’OpenRouter, avec un volume rapporté d’environ 10,1 mille milliards de tokens par mois et un bond de +242 % en un mois ; VentureBeat le décrit même comme étant « en tête » de la plateforme. Ensuite, Meituan revendique l’avoir entraîné entièrement sur plus de 50 000 puces (ASIC) chinoises, sans aucun GPU Nvidia, le premier modèle à mille milliards de paramètres bâti sur du compute domestique.

Côté prix, le grand écart avec le frontière occidental saute aux yeux : 0,75 $ / 2,95 $ le million de tokens en tarif standard, et 0,30 $ / 1,20 $ en promotion, les hits de cache facturés gratuitement. Un modèle quasi-frontière, ouvert, auto-hébergeable, à un vingtième du prix de sortie d’un Claude Fable 5 : c’est très exactement l’argument que la Chine a mis en scène à Shanghai la semaine dernière, et il ne relève plus du discours mais de la part de marché.

Meta fait payer pour la première fois

Troisième signal, plus discret mais lourd de sens : Meta, dont la doctrine par défaut était l’open-weight gratuit, a ouvert le 9 juillet une API payante pour son modèle Muse Spark 1.1, tarifée 1,25 $ / 4,25 $ le million de tokens (20 $ de crédits offerts à l’inscription, un tarif de cache évoqué autour de 0,15 $ mais non officiel). Mark Zuckerberg le présente comme « la première fois que nous faisons une vraie API sérieuse », avec un prix « très agressif et attractif », de fait, environ un quart de ce que facturent OpenAI ou Anthropic pour des modèles comparables. L’API accepte nativement les formats OpenAI (Chat Completions) et Anthropic (Messages), pour permettre de basculer sans coût de migration. Autrement dit : même l’acteur historiquement le plus ouvert commercialise désormais l’accès, mais en cassant les prix par le bas.

Tableau comparatif : les prix API au 22 juillet 2026

Le paysage reste étiré d’un facteur cent entre le plus cher et le plus économique, mais le bas et le milieu du tableau se sont densifiés en une semaine.

Modèle Input ($/M tokens) Output ($/M tokens) Note
Claude Fable 5 (Anthropic) 10.00 50.00 frontière ; plafonds abonnement resserrés le 20.07
GPT-5.6 Sol (OpenAI) 5.00 30.00 lancé le 09.07
Claude Opus 4.8 5.00 25.00
GPT-5.6 Terra 2.50 15.00 lancé le 09.07
Kimi K3 (Moonshot, Chine, open-weight) 3.00 15.00 lancé le 16.07 ; cache-hit 0.30
Gemini 3.1 Pro (Google) 2.00 12.00 double au-delà de 200k de contexte
Claude Sonnet 5 2.00 10.00 tarif de lancement jusqu’au 31.08, puis 3/15
Gemini 3.6 Flash (Google) 1.50 7.50 lancé le 21.07 ; −17 % de tokens/tâche
Grok 4.5 (xAI) 2.00 6.00 prix publié ; accès UE encore restreint
GPT-5.6 Luna 1.00 6.00 lancé le 09.07
Meta Muse Spark 1.1 1.25 4.25 lancé le 09.07 ; 1ʳᵉ API payante de Meta
LongCat-2.0 (Meituan, open-weight) 0.75 2.95 promo 0.30/1.20 ; MIT ; en tête d’OpenRouter
Gemini 3.5 Flash-Lite (Google) 0.30 2.50 lancé le 21.07 ; très haut débit
Grok 4.3 / 4.20 (xAI) 1.25 2.50 contexte 1M
Mistral Large 3 0.50 1.50
DeepSeek V4 Pro 0.435 0.87 après la baisse de mai
DeepSeek V4 Flash 0.14 0.28 contexte 1M ; cache jusqu’à −99 %

Prix relevés le 22 juillet 2026 auprès des pages officielles (Anthropic, OpenAI, Google, Meta) et d’agrégateurs spécialisés pour les modèles sans page tarifaire directement accessible. Les tarifs promotionnels et de cache sont signalés dans la colonne note ; ils peuvent expirer sans préavis.

Le frontière, lui, se verrouille, et le compute reste l’angle mort

Pendant que le milieu de gamme se brade, le haut du tableau prend le chemin inverse. Claude Fable 5 reste à 10 $ / 50 $ et, depuis le 20 juillet, ses plafonds d’abonnement Max et Team Premium ont été abaissés d’environ un tiers, les utilisateurs Pro et Team Standard basculant vers une facturation à l’usage. La tournée d’IPO d’Anthropic, cotation visée dès octobre, valorisation de départ que les marchés de prédiction placent autour de 1 100 milliards de dollars, suppose une monétisation serrée du modèle le plus capable, pas un forfait illimité. Le marché se scinde en haltère : un frontière rare et compté d’un côté, une abondance ouverte et bon marché de l’autre.

Sous cette bascule, le socle matériel ne cède pas, mais il se recompose. La location d’un H100 reste comprise entre ~2 et ~11 $ l’heure selon le fournisseur, et le point d’équilibre d’un serveur acheté demande toujours de longs mois d’usage soutenu. Deux mouvements de fond, en revanche, changent la donne : LongCat-2.0 démontre qu’un modèle de pointe peut être entraîné sans silicium américain, ce qui déplace le rapport de force sur l’approvisionnement en calcul ; et la consolidation s’accélère, Qualcomm a annoncé le rachat de la plateforme d’IA Modular pour environ 3,9 milliards de dollars afin de renforcer son infrastructure de l’edge au datacenter. Le prix du token baisse ; la maîtrise du compute qui le porte, elle, devient un enjeu géopolitique.

Ce que cela signifie pour une organisation suisse

Trois points d’attention concrets. D’abord, le vrai levier de coût n’est plus le tarif par token, mais le nombre de tokens consommés par tâche : la mise à jour de Gemini Flash montre qu’un modèle moins cher et plus économe en sortie peut diviser la facture réelle bien au-delà de sa baisse de prix affichée, encore faut-il mesurer sa propre consommation pour le constater. Ensuite, l’open-weight n’est plus une alternative de repli mais un standard de distribution : avec LongCat-2.0 parmi les modèles les plus utilisés d’OpenRouter et une licence MIT, l’auto-hébergement souverain devient un choix de gouvernance et de coût sans compromis de performance. Enfin, la structure en haltère du marché impose d’arbitrer, pas de choisir un camp : réserver le frontière compté aux tâches qui l’exigent, router le volume courant vers un milieu de gamme devenu abondant et bon marché, et garder la main sur ce routage, puisque plafonds et tarifs peuvent changer du jour au lendemain, en haut comme en bas.

Comoto OS · Noyau cognitif souverain

Maîtrisez vos coûts d'IA au lieu de les subir. Comoto OS orchestre les meilleurs modèles du marché, propriétaires ou open-weight, depuis un noyau souverain hébergé en Suisse : chaque tâche routée vers le bon modèle au bon prix, chaque token tracé, chaque décision auditable, quels que soient les plafonds et les tarifs que votre fournisseur décide demain.

Découvrir Comoto OS
Accès anticipé

Lisez nos prochains papers en avant-première.

Certains articles sont réservés. Laissez votre e-mail pour débloquer l'accès aux prochaines publications de Meotis Research.