Aller au contenu

Analyses/Notes modèles Est-Ouest

Le mix de modèles est désormais incontournable.

Pendant deux ans, la règle par défaut consistait à envoyer chaque requête au meilleur modèle qu’on pouvait s’offrir. Cette règle est devenue un problème budgétaire, et le segment bon marché qui le résout est surtout chinois.

55×d’écart de prix, même réponse
95%encore sur les modèles de pointe
18%part de tokens de DeepSeek
Mis à jour le 15 juillet 2026Lecture 10 min
Un décompte de coûts annoté sur un tirage papier crème, des lignes entourées au stylo-bille bleu et une rature, un compas en laiton posé sur la feuille sur un bureau d’ingénieur

Cette année, l’événement le plus décisif pour l’IA en entreprise n’est pas né dans un laboratoire. Il est né dans les directions financières.

Nous travaillons à la fois dans les écosystèmes de modèles occidentaux et chinois, ce qui nous amène à passer beaucoup de temps sur une question que nos clients nous posent sans cesse : le segment bon marché est-il réel, ou n’est-ce qu’un effet d’annonce ? Pour faire court : il est réel, il est surtout chinois, et s’il faut s’y intéresser, c’est pour une raison arithmétique, pas géopolitique.

Une nouvelle discipline budgétaire s’installe dans les entreprises américaines, à mesure que directeurs financiers et conseils d’administration serrent la vis sur les dépenses inefficaces d’intelligence artificielle.
CNBC5 juin 2026

C’est le calcul qui les a fait bouger. Jeetu Patel, directeur produit de Cisco, l’a exposé en des termes que n’importe quel directeur financier peut suivre.

$200par salarié / semaine
90ksalariés
$900Mpar an, tout en modèles de pointe

Jeetu Patel, directeur produit de Cisco, a détaillé le calcul pour CNBC le 5 juin : environ 200 $ de consommation de tokens par salarié et par semaine, cela revient à près de 10 000 $ par personne et par an. Pour 90 000 salariés, on atteint 900 millions de dollars par an.

Ramenez ces chiffres à votre échelle si 90 000 salariés ne vous concernent pas. Deux cents personnes au même rythme, c’est environ 2 millions de dollars par an, une ligne bien réelle dans le compte de résultat d’une entreprise de cette taille, et qu’une seule décision de routage peut réduire de moitié.

Cette facture suppose que chaque requête part vers un modèle de pointe. La plupart n’en ont pas besoin. Demandez qui fut le troisième président des États-Unis : vous obtenez Thomas Jefferson aussi bien d’un modèle facturé 0,09 $ par million de tokens en entrée que d’un modèle facturé 5,00 $. Le même Jefferson, à environ 55 fois le prix.

01
En bref

L’écart, mi-2026

Ouvert / ChineFermé / États-Unis
DeepSeek V4 FlashChine · MIT
$0.09
GLM-5.2Chine · MIT
$0.93
Claude Opus 4.8États-Unis · Fermé
$5.00
GPT-5.5États-Unis · Fermé
$5.00
par 1M de tokens · entréedu moins cher au plus cher55×
Voir le tableau complet des prix
ModèleEntrée / 1MSortie / 1MOriginePoids
DeepSeek V4 Flash$0.09$0.18ChineMIT
GLM-5.2$0.93$3.00ChineMIT
Claude Opus 4.8$5.00$25.00États-UnisFermé
GPT-5.5$5.00$30.00États-UnisFermé
DeepSeek V4 Flash, sur le point d’accès le moins cher, coûte 0,09 $ en entrée et 0,18 $ en sortie par million de tokens. GPT-5.5 est aujourd’hui facturé 5 $ en entrée et 30 $ en sortie par million de tokens.
OpenRouter30 juin 2026

Prix vérifiés le 15 juillet 2026. Une réserve sur cette ligne GLM, et elle vaut en général. Les poids ouverts n’ont pas un prix, ils ont un marché. Une vingtaine d’hébergeurs servent GLM-5.2, et un seul jour du début juillet, leurs tarifs d’entrée affichés allaient de 0,93 $ à 3,00 $, la sortie atteignant 10,25 $ sur les paliers de latence premium. La route la moins chère imposait aussi le plafond de sortie le plus serré, 32 768 tokens, ce qui tronque en silence une longue exécution d’agent. L’étiquette n’est pas la facture. Confrontez les deux à votre propre charge de travail avant de bâtir une analyse de rentabilité sur l’une ou l’autre, et revérifiez-les dans un mois, car ce plancher d’entrée de GLM a chuté d’un tiers en quatre-vingt-dix jours.

02
L’économie

Pourquoi « incontournable » n’a rien d’exagéré

Quand l’écart entre segments grimpe à 50 fois, le routage devient le premier levier de coût de la plupart des équipes. Plus puissant que la mise en cache. Plus puissant que la compression de prompt, et bien moins casse-tête que l’une ou l’autre.

Vous pouvez faire ce calcul vous-même, ce qui vaut toujours mieux que de gober le pourcentage d’économies annoncé par le premier venu. Prenez un million de tokens en entrée au tarif de 5,00 $ d’Opus 4.8 : la facture est de 5,00 $. Basculez-en 70 % vers GLM-5.2 à 0,93 $ et vous payez 0,65 $ plus 1,50 $, soit 2,15 $. C’est 57 % de moins pour une seule décision de routage, avant même de toucher à la mise en cache. Portez la part bon marché à 80 % et l’on approche des deux tiers.

Faites le calcul vous-mêmeRouter 70 % d’un million de tokens en entrée vers le segment bon marché
$2.15facture mixte / 1M
57%de baisse vs tout-de-pointe

Le routage n’est pas gratuit, et toute version honnête de cet argument le dit d’emblée. Vous ajoutez un maillon au trajet de la requête : une couche de classification ou de règles qui coûte quelques millisecondes, se trompe parfois de destination et devient une chose de plus susceptible de lâcher à 3 heures du matin. Face à un écart de prix de 50 fois, l’arbitrage vaut généralement la peine. Cela reste un arbitrage.

Le plus gênant, c’est le peu d’équipes qui le font.

Près de 95 % de l’usage de l’IA en entreprise tourne encore sur les modèles de pointe les plus chers, y compris pour des tâches que des solutions moins coûteuses géreraient sans peine.Arvind Jain, PDG de Gleanvia CNBC, 5 juin 2026

Mettez ces deux constats côte à côte. Le secteur connaît la réponse et n’en a rien fait. Ce n’est pas vraiment un problème de technologie. Personne n’est promu pour avoir fait passer un pipeline qui marche à un modèle moins cher, et tout le monde écope d’un mauvais trimestre quand la bascule tourne mal. L’écart est organisationnel, et c’est là qu’est l’argent.

Les analystes voient venir la même chose.

D’ici 2028, 70 % des entreprises les plus avancées dans l’IA s’appuieront sur des architectures multi-outils évoluées pour piloter dynamiquement le routage entre des modèles variés.
IDC, 2026 AI and Automation FutureScapedécembre 2025
03
L’offre

La Chine est devenue exportatrice de tokens

Le segment bon marché n’est pas apparu de nulle part. Il a été publié, délibérément, sous des licences permissives.

Qualifier la Chine d’exportatrice de tokens mérite une précision, car elle n’exporte pas des tokens comme elle exporte de l’acier. Elle publie des poids. N’importe qui peut les télécharger, et l’inférence se fait sur le matériel que l’acheteur choisit, dans le pays qu’il veut. Ce qui franchit la frontière, c’est la capacité, une fois, gratuitement. Les revenus arrivent plus tard et ailleurs : contrats cloud, déploiement en entreprise, points d’accès payants pour les équipes qui préfèrent ne pas héberger elles-mêmes.

2025
É.-U. 75 %
Modèles américains, ~3/4 des tokens
juin 2026
Chine >50 %
Les modèles chinois prennent la tête
Les modèles chinois ont dépassé les modèles américains en part de tokens sur OpenRouter dès le début juin 2026. En 2025, les modèles américains représentaient environ les trois quarts des tokens consommés.
OpenRouter30 juin 2026

DeepSeek à lui seul a doublé, de 9 % à 18 % de la part de tokens de la plateforme entre janvier et juin. La semaine du basculement fut celle du 9 au 15 février, quand les systèmes chinois ont traité plus de tokens que les américains pour la première fois. Ce qui mérite votre attention, ce n’est pas le drapeau. C’est que les développeurs ont basculé vite, en production, sur le prix, ce qui indique que le coût de bascule est plus faible que ne le supposent la plupart des discussions d’achat.

La stratégie qui la sous-tend n’a rien d’une œuvre de charité. Alibaba se sert de Qwen comme d’un produit d’appel pour Alibaba Cloud : les poids ouverts amorcent l’adoption, l’inférence payante capte le reste. Qwen a franchi le milliard de téléchargements cumulés sur Hugging Face, dépassant Llama. Zhipu, désormais cotée à Hong Kong, livre GLM sous licence MIT et vend du déploiement en entreprise.

Exportation reste le mot juste. Un modèle publié sous licence MIT et servi par n’importe quel hébergeur, n’importe où, est un produit d’inférence qui a franchi une frontière sans déclaration en douane, sans laisser à Washington le moindre interrupteur à actionner.

04
La correction

Les gros titres mesurent la mauvaise chose

Si vous avez lu jusqu’ici, vous avez sans doute vu un graphique de cette bascule avec une courbe rouge qui monte. Voici ce que ces graphiques omettent, et cela change la conclusion.

Cette flambée soudaine du volume de tokens pour V4 ne s’est pas traduite par une hausse identique de la part des dépenses.
OpenRouter30 juin 2026
Voie standard

Là où le modèle capable le moins cher absorbe le gros du travail : classification, extraction, recherche, les tâches qui se comptent en milliards de tokens par mois.

milliards de tokens / mois
Voie premium

Là où la fiabilité et un raisonnement vraiment difficile justifient encore un surcoût que les acheteurs continuent de payer.

surcoût que les acheteurs paient encore

Il y a ici deux marchés, pas un seul. Une voie standard, où le modèle capable le moins cher absorbe le gros du travail : classification, extraction, recherche, les tâches qui se comptent en milliards de tokens par mois. Et une voie premium, où la fiabilité et un raisonnement vraiment difficile justifient encore un surcoût que les acheteurs continuent de payer. Les gros titres sur l’effondrement de la part américaine mesurent la première voie tout en laissant entendre quelque chose sur la seconde.

Votre charge de travail vit dans l’une d’elles. En réalité, dans les deux.

05
Le risque

Le risque n’est pas dans les poids. Il est dans le déploiement.

Un prix de token bas ne dit rien de la gouvernance des données. Et avec les modèles chinois, une décision domine toutes les autres : la façon dont vous les exécutez.

Des poids ouverts auto-hébergés ne renvoient rien au concepteur du modèle. Appeler une API hébergée en Chine peut placer vos données sous le droit chinois, car les entreprises chinoises sont soumises à la loi sur le renseignement national et peuvent être contraintes de prêter assistance au travail de renseignement de l’État.

Cela se décline en trois voies concrètes :

01exposition

Poids ouverts auto-hébergés

Aucune hors de votre environnement

Réglementé, sensible, confidentiel

02exposition

Poids ouverts hébergés en Occident

Juridiction de l’hébergeur

Travail de production courant

03exposition

API hébergée en Chine

Le droit chinois s’applique

Volume non sensible uniquement

C’est la licence ouverte qui rend la première voie possible, et cette première voie explique pourquoi les poids ouverts comptent davantage qu’un point d’accès hébergé bon marché.

06
La réserve

L’exportation n’est peut-être pas définitive

Cette section n’est pas une mise en garde contre la Chine. C’est une mise en garde contre les points de défaillance uniques, et il se trouve qu’elle s’applique de façon symétrique.

Le 7 juillet 2026, Reuters a rapporté que les autorités chinoises avaient tenu des réunions avec Alibaba, ByteDance et Z.ai au sujet d’une possible restriction de l’accès à l’étranger aux modèles d’IA les plus avancés de Chine, y compris les publications en poids ouverts.
Reuters7 juillet 2026

Des discussions de politique publique avec des laboratoires nommés, pas un décret signé, et aucun commentaire des ministères ni des entreprises quand Reuters les a sollicités. À prendre pour de la météo, pas du climat.

Pékin

Réunions avec Alibaba, ByteDance et Z.ai sur la restriction de l’accès à l’étranger aux modèles avancés.

Washington

A soumis deux modèles Anthropic au contrôle des exportations ; a placé GPT-5.6 Sol derrière une approbation client par client.

La symétrie reste l’essentiel. En juin, Washington a soumis deux modèles Anthropic au contrôle des exportations et placé le GPT-5.6 Sol d’OpenAI derrière une approbation client par client. Les deux capitales traitent désormais les modèles de pointe comme des actifs stratégiques, et toutes deux ont montré qu’elles agiraient en ce sens sans préavis.

Ce qui oriente la planification d’une façon précise. Des poids déjà publiés ne se rappellent pas : DeepSeek V4 et GLM-5.2 sont sur les disques, partout dans le monde, pour de bon. Les prochains peuvent être retenus par l’un ou l’autre gouvernement. Bâtissez donc sur le segment que vous avez déjà téléchargé et traitez les versions de l’an prochain comme un bonus, pas comme une dépendance. C’est une tout autre posture que de miser votre feuille de route sur la poursuite d’une tendance de prix.

07
La pratique

Par où commencer

  1. 1

    Mesurer avant de migrer

    Commencez par une mesure, pas par une migration. Sortez la facture d’inférence du mois dernier, segmentez-la par type de tâche et regardez ce que l’argent achète vraiment. La plupart des équipes découvrent que l’essentiel de leurs appels relève de la classification, de l’extraction ou de la recherche, le tout tournant sur des modèles de pointe sans meilleure raison que d’avoir été câblé ainsi au départ.

  2. 2

    Évaluer sur votre propre trafic

    Menez ensuite votre propre évaluation, et menez-la sur votre trafic plutôt que sur un classement. La version à copier est volontairement rudimentaire. Tirez 200 requêtes réelles des journaux du mois dernier, en surpondérant le type de tâche qui domine votre facture. Passez chacune dans le modèle en place et dans le candidat. Confiez à quelqu’un qui connaît le domaine la notation des deux sorties en aveugle, sur une échelle qui a du sens pour votre activité, pas sur une échelle de un à cinq. Comptez les désaccords. Si le modèle bon marché perd sur une poignée de cas à peine et qu’aucun de ces cas n’est coûteux à rater, vous avez votre réponse, et vous la tenez de votre propre trafic plutôt que d’une évaluation comparative menée par un autre.

    Les évaluations comparatives publiées vous disent qu’un modèle est capable en général. Que GLM-5.2 domine l’Artificial Analysis Intelligence Index parmi les poids ouverts est un fait sur GLM-5.2. Ce n’est pas un fait sur votre pipeline.

  3. 3

    Router la majorité facile vers le bas

    Faites descendre la majorité facile et laissez la minorité difficile là où elle est. Mesurez la qualité des deux côtés, car la régression silencieuse de qualité est le vrai risque du routage en production et elle ne s’annonce pas dans la facture. Elle se manifeste dans les reprises, dans les tickets de support, dans un relecteur qui réécrit discrètement une sortie que personne n’a journalisée. C’est la partie Référence et Relèvement de notre méthode AZIMUTH à l'œuvre dans son travail ordinaire : on ne peut pas router sur des preuves qu’on n’a jamais recueillies.

    Combien coûte l’exercice lui-même ? Pour une équipe dotée d’un seul pipeline de production, la réponse réaliste tient en une semaine : un jour pour segmenter la facture, deux pour constituer et noter le jeu d’évaluation, deux pour brancher une route et la surveiller. Le poste coûteux n’est pas l’ingénierie, c’est de trouver la personne dont la connaissance du domaine permet de noter les sorties sans broncher, et cette personne est en général débordée. Prévoyez du budget pour son temps, pas pour l’outillage.

  4. Écrire le critère d’arrêt d’abord

    Écrivez le critère d’arrêt avant de commencer, pas après la première mauvaise semaine. Le nôtre, pour ce genre de travail, dit à peu près ceci : si le segment bon marché coûte plus en reprises, en temps de relecture et en escalades qu’il n’économise en tokens, nous arrêtons, nous expliquons pourquoi par écrit, et le modèle en place conserve le trafic. Décider cela à l’avance, c’est ce qui empêche un projet de routage de virer, trois mois plus tard, en débat de coûts irrécupérables, quand quelqu’un a un tableau de bord à défendre.

Parlons-en

Parlons de votre IA.

Un échange avec l’équipe senior sur vos marchés, vos données et les endroits où l’IA rembourserait vraiment votre mise. Pas de diapositives, pas d’engagement, et si la réponse honnête est que votre dispositif actuel convient, vous l’entendrez aussi.

Parlons de votre IA