Aller au contenu

AI

L’intelligence par-dessus vos données.

Des règles font tourner votre entreprise depuis des décennies, et l’essentiel doit le rester. L’intelligence, c’est ce qu’une règle ne sait pas faire : lire l’e-mail brouillon d’un fournisseur, le peser au regard de trois ans de contrats, dire à un acheteur ce qu’il signifie.

Ce pilier décide si un cas d’usage mérite d’exister, et quel modèle doit le porter. Le construire, c’est le pilier Tech.

Accords de revente
aucun
Chaque rapport
daté
// la recommandation de routageLe modèle le moins cher qui franchit chaque barre, nommé par tâche.

Juger le cas

« Où l’intelligence se rembourse-t-elle ici ? »

Des cas d’usage, jugés avant que quiconque s’engage.

Trois questions éliminent la plupart des candidats.

La plupart tombent sur la deuxième, et c’est pourquoi ce pilier et lepilier Données partagent un seul corpus de documents.

La questionCe qu’elle attrape
Une règle peut-elle le faire ?Un travail qui n’a nul besoin d’un modèle
Les données de contexte sont-elles assez bonnes ?Le cas d’usage qui échoue au bout de huit semaines
Quelqu’un porte-t-il la décision ?Un résultat sur lequel personne n’agira

Survivors get tested on your real data before anyone funds a build. Each test reports cost per run today, projected cost at your volumes, and quality against examples your team graded.

// convenu avant que le travail commence

Chaque cas porte aussi un critère d’arrêt, convenu avant que le travail commence : un chiffre et une date auxquels nous nous arrêtons. Nous l’écrivons au début, et quand nous l’atteignons, nous rendons compte de l’arrêt comme du résultat qu’il est.

Ce que vous obtenez

Une feuille de route notée, une économie validée, et un verdict par cas : le financer, le mettre de côté, ou le résoudre sans IA. Le troisième revient plus souvent que les clients ne l’imaginent.

Format

Trois à six semaines, prix fixe, périmètre cadré après un appel.

La deuxième question

Tout se joue sur le contexte.

Cette deuxième question élimine plus de cas d’usage que les deux autres réunies. Voici pourquoi.

Les modèles sont bons. Les systèmes bâtis dessus manquent de fiabilité, et la cause n’est presque jamais le modèle.

  • Une même entité portant quatre noms à travers trois systèmes
  • Une documentation décrivant une architecture remplacée l’an dernier
  • Une récupération qui renvoie ce qui ressemble plutôt que ce qui est juste

Mettez un modèle plus puissant, et vous obtenez la même mauvaise réponse, plus vite, à un coût plus élevé.

// même contexte, modèle plus puissant

modèle Arépond en quelques secondes
modèle B, plus puissantrépond plus vite, coûte plus cher
la même mauvaise réponseparce que le contexte en dessous n’a jamais changé
// le modèle n’a jamais été le goulet d’étranglement

Sélection

« Quel modèle, et comment le saurions-nous ? »

La sélection d’un modèle a cinq variables.

Les classements publics n’en tranchent aucune. Les concepteurs de modèles documentent eux-mêmes le problème.

VariablePourquoi elle tranche
QualitéLà où tout le monde commence, rarement là où cela s’arrête
Coût à vos volumesChange quels cas d’usage sont seulement viables
LatenceQuatre secondes de plus perdent un flux en direct, gagnent un flux par lots
Adéquation à la gouvernanceDisqualifie plus de modèles que la qualité, et plus tôt
JuridictionQui peut exiger l’accès à ce que vous versez. Voir plus bas

Plus de 16 % des échantillons de MMLU sont contaminés, une fraction non négligeable présentant une fuite sévère.

Touvron et al., Llama 2 technical report (2023)

Les modèles de pointe se regroupent désormais au-dessus de 88 % sur ce même test, si bien que l’écart entre les tout premiers tient dans le bruit. Un score élevé prouve surtout qu’un modèle sait réussir une épreuve déjà présente sur Internet.

Un accès, pas un label

Les deux camps de la carte.

Nous opérons en Chine et hors de Chine. C’est un accès, pas un label : modèles occidentaux et chinois sur un même jeu de tâches, la même semaine, la même notation.

Occidental
  • OpenAI
  • Anthropic
  • Google
  • Mistral
Chinois
  • Qwen
  • DeepSeek
  • GLM
  • Kimi

La plupart des cabinets ne testent qu’un seul écosystème parce qu’ils n’en connaissent qu’un. Les résultats reviennent assez souvent nuancés pour que n’en tester qu’un camp revienne à deviner.

C’est le prix qui, en général, fait pencher la décision. Classification, extraction, routage, résumé d’entrées propres : voilà une large part de ce que les systèmes de production font à longueur de journée.

Un modèle quinze fois moins cher obtient souvent le même score sur ces tâches. À l’échelle, cet écart décide si un cas d’usage survit à sa première revue budgétaire.

L’inverse tient aussi. Sur les jugements difficiles, le modèle coûteux mérite son prix, et tout router vers le bon marché pour économiser échoue d’une façon plus discrète et plus coûteuse. Aucune des deux réponses ne se généralise.Les deux se testent.

Alors nous testons. Vos tâches réelles, vos langues, votre plafond de coût, notés à l’aveugle par votre équipe là où la qualité est subjective.

Ce que vous obtenez

Qualité, coût pour mille exécutions, latence et adéquation à la gouvernance par tâche. Plus une recommandation de routage nommant le modèle le moins cher qui franchit chaque barre.

Format

Deux à quatre semaines par cycle. Les reprises coûtent moins ; le jeu de tâches existe déjà.

La place que nous occupons

Nous n’en revendons rien.

Aucun accord de revente. Aucun palier de partenariat. Aucun partage de revenus. Nous payons les mêmes API que vous.

L’évaluation comparative n’est crédible que depuis une place sans rien à vendre. Les grands cabinets ont choisi l’inverse et bâti leurs pratiques d’IA sur des alliances affichées avec les hyperscalers et les laboratoires. C’est une façon raisonnable de mener une activité de conseil, et un mauvais poste d’observation pour arbitrer une comparaison.

Alors quand un modèle chinois à poids ouverts l’emporte sur le coût et respecte vos règles, nous le disons, etpersonne ici ne perd de marge quand vous en tenez compte.

  • Aucun accord de revente.

  • Aucun palier de partenariat.

  • Aucun partage de revenus.

  • Les mêmes factures d’API que vous régleriez.

Juridiction

« Où ces données ont-elles le droit de résider ? »

La souveraineté n’est pas la résidence.

Des données à Francfort chez un fournisseur dont le siège est aux États-Unis résident dans l’UE, mais n’y sont pas souveraines. Le CLOUD Act atteint la maison mère où que se trouvent les serveurs. La même logique joue dans l’autre sens avec les fournisseurs chinois et les règles chinoises sur les données.

// le coût et la contrainte montent avec l’échelon

Niveau unPoint d’accès UE d’un fournisseur hors UELe plus bas
Niveau deuxModèle à poids ouverts auto-hébergé sur une infrastructure UEPlus élevé
Niveau troisFournisseur domicilié dans l’UE gouvernant toute la pileLe plus élevé

La plupart des charges n’ont pas besoin du niveau trois. Certaines ne peuvent légalement pas se placer en deçà. Nous le notons par charge pendant l’évaluation, au lieu de vous remettre un exercice de conformité séparé après coup.

// les dates que la plupart des pages se trompent encore

Une mise au point qui vaut la peine, car bien des pages se trompent : l’accord omnibus numérique de mai 2026 a reporté les obligations à haut risque relatives à la biométrie, à l’emploi et aux infrastructures critiques au 2 décembre 2027, et les systèmes intégrés à des produits au 2 août 2028.

Durée de validité

« Combien de temps cette réponse tiendra-t-elle ? »

Toute évaluation a une durée de validité.

Menlo Ventures a mis des chiffres sur la vitesse à laquelle le sol se déplace.

Nous estimons qu’Anthropic capte désormais 40 % des dépenses LLM des entreprises, contre 24 % l’an dernier et 12 % en 2023. Sur la même période, OpenAI a perdu près de la moitié de sa part entreprise, tombée à 27 % depuis 50 % en 2023.

Menlo Ventures, « 2025: The State of Generative AI in the Enterprise »

Quiconque a désigné un vainqueur définitif en 2023 s’est trompé deux fois depuis. Alors nous datons chaque rapport et traitons la réponse comme périssable.

// le préavis dont vous disposez avant que quelque chose bouge

  • Modèles généralistessix mois de préavis
  • Variantes spécialiséestrois mois
  • Préversionsdeux semaines

En juin 2026, OpenAI a mis au rebut sa propre plateforme Evals et son Agent Builder. Des modèles partent à la retraite, les prix bougent, et les fournisseurs changent de version derrière un nom inchangé.

L’évaluation vous dit la bonne réponse maintenant, et combien de temps ce maintenant dure. Construire de sorte qu’une réponse qui change coûte un changement de configuration plutôt qu’une réécriture relève de l’ingénierie, et cela appartient aupilier Tech.

Mesure

La mesure qui garde le reste honnête.

L’indicateur défini avant que le travail commence. Une référence datée. La même méthode au moment convenu. Si les chiffres disent que le pilote a échoué,le rapport dit que le pilote a échoué.

L’échec dangereux est l’échec silencieux. Un système passe tous les contrôles d’avant lancement, puis se dégrade parce qu’un fournisseur a changé quelque chose en dessous ou que vos données ont bougé. Les métriques d’infrastructure restent au vert tout du long. Seul un jeu de non-régression le rattrape.

// ce que les tableaux de bord ne montrent pas

infrastructure · au vert tout du longqualité des réponses · en dérive
Un jeu de non-régression est le seul instrument pointé sur la seconde courbe.

Alors nous en tenons un : des cas notés figés, rejoués à échéance, datés et conservés. Ce jeu est aussi ce qui rend sûr l’adoption d’un modèle moins cher, car vous pouvez prouver qu’il tient la barre avant de déplacer le trafic.

Nous menons cela en audit autonome sur des systèmes que nous n’avons pas construits. Deux à trois semaines, des mesures avant et après, un verdict écrit, preuves à l’appui.

Un cas appliqué

Un cas appliqué : la visibilité IA.

Une référence datée, une méthode reproductible, des résultats conservés. Pointez cela sur une question marketing et voici ce que vous obtenez.

Quand un prospect demande à un assistant avec qui travailler, un nom sort. Nous mesurons si c’est le vôtre : quels assistants vous citent, sur quels marchés, et quels contenus ils citent en réponse.

Le domaine fourmille d’allégations invérifiables ; nous le traitons donc comme une mesure. Il tourne sur notre propre plateforme, si bien que votre équipe peut le reprendre en interne quand elle le souhaite.

Découvrir bearingbridge intelligence

// qui est recommandé

  • Vous
  • Concurrent
  • Concurrent
  • Concurrent

part des réponses d’assistants · datée · rejouée à échéance

FAQ

Les questions qu’on nous pose.

Quels modèles revendez-vous ou avec lesquels êtes-vous partenaire ?

Aucun. Aucun accord, aucun palier, aucun partage de revenus. Nous payons les mêmes API que vous.

Pouvez-vous travailler dans le cadre de nos contraintes de conformité ?

En général oui, et le découvrir fait partie de l’évaluation comparative. Là où un modèle enfreint vos règles de résidence ou de confidentialité, il est écarté, quel que soit son score.

Avez-vous un modèle de prédilection ?

Pour une tâche précise, après tests, oui. En général, non. Quiconque répond à cette question dans l’abstrait a quelque chose à vendre.

Les modèles chinois sont-ils sûrs à utiliser ?

Cela dépend de la charge. Pour du travail non sensible à fort volume, l’argument du coût est souvent écrasant. Pour des données réglementées ou personnelles, la gouvernance peut les écarter avant même que la qualité entre en jeu. La gouvernance se note au même titre que la qualité et le coût, et les règles sont les vôtres, pas les nôtres.

Combien de temps une évaluation reste-t-elle valable ?

Moins longtemps qu’on ne le croit. Nous datons chaque rapport et recommandons de le refaire au trimestre pour tout ce qui porte un vrai volume.

Et si nous avons déjà choisi un modèle ?

Alors c’est une vérification plutôt qu’une recherche. Soit elle confirme le choix, soit elle découvre que la moitié de votre trafic va vers une gamme dont il n’a pas besoin.

Pouvez-vous évaluer un système bâti par un autre prestataire ?

Oui, en audit autonome. Nous dirons franchement quand un système est performant, et tout aussi franchement quand il ne l’est pas.

Nos données doivent-elles être en ordre avant que vous démarriez ?

Pas parfaites, mais visibles pour nous. Là où les données ne peuvent pas encore porter un cas d’usage, le document le dit, chiffre la trajectoire, et ce travail passe au pilier Données.

Combien coûte une mission ?

Les évaluations au cycle, le travail de cas d’usage en sprint à prix fixe, les reprises moins chères que les premières passes. Le périmètre se fixe lors d’un appel avant tout devis.

Construisez-vous ce que l’évaluation recommande ?

Nous le pouvons, et cela relève du pilier Tech, avec son propre périmètre et son propre prix. Beaucoup de clients portent la recommandation à leurs propres ingénieurs, ce qui est l’une des raisons pour lesquelles l’évaluation se vend à part.

Parlons-en

Parlons IA.

Un échange avec l’équipe senior sur vos marchés, vos données, et l’endroit où l’intelligence rapporterait vraiment. Sans diapositives, sans engagement, et si la réponse honnête est que l’IA n’est pas votre prochaine étape, vous l’entendrez aussi.