Aller au contenu

Tech

Des produits, pas des présentations.

La plupart des produits d’IA ne sont pas des agents conversationnels. Ce sont des agents qui achèvent des tâches à travers vos systèmes, des modèles qui notent derrière un simple champ, des outils appelés depuis les logiciels que vos équipes exploitent déjà, des classifieurs au cœur de processus que personne ne regarde.

Quatre choses portent un produit jusqu’à l’usage quotidien : le prototype, la pile qui le soutient, le développement de production, et le rythme qui le tient à jour.

Prototype
deux semaines
Production
six à douze
Deux ingénieurs à un même bureau examinent un schéma d’architecture système sur un grand écran, la sortie d’un terminal ouverte à côté
Votre équipe voit exactement ce que nous voyons : chaque étape de chaque requête, chiffrée au fil de l’exécution.

Le premier engagement

« Cela vaut-il la peine d’être construit pour de bon ? »

Deux semaines, sur vos données, dans votre flux de travail.

Un prototype est une preuve, pas une démonstration. Il déroule le chemin idéal, sur des données que nous avons préparées, avec des permissions qui viennent plus tard, face à un seul modèle sans repli.

Il répond à une question, et les deux réponses sont utiles. L’une comme l’autre arrive en deux semaines.

Une à deux semaines. Un échantillon de données, et l’accès à ceux qui font le travail aujourd’hui.

Un prototype fonctionnel

Il tourne sur vos données, dans le flux de travail où il vivrait vraiment. Cliquable, pas imaginé.

Une note écrite sur ce qu’il a prouvé

Ce qui a marché, ce qui n’a pas marché, et ce que la preuve dit d’une construction pour de bon.

Un chiffrage de production, par couche

Détaillé au regard des neuf décisions ci-dessous, pour que l’engagement suivant soit chiffré avant que vous le preniez.

Deux objets différents

Le prototype n’est pas une petite version de production.

C’est une tout autre chose, et voilà toute l’explication du pourquoi : l’un prend deux semaines, l’autre trois mois. Basculez de l’un à l’autre et regardez ce qui doit changer.

Donnéesun échantillon que nous avons préparéles enregistrements tels qu’ils arrivent vraiment
Utilisateursdans la pièce avec nousabsents, et non briefés
Modèlesun seul, sans repliroutés par tâche, avec repli
Permissionsviennent plus tardappliquées avant la récupération
Coûtmesuré par exécutionplafonné par utilisateur et par charge
Panneon redémarrereprises, repli, retour arrière testé

Six choses changent, et chacune relève d’une ingénierie que le prototype avait le droit de sauter.

La pile

Neuf décisions, prises par écrit avant que le développement commence.

Tout produit d’IA est fait de ces neuf couches, que quelqu’un les ait choisies délibérément ou non. Nous les choisissons avec vous, et nous en écrivons la raison.

Quatre méritent d’être tranchées avec soin, parce que les défaire plus tard coûte de l’argent réel. Les autres peuvent changer dès que la preuve change.

// neuf couches, un seul système. La plaque éclairée est celle que vous lisez.

Notre choix par défautSans interface ou intégrée. La conversation là où la tâche n’a pas de fin définie.

Une fenêtre de conversation est la bonne réponse bien moins souvent qu’on ne la prescrit. La plupart des tâches ont un début et une fin, et leur place est dans les logiciels que les gens ont déjà ouverts.

Notre choix par défautUne colonne vertébrale déterministe, le modèle appelé à des points choisis.

Moins cher à exploiter, plus simple à déboguer, prévisible en charge. L’autonomie reste réservée aux étapes dont le chemin ne peut réellement pas se connaître à l’avance.

Notre choix par défautPoints de reprise LangGraph en deçà d’une heure, Temporal au-delà.

Tout traitement assez long pour être interrompu doit survivre à l’interruption. Le seuil se situe autour d’une heure de travail réel.

Notre choix par défautRecherche hybride et reclasseur avant toute solution exotique.

La récupération décide de la qualité des réponses plus que le modèle. Une recherche hybride avec reclasseur en règle l’essentiel sans lancer un projet de recherche.

Coûteux à défaire : le modèle de plongements.

Notre choix par défautpgvector sous dix millions de vecteurs, Qdrant ou Weaviate au-dessus.

Une base dédiée mérite sa place quand l’échelle, le filtrage par métadonnées ou l’isolement des clients l’exigent. En deçà, c’est un système de plus à exploiter.

Coûteux à défaire : l’endroit où résident les données.

Notre choix par défautToujours une passerelle. C’est elle qui rend le routage réel.

Une seule porte de sortie transforme le routage, les plafonds de budget, le repli entre fournisseurs et la journalisation par appel : d’intentions, ils deviennent des mécanismes.

Coûteux à défaire : passerelle ou pas de passerelle.

Notre choix par défautMCP, avec authentification et permissions par serveur en amont.

Un protocole partagé fait d’un nouvel outil un changement de configuration plutôt qu’un développement. La couche de permissions en amont n’est pas facultative.

Notre choix par défautUne suite qui conditionne les déploiements, comme des tests ordinaires.

Une qualité contrôlée à l’œil dérive en silence. Une suite bâtie sur des cas réels tirés de votre travail attrape la régression avant la mise en ligne.

Notre choix par défautConventions OpenTelemetry GenAI, dans la supervision que vous exploitez déjà.

Des conventions ouvertes font atterrir les traces dans les outils que votre équipe surveille déjà, au lieu d’un second tableau de bord que personne n’ouvre.

Coûteux à défaire : la journalisation ou non des appels d’outils.

Pourquoi ces choix par défaut

Sur l’orchestration.

Les flux coûtent moins cher, sont plus prévisibles et plus simples à déboguer que les agents. L’autonomie mérite sa place là où le nombre d’étapes ne peut réellement pas se connaître à l’avance.

Les flux offrent prévisibilité et constance pour des tâches bien définies, tandis que les agents sont le meilleur choix lorsqu’il faut de la souplesse et une décision pilotée par le modèle, à grande échelle.

Anthropic, Building Effective AI Agents, décembre 2024

Sur la récupération.

Elle décide de la qualité des réponses plus que le modèle. Une recherche hybride avec reclasseur règle à elle seule l’essentiel du travail de récupération. Une base vectorielle dédiée mérite sa place quand l’échelle, le filtrage par métadonnées ou l’isolement des clients l’exigent.

Sur le routage.

Un modèle rapide et bon marché pour la classification et l’extraction, un modèle de pointe pour le raisonnement qui l’exige, dans le même système. C’est la passerelle qui rend cela possible.

CLASSEREXTRAIRERAISONNERPASSERELLEMODÈLE RAPIDEDE POINTE
// une seule porte de sortie : c’est elle qui rend le routage, les plafonds de budget et le repli réels plutôt que voulus

Le développement

« Qu’est-ce qui lui fait survivre à de vrais utilisateurs ? »

L’ingénierie de production.

Le prototype a mérité la décision. Ce développement en fait un système que votre organisation exploite chaque jour, sur les enregistrements tels qu’ils arrivent vraiment.

// durcissement0 sur 7
  • données
  • habilitations
  • schéma
  • portée des outils
  • plafonds
  • repli
  • déploiement

Six à douze semaines, chiffrées avant que vous vous engagiez.

  • Données réelles

    Les vrais enregistrements remplacent l’échantillon propre. Champs manquants, doublons, la convention de nommage vieille de douze ans que personne n’a documentée.

  • Habilitations

    Filtrer par permission avant la récupération, pour que le système n’atteigne jamais que ce que l’utilisateur a le droit de voir.

  • Sorties structurées

    Validation par schéma sur tout ce qui suit, avec un comportement défini quand une réponse en sort.

  • Permissions d’outils

    Accès restreint par outil, et confirmation humaine sur les actions à conséquence.

  • Maîtrise des coûts

    Des plafonds par utilisateur et par charge, dimensionnés sur les volumes réels de production, pas sur ceux d’un pilote.

  • Chemins de panne

    Reprises, repli entre fournisseurs, et un retour arrière réellement testé.

  • Déploiement

    Par vagues, une mesure à chacune, pour que l’adoption s’observe au lieu de se présumer.

// ce que vous obtenez

  • Un système en production, chaque décision de pile documentée.
  • Une récupération sensible aux habilitations et des plafonds de budget.
  • Une suite d’évaluation en intégration continue, et la traçabilité dans la supervision que vous exploitez déjà.
  • L’intégration aux logiciels que vos équipes ouvrent déjà.
  • Code source et documentation compris.

« Qui le tient à jour ? »

Une décision de routage prise en mars mérite d’être revue dès septembre.

Les modèles progressent, les prix baissent, les fournisseurs livrent de nouvelles versions. Réévaluer n’est pas de l’entretien : c’est le travail de performance le moins cher qui soit, et il s’amortit d’ordinaire de lui-même.

Changer de modèle de plongements suppose de réindexer le corpus. Nous le prévoyons dès le premier jour, pour que cela reste une opération planifiée plutôt qu’une crise.

Au mois, dimensionné au système : un interlocuteur senior nommé, un rythme de réévaluation, un backlog transparent, et un modèle de coûts confronté à la dépense réelle. Tout est documenté pour une passation à tout moment.

Prototypedeux semaines
Décisionon y va ou on arrête
Productionsix à douze semaines
Exploiter et faire évoluerau mois, dimensionné au système

FAQ

Les questions qu’on nous pose.

Deux semaines pour un prototype, trois mois pour la production. Pourquoi ?

Deux objets différents. Le prototype tourne sur des données que nous avons préparées, pour des utilisateurs présents, un seul modèle, sans repli. La production tourne sur les données telles qu’elles arrivent, pour des utilisateurs absents. Le second délai va à la qualité de récupération, aux habilitations, à l’évaluation, à la gestion des pannes et à l’intégration.

Combien coûte l’exploitation par mois ?

Cela dépend du volume et du routage, et nous le modélisons pendant le prototype plutôt que de l’estimer après coup. Le prototype rend compte du coût par exécution sur vos vraies données, ce qui s’extrapole aux volumes de production avec une précision raisonnable. Les plafonds de budget par utilisateur et par charge sont fixés avant le lancement.

Pouvez-vous reprendre un système bâti par un autre prestataire, ou monté vite par notre équipe ?

Oui, après une évaluation. Nous regardons comment la récupération est évaluée, où les permissions s’appliquent et ce qui est tracé aujourd’hui, puis nous vous donnons une trajectoire chiffrée, options côte à côte.

Sommes-nous obligés d’adopter votre pile ?

Non. Nous bâtissons sur ce que vous exploitez déjà. Nous donnons un avis réfléchi sur les quatre décisions coûteuses à défaire : l’endroit où résident les données, le modèle de plongements, la passerelle, la journalisation des outils.

Quels modèles utilisez-vous ?

En général plusieurs au sein du même système, routés par tâche. L’évaluation comparative relève du pilier IA ; ce pilier-ci en met le résultat en œuvre.

Construisez-vous des agents ou des flux ?

Les deux, et le choix se fait étape par étape plutôt que projet par projet. La plupart des systèmes que nous livrons sont un flux codé qui appelle un modèle à des points précis, le comportement autonome étant réservé aux étapes dont le chemin ne peut réellement pas se connaître à l’avance. Ce mélange coûte moins cher à exploiter et se raisonne plus facilement quand il faut changer quelque chose.

Et si nous avons déjà un entrepôt de données et un fournisseur cloud ?

Tant mieux, cela raccourcit le développement. La plupart de ces couches reposent sur une infrastructure que vous exploitez déjà, et la récupération en particulier fonctionne mieux au plus près des systèmes où vos données résident. Nous partons de votre pile et ajoutons ce que le cas d’usage exige.

Nos données peuvent-elles rester en Europe ?

Oui. Résidence et souveraineté sont deux questions distinctes, et nous répondons aux deux dès la conception. La résidence, c’est l’endroit où la donnée se trouve physiquement. La souveraineté, c’est la loi qui l’atteint, laquelle dépend de qui exploite l’infrastructure plutôt que de l’emplacement du bâtiment. Les deux figurent au document d’architecture avant que le développement commence.

Comment savoir que cela fonctionne après le lancement ?

Une suite d’évaluation tourne en intégration continue sur un jeu de cas réels tirés de votre travail, si bien qu’un changement qui déplace la qualité se voit avant la mise en ligne. En production, la traçabilité montre le parcours complet de chaque requête : quel modèle a répondu, ce qui a été récupéré, quels outils ont été appelés, ce que cela a coûté. Votre équipe a la même vue que nous.

Nos propres ingénieurs peuvent-ils y travailler ?

C’est l’intention même. Le code source, la documentation et le registre des décisions d’architecture vous appartiennent d’un bout à l’autre. Là où votre équipe veut posséder une couche dès le départ, nous la construisons avec elle plutôt que de la transmettre plus tard.

Sommes-nous propriétaires de ce que vous construisez ?

Oui. Le code source, la documentation et les données vous appartiennent.

Parlons-en

Parlons IA.

Un échange avec l’équipe senior sur vos marchés, vos données, et l’endroit où l’IA vous rapporterait vraiment. Sans diapositives, sans engagement, et si la réponse honnête est que l’IA n’est pas votre prochaine étape, vous l’entendrez aussi.