Sur la planète IA de 2026, l'erreur la plus fréquente des éditeurs SaaS est d'ouvrir un robinet grand ouvert vers les modèles de langage les plus puissants — et de découvrir la facture trois semaines plus tard. hubdiver a choisi une troisième voie : concevoir l'architecture IA dès le départ pour être à la fois puissante et frugale.
Le bon modèle pour la bonne tâche
Tous les appels IA de hubdiver ne sont pas équivalents. "Où cliquer pour créer une sortie ?" n'est pas la même chose que "calcule-moi les paliers de décompression d'un trimix 18/45 à 65 mètres."
La première question appelle une réponse rapide et factuelle. Un modèle léger (Claude Haiku) y répond parfaitement, à une fraction du coût d'un modèle premium. La seconde demande un raisonnement technique — Sonnet est alors mobilisé, ponctuellement. Ce routage est transparent pour l'utilisateur, mais signifie que 90 % des échanges passent par le modèle le moins coûteux.
Le RAG local : moins de tokens, plus de pertinence
Envoyer toute la documentation de hubdiver à chaque requête coûterait cinquante fois plus cher qu'un RAG bien conçu. La base de connaissance est découpée en fragments courts, indexés en recherche plein-texte locale. À chaque question, les trois à cinq fragments les plus pertinents sont sélectionnés et injectés dans le prompt.
Le modèle travaille sur un contexte de 2 000 tokens au lieu de 50 000. La réponse est plus précise, la facture dix fois moins lourde.
Le bridage du périmètre : la première ligne de défense
Avant d'appeler Claude, un filtre d'intention évalue la demande. Si elle sort du périmètre (plongée + hubdiver), la réponse est pré-écrite et envoyée immédiatement. Aucun appel API n'est effectué. Aucun token n'est consommé.
Le disjoncteur par tenant
Chaque centre a un quota journalier. Un compteur en base de données D1 trace les requêtes en temps réel. Au-delà du seuil, le copilote passe en mode dégradé (réponses pré-écrites) sans interruption de service. Ce disjoncteur protège l'éditeur contre les abus, et l'abonné contre les dérives incontrôlées.
L'IA de hubdiver n'est pas moins intelligente parce qu'elle est frugale. Elle est plus fiable parce qu'elle est maîtrisée.
À retenir
- Claude Haiku est utilisé par défaut pour 90 % des requêtes — Sonnet uniquement pour la plongée technique pointue.
- Le RAG local (3–5 chunks, 2 000 tokens de contexte) est 10× moins cher qu'envoyer toute la documentation.
- Un disjoncteur par tenant (quota journalier D1) évite toute dérive de coût incontrôlée.
Quel modèle d'IA utilise hubdiver pour son copilote ?
hubdiver utilise Claude Haiku par défaut pour environ 90 % des requêtes. Claude Sonnet est mobilisé ponctuellement pour les questions de plongée technique pointue (calculs de décompression, Trimix). Ce routage par intention est automatique et transparent pour l'utilisateur.
