IA & Données

IA frugale : pourquoi hubdiver n'envoie pas tout à Claude (et comment ça vous protège)

Sur la planète IA 2026, ouvrir un robinet grand ouvert vers les modèles premium, c'est découvrir une facture incontrôlable trois semaines plus tard.

IA frugale : pourquoi hubdiver n'envoie pas tout à Claude (et comment ça vous protège)

Sur la planète IA de 2026, l'erreur la plus fréquente des éditeurs SaaS est d'ouvrir un robinet grand ouvert vers les modèles de langage les plus puissants — et de découvrir la facture trois semaines plus tard. hubdiver a choisi une troisième voie : concevoir l'architecture IA dès le départ pour être à la fois puissante et frugale.

Le bon modèle pour la bonne tâche

Tous les appels IA de hubdiver ne sont pas équivalents. "Où cliquer pour créer une sortie ?" n'est pas la même chose que "calcule-moi les paliers de décompression d'un trimix 18/45 à 65 mètres."

La première question appelle une réponse rapide et factuelle. Un modèle léger (Claude Haiku) y répond parfaitement, à une fraction du coût d'un modèle premium. La seconde demande un raisonnement technique — Sonnet est alors mobilisé, ponctuellement. Ce routage est transparent pour l'utilisateur, mais signifie que 90 % des échanges passent par le modèle le moins coûteux.

Le RAG local : moins de tokens, plus de pertinence

Envoyer toute la documentation de hubdiver à chaque requête coûterait cinquante fois plus cher qu'un RAG bien conçu. La base de connaissance est découpée en fragments courts, indexés en recherche plein-texte locale. À chaque question, les trois à cinq fragments les plus pertinents sont sélectionnés et injectés dans le prompt.

Le modèle travaille sur un contexte de 2 000 tokens au lieu de 50 000. La réponse est plus précise, la facture dix fois moins lourde.

Le bridage du périmètre : la première ligne de défense

Avant d'appeler Claude, un filtre d'intention évalue la demande. Si elle sort du périmètre (plongée + hubdiver), la réponse est pré-écrite et envoyée immédiatement. Aucun appel API n'est effectué. Aucun token n'est consommé.

Le disjoncteur par tenant

Chaque centre a un quota journalier. Un compteur en base de données D1 trace les requêtes en temps réel. Au-delà du seuil, le copilote passe en mode dégradé (réponses pré-écrites) sans interruption de service. Ce disjoncteur protège l'éditeur contre les abus, et l'abonné contre les dérives incontrôlées.

L'IA de hubdiver n'est pas moins intelligente parce qu'elle est frugale. Elle est plus fiable parce qu'elle est maîtrisée.

À retenir

  • Claude Haiku est utilisé par défaut pour 90 % des requêtes — Sonnet uniquement pour la plongée technique pointue.
  • Le RAG local (3–5 chunks, 2 000 tokens de contexte) est 10× moins cher qu'envoyer toute la documentation.
  • Un disjoncteur par tenant (quota journalier D1) évite toute dérive de coût incontrôlée.
Quel modèle d'IA utilise hubdiver pour son copilote ?

hubdiver utilise Claude Haiku par défaut pour environ 90 % des requêtes. Claude Sonnet est mobilisé ponctuellement pour les questions de plongée technique pointue (calculs de décompression, Trimix). Ce routage par intention est automatique et transparent pour l'utilisateur.

IA maîtrisée, budget prévisible

Le copilote hubdiver optimise chaque requête IA — le bon modèle, le bon contexte, avec un disjoncteur budgétaire par centre.