IA hybride: gouverner l'exploitation après le choix du modèle
Le guide Red Hat du 28 août prolonge la sélection de modèles par une question plus structurante: qui exploite le calcul, les poids, l'inférence, le RAG et les outils des agents une fois le système en production? Pour les entreprises belges et françaises, ce choix détermine autant la souveraineté que le coût et la continuité.
1. API managée, self-hosting ou hybride
Red Hat distingue les API managées, où le fournisseur opère le calcul, le stockage du modèle et l'inférence, du self-hosting, où ces responsabilités restent dans l'environnement de l'entreprise. L'API réduit l'investissement initial et accélère le démarrage; le self-hosting renforce le contrôle des données et peut rendre les coûts plus prévisibles à fort volume, mais exige capacité GPU, compétences de plateforme, mises à jour et réponse aux incidents.
Une architecture hybride attribue chaque cas d'usage à un mode d'hébergement explicite. Les flux exploratoires ou peu sensibles peuvent utiliser une API, tandis que les données réglementées ou les traitements critiques restent sur une infrastructure contrôlée. Cette répartition doit décrire les chemins réseau, les régions, les liens privés, les journaux et l'emplacement des index RAG.
2. Ce que cela change pour une entreprise belge ou française
Pour une PME, le changement concret est de séparer le besoin métier du prestige technique. Une API entreprise peut suffire pour une assistance documentaire limitée, à condition de contrôler rétention, accès et budget. Héberger un modèle devient pertinent lorsque la confidentialité, le volume, la latence ou la continuité le justifient et qu'un responsable sait exploiter la plateforme.
Pour une ETI, un grand groupe ou une administration, chaque workload doit avoir un propriétaire, une frontière de données, un niveau de risque, un objectif de disponibilité et un plan de repli. Les directions IT doivent budgéter les pointes de concurrence et de tokens, pas seulement la moyenne, puis suivre latence, erreurs, files d'attente, coûts, qualité de retrieval et appels d'outils.
3. Lecture Underside: la souveraineté se joue au Day 2
L'analyse Underside est que la localisation d'un modèle ne suffit pas. Une IA souveraine doit aussi pouvoir être observée, corrigée, remplacée et arrêtée. Il faut versionner ensemble l'identifiant du modèle, les prompts, l'index RAG et la configuration des outils afin qu'une promotion ou un rollback conserve un état cohérent.
La continuité doit prévoir les échecs ordinaires: API indisponible, GPU perdu, modèle dégradé ou outil métier en panne. Les modes dégradés peuvent inclure un modèle plus petit, des réponses en cache, un agent en lecture seule ou la suspension temporaire des actions. Cette capacité de repli compte davantage pour la souveraineté opérationnelle qu'une simple promesse de région.
4. Agents, MCP et Odoo: gouverner les actions
Un RAG ajoute ingestion, embeddings, index, droits documentaires et métriques de retrieval. Un agent ajoute orchestration, identité de service, liste d'outils autorisés, délais, validation des entrées et journal d'invocation. MCP facilite l'exposition d'outils, mais ne remplace ni l'authentification, ni le filtrage par rôle, ni l'audit.
Dans Odoo Entreprise, un assistant qui lit des documents peut rester sur un flux système-vers-IA. Un agent qui crée un devis, modifie un stock ou déclenche un paiement inverse le sens du contrôle: il appelle le SI. Les entreprises doivent donc séparer lecture et écriture, limiter chaque compte de service, imposer une validation humaine sur les actes engageants et relier chaque action à un identifiant de corrélation exploitable en audit.
5. Une grille de décision exploitable
La bonne décision ne consiste pas à choisir une seule plateforme pour tous les usages. Il faut classer les workloads selon sensibilité, criticité, volume, latence, dépendance fournisseur et compétence interne. Cette matrice doit aussi couvrir les terminaux Apple Enterprise, les clouds européens, les environnements locaux et les intégrations métier: la donnée peut rester locale tandis que l'inférence est distante, ou l'inverse.
Priorité opérationnelle: pour chaque cas d'usage, documenter le modèle, l'hébergement, les chemins de données, l'index RAG, les outils d'agent, les SLO, les coûts, les journaux, le mode dégradé, le responsable et la procédure de rollback.
Cadrer l'exploitation IA