Aller au contenu
Tous les guides

IA locale: Ollama, self-host et vrais critères de choix

IA locale vs cloud: privacy, TCO, qualité, latence, SLA. Ollama pour dev/prototype; prod multi-user = autre stack. Grille de décision et checklist sécu pour PME.

Illustration pour l'article : IA locale: Ollama, self-host et vrais critères de choix

Pourquoi le local revient

Souveraineté des données, coûts prévisibles, latence, air-gap: le local revient quand le cloud générique frotte la politique sécu ou le budget à l'échelle.

Ce n'est pas cloud vs local en absolu. C'est quel workload mérite quel isolement. Un agent qui lit des contrats clients n'a pas le même profil qu'un outil de reformulation marketing.

La stack locale, en pratique: hardware (souvent 16 Go+ de RAM minimum pour des modèles utiles), runtime (Ollama, LM Studio, ou moteur multi-user type vLLM en prod), modèle, isolation réseau.

Limites réelles vs cloud frontière

Écart de qualité: les petits modèles locaux restent souvent nettement en dessous des modèles frontière sur le raisonnement multi-étapes et le français complexe. Mesure sur tes 30 cas métier, pas sur un leaderboard.

Vitesse: l'inférence locale peut être nettement plus lente que les API cloud selon GPU/CPU. En itération produit, la latence change le rythme de travail.

SLA: le cloud offre des garanties de disponibilité; le local, c'est ton hardware, tes patches, ton monitoring. Pour une app multi-utilisateurs avec SLA client, le local « laptop + Ollama » n'est pas une prod.

Ollama (et équivalents) excellent pour dev, prototype, charge interne bornée. Pour multi-user prod, on regarde plutôt des runtimes pensés throughput (ex. vLLM) + ops.

Grille de décision local vs API

Local privilégié: données très sensibles, volume élevé et prévisible, offline/air-gap, exigences contractuelles d'hébergement, coût API qui explose.

API privilégiée: qualité max, usage sporadique, time-to-market, pics de charge, équipe sans ops ML, besoin de modèles frontière.

Hybride fréquent: classification / prétraitement en local; génération complexe en API UE après masquage PII. Documente la matrice de routage.

TCO 12 mois: matériel + électricité + temps ops + downtime vs facture API. Le gratuit local ne l'est jamais.

Checklist sécu et ops

Classification des données, choix modèle, isolation réseau (pas d'endpoint public sans auth), logs d'accès, privilèges minimaux, mises à jour modèles avec validation métier, plan de bascule si le local sature.

Conteneuriser aide à figer versions et isoler le réseau. Ce n'est pas une baguette magique si les secrets restent mal gérés.

Même en local, un prompt injection via un document peut déclencher des outils. Borne les outils comme en cloud.

Si vous voulez une feuille de route local vs API, on peut cadrer en 20-40 minutes.

FAQ

Ollama suffit-il en production PME ?
Pour usages internes bornés, parfois. Pour un SLA client multi-user: monitoring, HA, runtime adapté, ownership ops.
IA locale = conforme RGPD automatiquement ?
Non. La localisation aide, mais bases légales, minimisation, droits et sécu restent.
Quel modèle local choisir ?
Celui qui score le mieux sur tes 30 cas métier sous contrainte VRAM et latence. Ignore le hype du dernier release si tes tests ne suivent pas.
Mixer Claude API et local ?
Oui, souvent optimal. Routeur selon sensibilité et complexité. Documente la matrice.
Quand éviter le local ?
Usage sporadique, besoin de qualité frontière, pas d'ops, SLA strict sans équipe pour l'opérer.

Articles liés

Cadrez votre premier agent IA

20 minutes pour vérifier vos outils, vos données et le premier cas utile. Sans jargon, sans engagement.