Livre blanc : étude de consommation électrique d'une IA locale

Une IA peut-elle être frugale ? Consommation et efficience d'une IA locale

« Loin des effets d’annonces et des benchmarks spectaculaires, nous avons souhaité mettre en œuvre une IA qui soit souveraine, frugale et utile. Et pour cela, rien de tel que le test réel. »

Faire tourner un modèle de langage sur ses propres serveurs garantit la confidentialité des données. Mais à quel coût énergétique et avec quelle précision ? Pour répondre avec des faits mesurés, nous avons assemblé un serveur dédié bi-GPU et soumis les modèles à 75 questions métiers.

~6 k€ HT

Investissement matériel

Coût complet du serveur bi-GPU (2x RTX 5090 - 64 Go VRAM) capable d'exécuter des modèles jusqu'à 70 milliards de paramètres.

89 %

Précision utile

Taux de succès obtenu par GPT-OSS 20b sur les tâches d'entreprise (raisonnement, documents, code, traduction hors web direct).

0,0018 kWh

Énergie par question

Consommation mesurée à la prise pour GPT-OSS 20b (soit 0,10 gCO2e par réponse), 11 fois moins qu'un grand modèle cloud.

7 s / req.

Temps sous 10 requêtes

Temps de réaction moyen constaté en lançant 10 demandes simultanées pour GPT-OSS 20b (et < 60 ms pour Mistral Small 24b).

Pourquoi mesurer une IA sur ses propres serveurs ?

Les organisations souhaitent intégrer l'intelligence artificielle sans envoyer leurs données stratégiques vers des prestataires tiers. Mais deux freins reviennent souvent : la crainte d'une facture d'électricité incontrôlée et le doute sur la précision des modèles de taille moyenne.

Notre démarche s'appuie sur trois exigences simples :

  • Souveraineté : Hébergement intégral sur nos propres machines. Aucun octet client ne quitte le réseau interne.
  • Frugalité : Choix du modèle le plus compact capable de résoudre la tâche demandée afin d'économiser l'électricité et le matériel.
  • Utilité : Concentration sur les besoins concrets du travail quotidien : synthèse documentaire, audit de code, logique métier et traduction technique.

Pourquoi avoir une IA locale ?

1. S'affranchir du contexte géopolitique : Le contexte international est porteur d'incertitudes juridiques et de dépendance technologique (extraterritorialité du droit américain) et ne permet pas de garantir la souveraineté de vos données.

2. Garantir un coût stable et maîtrisé : Le modèle économique des géants de l'IA reste à ce jour déficitaire (OpenAI, Anthropic ou Perplexity perdent des milliards). Une augmentation des coûts est inéluctable à terme, et la tendance haussière est d'ailleurs déjà amorcée. Disposer de son IA en local permet de s'affranchir de ce risque.

3. Personnalisation avancée des données : Le déploiement local permet de personnaliser l'IA pour un meilleur rendu. La réponse de l'IA locale devient ainsi plus précise et personnalisée et tout en garantissant que vos données restent chez vous.

Le banc d'essai matériel et les mesures physiques

Photographie du serveur de test bi-GPU RTX 5090 instrumenté chez IDfr

Le serveur de test assemblé et instrumenté dans les locaux d'IDfr (Besançon)

Configuration matérielle (5 730 € HT)

Composant Spécification Montant HT
Cartes graphiques 2x NVIDIA RTX 5090 (32 Go VRAM chacune, 64 Go au total) 4 268 €
Processeur Intel Core Ultra 9 285K (24 cœurs, jusqu'à 5,7 GHz) 604 €
Carte mère ASUS Prime B860-PLUS WiFi (bus PCIe 5.0) 178 €
Mémoire vive 64 Go DDR5 5200 MT/s Kingston FURY Beast 150 €
Stockage SSD NVMe P310 2 To PCIe Gen4 (7 100 Mo/s) 106 €
Alimentation Corsair HX1500i modulaire 1500W Platinum 231 €
Châssis & ventilation Noctua NF-F12, accessoires et câblage PCIe 193 €

Système de mesure et supervision continue :

Prise connectée AwoX mesurant la puissance instantanée toutes les 500 millisecondes directement à la prise 230V et transmise vers Grafana. Suivi GPU par NVIDIA-SMI, suivi CPU par Scaphandre et moteur d'inférence Ollama sous Linux Ubuntu.

75 questions et réponses

Nous avons rédigé 75 questions, ainsi que la réponse correcte, afin de pouvoir tester les modèles sur des usages concrets et réels. L'idée était de prendre des cas d'usage représentatifs de l'entreprise et d'évaluer le comportement précis des modèles face à ces situations. Les questions ont été réparties en 7 catégories :

  • Langage : Synthèse, rédaction professionnelle, reformulation et compréhension textuelle fine.
  • Raisonnement logique : Déductions logiques, analyse de cohérence et résolution de cas complexes.
  • Traduction : Transposition technique bilingue français-anglais respectant les nuances métiers.
  • Mathématiques : Calculs appliqués, logique arithmétique et analyse de métriques chiffrées.
  • Code informatique : Génération de scripts, relecture de syntaxe, débogage et sécurité.
  • Extraction PDF : Capacité à extraire fidèlement des données structurées à partir de documents.
  • Recherche Web : Exactitude sur des faits précis et détection des hallucinations en contexte déconnecté.

Résultats des modèles testés

Moyenne obtenue sur les questions posées à chaque modèle, exécutées dans des conditions logicielles et matérielles strictement identiques :

Modèle Taille Précision Vitesse Tokens / rép. Temps moy. Énergie / q. Émissions CO2e
OpenAI gpt-oss Recommandé 20b (MXFP4) 79 % 208 t/s 2 079 t 13 s 0,0018 kWh 0,10 g

Tableau complet disponible dans le livre blanc : Les données détaillées des 7 autres modèles (Qwen, Mistral, Llama, Gemma) sont accessibles dans le PDF complet.

Télécharger le livre blanc (PDF) pour voir toutes les conclusions

Consommation électrique et bilan carbone sur 5 ans

Intégration des données de fabrication (estimées via Boavizta) et de la consommation réelle :

Régime d'utilisation Puissance Consommation Émissions usage Émissions fabrication* Coût élec. Bilan sur 5 ans
Serveur au repos
(2x RTX 5090 sans requête)
85,8 W Jour : 2,1 kWh
An : 744 kWh
37 kgCO2e/an 660 kgCO2e 148 €/an 850 kgCO2e
78 % Fab. / 22 % Usage
Activité IA (10h/j)
(gpt-oss 20b en charge)
750 W en pic Jour : 8,6 kWh
An : 3 171 kWh
158 kgCO2e/an 660 kgCO2e 634 €/an 1 450 kgCO2e
45 % Fab. / 55 % Usage

* Émissions de fabrication estimées via l'outil Boavizta (https://dataviz.boavizta.org/serversimpact).

Comportement sous forte charge d'utilisateurs

Temps moyen mesuré avant réception du premier octet (TTFT) selon le nombre de requêtes simultanées :

Modèle testé Threads 1 user 5 users 10 users 30 users
GPT-OSS 20b 10 // 1,54 s 3,99 s 5,89 s 15,91 s
Mistral Small 24b 6 // 0,041 s 0,056 s 0,057 s 0,065 s
Qwen 3 30b 6 // 8,0 s 20,0 s 23,0 s 28,0 s
Google Gemma 3 27b 6 // 16,0 s 22,0 s 30,0 s 34,0 s

Tests réalisés sur 180 secondes avec la question type : « Traduis en français : UK car industry in brace position ahead of Brexit deadline ».

Les leçons de la mise en production

1. Configuration d'Ollama : Par défaut, le moteur ne traite qu'une requête à la fois. Régler la variable OLLAMA_NUM_PARALLEL est indispensable pour éviter les erreurs de délai dépassé (504 Timeout).

2. La stabilité de Mistral : Mistral Small 24b encaisse la charge avec une grande régularité. Même sous 30 appels simultanés, le temps de réaction reste sous 65 millisecondes.

3. GPT-OSS 20b en entreprise : Avec 10 requêtes parallèles, la latence moyenne reste sous 6 secondes pour 10 utilisateurs simultanés.

À propos d'IDfr : Agence Web B-Corp à Besançon

Créée en 1999 et labellisée B-Corp depuis 2019, IDfr est une agence de développement web de moins de 10 personnes située à Besançon. Nous faisons depuis longtemps le choix de l'éco-conception pour nos développements internes (Wysistat, outil de mesure d'audience respectueux de la vie privée — GDC, gestion de candidatures) et pour nos clients.

Nous réalisons notre bilan Carbone chaque année depuis bientôt 10 ans avec pour objectif continu de réduire nos émissions (déplacements, hébergement, serveurs).

Notre démarche sur l'intelligence artificielle

Dès 2024, nous avons massivement testé et investi dans les architectures d'IA afin de forger une expertise éclairée et indépendante.

Nous nous sommes dotés d'une charte d'usage interne stricte encadrant l'utilisation raisonnée de ces outils : refuser le gaspillage de ressources, prioriser la souveraineté et vérifier systématiquement les retours d'inférence.

Recevoir le livre blanc en PDF

Accédez au document technique complet de 10 pages comprenant les graphiques de charge, les données d'analyse du cycle de vie (ACV) et nos préconisations d'achat matériel.

  • 10 pages de données réelles, tableaux complets et analyses opérationnelles
  • Bilan chiffré des consommations au repos, en charge et sur 5 ans (ACV)
  • Document complet transmis immédiatement par email au format PDF

Recevoir l'étude par email

Indiquez votre adresse email professionnelle pour recevoir directement le livre blanc technique en PDF :

Foire aux questions sur l'IA locale

Quelle puissance électrique consomme un serveur d'IA au repos ?

Notre machine de test équipée de 2 cartes NVIDIA RTX 5090 et d'un processeur Intel Core Ultra 9 consomme 85,8 W en veille (sans requête active). Cela représente une facture annuelle d'environ 148 € à l'arrêt.

Combien coûte l'électricité pour 10 heures d'utilisation par jour ?

En inférence 10 heures par jour avec le modèle GPT-OSS 20b, le serveur consomme environ 8,6 kWh par jour (soit 206 kWh par mois). Le coût annuel d'électricité s'établit à 634 € (environ 53 € par mois), avec une empreinte annuelle d'usage de 158 kgCO2e.

Quel est le bilan en analyse de cycle de vie (ACV) sur 5 ans ?

En intégrant les émissions de fabrication (660 kgCO2e estimées via Boavizta), le serveur au repos totalise 850 kgCO2e sur 5 ans (78 % fabrication, 22 % usage). En activité continue 10h/jour, le bilan atteint 1 450 kgCO2e (45 % fabrication, 55 % usage), soit 1,7 fois plus (+70 %) qu'un serveur classique.

Que se passe-t-il si le modèle dépasse la capacité de la mémoire VRAM ?

Si la taille du modèle excède la mémoire vidéo des cartes graphiques, le système décharge une partie du calcul sur la mémoire vive (RAM) de la carte mère. La vitesse de transfert s'effondre alors d'un facteur 5 à 10, rendant l'usage impraticable pour une équipe.