Workspace / DimensionnementMoteur disponible sans IA
INFERENCE ENGINEERING

La bonne puissance. Au juste coût.

Du besoin à l’infrastructure : des choix lisibles, des hypothèses explicites.

Un point de départ
QUALIFICATION GUIDÉE

Partons de votre besoin.

Parlons de votre entreprise et de votre usage. Vos réponses sont regroupées, puis appliquées à la fin de l’échange.

Assistant non configuré

Quelques mots suffisent.

« Nous sommes une PME. Nous voulons un assistant pour interroger nos documents internes. »

Vous pouvez arrêter les questions à tout moment.

Aucun chiffre de dimensionnement n’est calculé par l’assistant.

MODÈLEQwen2.5 7B
CONCURRENCE5 séquences
CONTEXTE8 192 tokens

Votre infrastructure, au bon équilibre.

3 options exploratoires · différents compromis.

Calcul déterministe
01Économique

RTX 4090

24 GiB / GPU · FP16

vLLMOn-prem
VRAM / GPU23 / 24 GiB
Vitesse / utilisateur
~36 tok/s
Premier token
~0,97 s
Débit de service
~0,5 req/s

Ordres de grandeur théoriques

202 € / mois

Exploitation + achat réparti sur 36 mois

03Réactivité

4 × H100 80 GB

80 GiB / GPU · INT4

vLLMOn-prem
VRAM / GPU4,4 / 80 GiB
Vitesse / utilisateur
~1 000 tok/s
Premier token
~0,1 s
Débit de service
~11,5 req/s

Ordres de grandeur théoriques

4 860 € / mois

Exploitation + achat réparti sur 36 mois

Mémoire calculée. Performances théoriques à valider. Prix indicatifs, sans engagement fournisseur.

LE COMPROMIS

Coût et réactivité

Plus à droite, plus rapide. Plus bas, plus économique.

ÉconomiqueÉquilibréeRéactivité

Par million de tokens de sortie au volume saisi. Projection théorique, hors frais annexes.

SOUS LE CAPOT

Chaque GiB compte.

15GiB / GPUÉquilibrée · RTX 4090
Poids du modèle7,8 GiB
KV cache2,19 GiB
Runtime2 GiB
Marge3 GiB

Contexte réservé pour 5 séquences. Doubler le contexte double leur KV cache.

Hypothèses et traçabilité20 champs par défaut

Le moteur réserve le KV cache au contexte maximum. Les hypothèses restent modifiables dans le questionnaire.

ParamètreValeurOrigine
Type de structureunspecifiedHypothèse modifiable dans le formulaire.
Modèleqwen-7bHypothèse modifiable dans le formulaire.
Profil de chargechatHypothèse modifiable dans le formulaire.
Séquences simultanées5Hypothèse modifiable dans le formulaire.
Tokens d’entrée500Hypothèse modifiable dans le formulaire.
Tokens de sortie250Hypothèse modifiable dans le formulaire.
Contexte maximum8192Hypothèse modifiable dans le formulaire.
QuantificationautoHypothèse modifiable dans le formulaire.
Marge VRAM0.25Hypothèse modifiable dans le formulaire.
Requêtes / seconde0.08333333333333333Dérivé : un appel par séquence toutes les 60 s, multiplié par les appels/tâche en agentique.
TTFT cible (ms)2000Hypothèse modifiable dans le formulaire.
TPOT cible (ms)100Hypothèse modifiable dans le formulaire.
Heures / mois730Hypothèse modifiable dans le formulaire.
Budget mensuel (€)Non définiHypothèse modifiable dans le formulaire.
HébergementanyHypothèse modifiable dans le formulaire.
GPU existantnoneHypothèse modifiable dans le formulaire.
Quantité existante1Hypothèse modifiable dans le formulaire.
Parc existant uniquementfalseHypothèse modifiable dans le formulaire.
Réserve N+1falseHypothèse modifiable dans le formulaire.
Appels par tâche1Hypothèse modifiable dans le formulaire.

Moteur 1.1.0 · Catalogue 2026-09-26.2 · 62 candidats examinés.

Sizer · L’infrastructure commence par le besoin.Calcul explicable · Données de référence versionnées