Workspace / MéthodologieMoteur disponible sans IA
INFERENCE ENGINEERING

Méthodologie

Les références et les choix derrière chaque estimation.

Des résultats traçables, avec leurs limites.

Le moteur est déterministe. Le LLM extrait uniquement des paramètres : il ne calcule ni mémoire, ni performances, ni prix.

01 — Mémoire avant tout

Poids = paramètres totaux × octets par poids. Les formats quantifiés ajoutent une provision de métadonnées. KV = 2 × couches × têtes KV × dimension de tête × octets KV × contexte × séquences. Le KV reste en FP16, même lorsque les poids sont en INT4.

La mémoire par GPU inclut le runtime, le partage tensoriel compatible et la marge. Les modèles MoE réservent tous leurs poids ; les paramètres actifs interviennent dans le calcul théorique du débit.

02 — Une estimation de performance

Le préremplissage et le décodage utilisent un modèle de calcul et de bande passante avec coefficients explicites. Le batching, la topologie et la réserve de débit affectent le résultat. Ces projections ne constituent pas un benchmark ni une garantie de latence P95.

03 — Des coûts comparables

Cloud : tarif horaire indicatif × GPU × heures facturées. On-premise : achat serveur et GPU, énergie système et refroidissement. Le TCO additionne l’achat une seule fois. Le seuil de rentabilité n’existe que si les économies mensuelles sont positives.

04 — Un périmètre assumé

Les configurations sont des pistes à valider sur le modèle et le matériel exacts. Les frais réseau, stockage cloud, personnel, maintenance, fiscalité et contrats réservés/spot ne sont pas chiffrés. La réserve N+1 ne déploie pas de mécanisme de haute disponibilité.

Le contexte agentique est réservé intégralement : aucun gain de cache partagé n’est présumé. La souveraineté dépend du fournisseur, de sa région, des contrats et des données traitées ; le choix d’un GPU ne certifie aucune conformité RGPD ou AI Act.

Sizer · L’infrastructure commence par le besoin.Calcul explicable · Données de référence versionnées