Quel matériel ?
Le GPU, le nombre de cartes et la mémoire occupée sur chacune : poids du modèle, cache KV et marge de sécurité.
Indiquez un modèle, une charge et un budget : Sizer propose deux ou trois configurations GPU comparables, avec pour chacune la mémoire, la latence et le coût. Chaque hypothèse reste visible.
Un calculateur de VRAM s’arrête à la mémoire. Sizer va jusqu’à la charge soutenable et au coût d’exploitation.
Le GPU, le nombre de cartes et la mémoire occupée sur chacune : poids du modèle, cache KV et marge de sécurité.
Le moteur de serving, la quantification (FP16, INT8 ou INT4), le parallélisme et le nombre de répliques.
Le temps jusqu’au premier token, la vitesse par utilisateur et le débit en requêtes par seconde, face à vos cibles.
La location cloud ou l’achat amorti sur 1 et 3 ans, avec l’énergie et les ressources CPU, RAM et disque de chaque hôte.
Remplissez le formulaire ou expliquez votre projet à l’assistant en quelques phrases. Un champ laissé vide prend une valeur par défaut, signalée dans le résultat.
Sizer retient deux ou trois configurations distinctes, de la plus économique à la plus réactive, et détaille leur mémoire, leur latence et leur coût.
Téléchargez un PDF avec les configurations, les hypothèses retenues et les versions du moteur et du catalogue, prêt à partager.
Chaque exemple ouvre l’outil pré-rempli : modifiez ensuite les champs qui ne correspondent pas à votre situation.
Un assistant de questions-réponses pour une équipe : requêtes courtes, quelques utilisateurs à la fois.
Dès 202 € / moisavec RTX 4090Ouvrir cet exempleDes réponses appuyées sur vos documents : de longs extraits en entrée, des réponses courtes.
Dès 810 € / moisavec 4 × RTX 4090Ouvrir cet exempleDes agents qui enchaînent plusieurs appels au modèle pour chaque tâche, sur un grand modèle.
Dès 24 300 € / moisavec 20 × H100 80 GBOuvrir cet exempleLatence et débit sont des ordres de grandeur calculés. Validez la configuration retenue par un benchmark avant tout achat.
Les prix du catalogue sont illustratifs. Confirmez-les auprès des fournisseurs avant de vous engager.
L’assistant se contente de remplir le questionnaire. Chaque chiffre vient d’un moteur déterministe, qui fonctionne aussi sans IA.
Vos saisies ne sont pas conservées. Le texte écrit à l’assistant n’est envoyé à un service externe qu’avec votre accord.
Commencez avec les valeurs par défaut, puis affinez champ par champ.