Hypothèses
Formule : octets ≈ 2 × couches × têtes KV × dimension de tête × tokens en cache × octets/élément × séquences
Approximation uniquement. Les tokenizers, noyaux, architectures, runtimes, partages de cache, métadonnées, fragmentations et niveaux de qualité réels varient. Mesurez le système cible exact ; n’utilisez pas cette estimation comme garantie de capacité ou de qualité.