Quantification des poids
Statut documentaire : architecture — voir Maturité et preuves.
Le Runtime tensoriel actuel contient des chemins d'exécution avec poids quantifiés afin de réduire la mémoire et la bande passante tout en conservant la sémantique des tenseurs et des Transformers.
Ce qui est vérifié dans le moteur
L'arbre source contient des implémentations et des tests pour plusieurs familles de quantification, notamment Q4, Q8, GGUF Q4_K et d'autres chemins low-bit. Les tests Transformer exercent des poids flottants et quantifiés, y compris des variantes résidentes sur accélérateur.
Cela confirme que l'exécution quantifiée fait partie de l'architecture actuelle du moteur. Cela ne signifie pas que chaque format soit disponible sur chaque backend ou exposé par chaque binding public.
Frontière Runtime
Une application publique doit normalement exprimer :
- le modèle ou l'opération tensorielle à exécuter ;
- une précision ou un artefact de modèle acceptable lorsque cela appartient au contrat de déploiement ;
- les contraintes de performance et de mémoire.
Le Runtime choisit ou valide ensuite le chemin stockage/backend compatible.
Précision et compatibilité
La quantification modifie la représentation numérique. Il faut au minimum valider :
- la qualité des sorties sur des données représentatives ;
- la réduction mémoire ;
- la latence et le débit sur le backend cible ;
- la compatibilité du format de modèle ;
- le comportement de repli lorsqu'un format accéléré demandé n'est pas disponible.
Un nom de noyau quantifié ne doit pas devenir un concept métier.