Aller au contenu
EN FR

Runtime Transformer

Statut documentaire : architecture — voir Maturité et preuves.

Le moteur tensoriel logiCells actuel contient un chemin d'exécution orienté Transformer et pas seulement des primitives tensorielles génériques. Le contrat public reste piloté par les capacités : une application ne doit pas dépendre des noms de classes privées du Runtime.

Blocs vérifiés

L'implémentation et les suites de tests couvrent les principaux blocs d'inférence :

  • normalisation RMS ;
  • projections Q/K/V ;
  • encodage positionnel rotatif (RoPE) ;
  • attention causale ;
  • chemins de grouped-query attention (GQA) ;
  • connexions résiduelles ;
  • calcul feed-forward de type SiLU/SwiGLU ;
  • normalisation de sortie et logits ;
  • buffers résidents ;
  • ajout au KV cache et décodage token par token.

Les sources contiennent aussi des tests Runtime qui comparent le décodage token par token à l'exécution de séquence complète et des tests produisant des logits avec des poids flottants ou quantifiés.

Prefill et décodage

L'inférence Transformer se sépare naturellement en deux phases :

tokens du prompt
  -> prefill
  -> construction de l'état / KV cache
  -> décodage token par token
  -> ajout du nouvel état K/V

Conserver l'état Transformer résident peut fortement réduire les transferts pendant les étapes répétées de décodage.

Indépendance du backend

Le registre de backends distingue l'exécution hôte ordinaire, l'exécution résidente sur périphérique et la capacité Transformer résidente. Des chemins WebGPU et MLX existent dans le moteur actuel, mais un modèle public doit dépendre de la capacité demandée plutôt que d'un nom de backend.

Poids quantifiés

Le moteur actuel contient des chemins Transformer testés pour plusieurs représentations quantifiées. Voir Quantification des poids. La quantification est un choix de déploiement/exécution et ne modifie pas l'identité conceptuelle.

Intégration conceptuelle

Les structures conceptuelles peuvent fournir les entités, relations, masques ou features projetés en tenseurs numériques. Les résultats du Transformer restent des projections apprises. Lorsqu'ils influencent le raisonnement conceptuel, il faut les rattacher à une identité conceptuelle stable et séparer la validité symbolique du classement ou de l'estimation appris.

Statut

Cette page est une référence d'architecture pour un sous-système moteur implémenté. Elle ne certifie pas que chaque noyau Transformer, format de poids ou accélérateur soit exposé par chaque version de SDK public.