Les articles du blog utilisent des abréviations et des concepts techniques. Chaque terme lié depuis un article renvoie ici, où il est défini en clair, avec une référence pour approfondir. Le glossaire s’enrichit au fil des articles.
Au-delà des LLM, deux grandes familles de modèles audio existent : les STT, qui transcrivent de l’audio en texte, et les TTS, qui fabriquent de l’audio à partir de texte. Ce sont des tâches opposées, avec des architectures et des sorties très différentes.
Attention linéaire
Une famille de blocs qui remplacent l’attention classique par une mémoire à taille fixe mise à jour token après token, comme une note qu’on réécrit en avançant : le coût est proportionnel à la longueur de la séquence au lieu de son carré, et l’état à conserver ne grossit pas avec le contexte. Gated DeltaNet, utilisée par Qwen3-Next et Flash-Next sur trois couches sur quatre, en est une variante. La précision sur les liens lointains est moindre, d’où le maintien d’une couche d’attention complète sur quatre.
Référence : Gated Delta Networks | arXiv
Attention parcimonieuse
Sparse attention. Une attention complète qui ne regarde pas tous les tokens précédents mais seulement un sous-ensemble choisi par un petit module, l’indexeur, sous un budget fixe. Au-delà du budget, seuls les tokens jugés les plus pertinents sont conservés ; en dessous, l’indexeur calcule ses scores pour rien. Dans Flash-Next, le budget est de 2 048 tokens, et l’indexeur, exécuté en Python séquentiel pendant une calibration, coûte plus que l’attention elle-même.
Référence : DeepSeek Sparse Attention | arXiv
Attention
Le mécanisme au cœur des Transformers : pour chaque token, le modèle calcule une pondération de tous les autres tokens (via des vecteurs Query/Key/Value) et mélange leurs informations. C’est ce qui permet à un mot de “regarder” les mots importants du contexte, peu importe leur distance.
Références : Neural Machine Translation by Jointly Learning to Align and Translate | arXiv (Bahdanau et al., 2014 — l’attention d’origine) et Attention Is All You Need | arXiv (Vaswani et al., 2017 — l’attention comme architecture entière)
Attention à fenêtre glissante
Sliding window attention. Variante de l’attention où chaque token ne regarde qu’une fenêtre fixe de tokens précédents, au lieu de tout le contexte. Le coût passe de quadratique (comparaison à tout le signal) à proportionnel à la fenêtre. Pour l’audio, c’est décisif : chaque nouvelle frame ne dépend que des N précédentes, donc on peut encoder au fur et à mesure que le signal arrive - c’est ce qui rend le streaming possible.
Référence : Gemma 4 Technical Report | arXiv
Autorégressif
“Auto” = soi-même, “régressif” = dépend de ses propres sorties passées. Un modèle autorégressif génère le texte un token à la fois : il prédit le token suivant à partir de tous les précédents, l’ajoute au contexte, et recommence. C’est la “machine à écrire” des LLM classiques (GPT, Llama, Gemma…). Le masque de causalité en est le mécanisme d’application.
Référence : The Illustrated GPT-2 | Jay Alammar
Base vectorielle
Un stockage qui indexe des embeddings et sait retrouver rapidement les plus proches d’un vecteur donné, sans les comparer tous un par un (index HNSW, IVF…). pgvector en est l’implémentation PostgreSQL : une extension qui ajoute un type vector et les opérateurs de distance, ce qui évite de déployer une base dédiée à côté de celle qu’on a déjà.
Référence : pgvector | GitHub
bf16
Brain float 16. Format de nombre sur 16 bits utilisé pour stocker et entraîner les modèles : même plage de valeurs que le float 32, moitié moins de précision, moitié moins de mémoire. C’est la précision « pleine » d’un checkpoint publié sur Hugging Face, le point de départ de toute quantization. Un paramètre en bf16 pèse 2 octets : 125 milliards de paramètres font 250 Go.
Référence : bfloat16 | Google Cloud
BOS
Beginning Of Sequence. Le token spécial placé au début d’une séquence pour signaler au modèle que l’inférence commence. Ex. chez Voxtral, le BOS initialise la séquence avant les frames audio.
ByteTrack
Algorithme de suivi multi-objets : il relie d’une image à la suivante les boîtes d’un détecteur pour donner à chaque objet un identifiant stable, une « piste ». Sa particularité est de garder aussi les détections à faible confiance pour prolonger une piste existante plutôt que de la perdre. La durée d’une piste sert d’indice de réalité : un vrai objet se suit longtemps, un faux positif clignote.
Référence : ByteTrack: Multi-Object Tracking by Associating Every Detection Box | arXiv
Calibration
Faire passer un corpus de texte dans le modèle, sans l’entraîner, uniquement pour observer ce qui se passe à l’intérieur : quels experts sont sollicités, avec quelle intensité, quelles colonnes d’une matrice comptent. Ces observations guident ensuite une décision qui ne touche pas l’apprentissage, comme retirer des experts ou choisir comment quantifier. La qualité du résultat dépend du corpus : ce qu’il ne contient pas, le modèle risque de le perdre.
Référence : Calibration datasets | llm-compressor
Chain-of-thought
Chaîne de pensée, souvent abrégé CoT. Le fait, pour un modèle, d’écrire son raisonnement avant de donner sa réponse. Ce n’est pas une explication ajoutée après coup : un modèle fait exactement la même quantité de calcul pour chaque token produit, et n’a aucune mémoire de travail en dehors des tokens qu’il a déjà écrits. Produire des étapes intermédiaires est donc le seul moyen de dépenser plus de calcul sur un problème difficile — le texte intermédiaire est le raisonnement.
Deux générations. D’abord une astuce de prompt (« réfléchissons étape par étape »), où le raisonnement se mélange à la réponse. Puis des modèles entraînés par renforcement à raisonner — o1, DeepSeek-R1, Qwen3 — qui produisent une phase de réflexion délimitée par des tokens spéciaux (<think>…</think>) et l’exposent dans un champ d’API séparé, reasoning_content.
Le CoT paie quand la réponse doit être dérivée (maths, code, planification) et se gaspille quand elle doit être récupérée (fait, classification, appel d’outil). Attention au coût : un token de raisonnement se génère à la même vitesse, occupe la même place dans le KV cache et se facture comme un token de réponse — et il partage le même plafond max_tokens, au point qu’un budget trop serré peut être entièrement consommé par la réflexion sans qu’aucune réponse ne sorte. Mesuré sur Qwen3.8-27B, la latence est multipliée par 1,0 sur une question courte mais par 2,05 sur un appel d’outil : plus la réponse attendue est brève, plus le raisonnement pèse en proportion.
Enfin, la trace n’est pas une piste d’audit : ce sont des tokens qui améliorent statistiquement le résultat, pas une introspection fidèle du calcul réel.
Référence : Chain-of-Thought Prompting Elicits Reasoning in Large Language Models | arXiv (Wei et al., 2022) et DeepSeek-R1 | arXiv (2025, pour la version apprise par renforcement)
Chunking
Découper les documents en morceaux avant de les vectoriser. La taille des chunks décide de tout : trop gros, l’embedding mélange plusieurs idées et la recherche devient floue ; trop petits, le contexte est perdu. Pour du code, un découpage guidé par l’AST - une fonction, une classe, un chunk - donne de bien meilleurs résultats qu’une coupe tous les N lignes.
Référence : Dense Passage Retrieval for Open-Domain Question Answering | arXiv (Karpukhin et al., 2020 — §3, l’effet de la granularité des passages)
compressed-tensors
La bibliothèque de vLLM qui gère, sous llm-compressor, le format des poids compressés et l’offload : chaque paramètre est stocké sur son support, RAM ou disque, et rapatrié sur le GPU au moment exact où le forward y accède, puis relâché. C’est ce qui permet de calibrer un modèle de 360 Go avec une seule couche sur une carte de 80 Go. Sur disque, elle écrit un fichier par tenseur, ce qui rend les rechargements dispersés.
Référence : compressed-tensors | GitHub
COCO
Jeu de données de référence en détection d’objets (Microsoft, 2014) : 80 classes du quotidien, dont voiture, camion, personne, feu de circulation et panneau stop. Les poids « COCO » d’un détecteur sont ceux entraînés sur ce jeu : ils savent reconnaître ces 80 classes, et rien d’autre (pas de cône, pas de panneau de limitation de vitesse).
Référence : Microsoft COCO: Common Objects in Context | arXiv
Connexions résiduelles
Les “résiduels”. Chaque sous-couche d’un Transformer est entourée d’une connexion qui ajoute son entrée à sa sortie : sortie = x + sous-couche(x). Le gradient traverse ainsi le réseau sans s’atténuer, et chaque bloc n’a plus qu’à apprendre “ce qui manque” (le résidu) au lieu de tout recalculer.
Référence : Deep Residual Learning for Image Recognition | arXiv
Continuous batching
Traiter plusieurs requêtes dans la même passe, pour amortir la relecture des poids sur plusieurs prédictions au lieu d’une. Le batching statique attend que tout le lot ait terminé avant d’en démarrer un nouveau, ce qui laisse des slots vides à mesure que les réponses se terminent. Le continuous batching insère une nouvelle requête dès qu’une place se libère, ce qui améliore nettement le débit sous charge.
Référence : Orca: A Distributed Serving System for Transformer-Based Generative Models | OSDI ‘22 (Yu et al., 2022 — l’article qui introduit l’iteration-level scheduling)
Cross-attention
L’attention d’un décodeur vers la représentation produite par l’encodeur, par opposition à la self-attention où la séquence se regarde elle-même. Chez Whisper, c’est le mécanisme par lequel chaque token de texte généré va chercher l’endroit de l’audio encodé qui le concerne - ce qui sert accessoirement à aligner les timestamps sur le signal.
Référence : Attention Is All You Need | arXiv
DELAY
Token spécial qui ajoute une marge supplémentaire en tête de séquence. Chez Voxtral, 6 tokens DELAY après les PAD laissent l’encodeur audio prendre un peu d’avance avant que la transcription ne commence.
Diarisation
Répondre à “qui parle quand” : segmenter l’audio par locuteur et attribuer chaque segment à une voix. C’est une tâche distincte de la transcription - un STT peut produire un texte parfait sans avoir la moindre idée du nombre de personnes présentes. Les deux se combinent en pipeline.
Référence : pyannote.audio: neural building blocks for speaker diarization | arXiv (Bredin et al., 2019)
Diffusion
Un paradigme de génération qui part d’un état bruité et le nettoie par étapes itératives, au lieu de produire la sortie d’un coup. Pour les images, le bruit est gaussien ; pour le texte, on masque des tokens et le modèle les reconstruit par passes. Appliquée à un LLM, elle permet de raffiner un bloc entier de tokens en parallèle (ex. DiffusionGemma) au lieu d’un token à la fois.
Référence : Denoising Diffusion Probabilistic Models | arXiv
Distillation
Entraîner un petit modèle (l’élève) à reproduire les sorties d’un gros (le professeur), plutôt que de l’entraîner directement sur les données brutes. On obtient un modèle plus rapide et plus léger qui conserve une bonne part de la qualité. distil-whisper en est un exemple côté transcription.
Référence : Distilling the Knowledge in a Neural Network | arXiv
Draft model
Le petit modèle “draft” du speculative decoding, celui qui propose les tokens que le gros modèle validera. Il doit être nettement plus rapide que la cible tout en prédisant juste assez souvent : un draft trop médiocre fait rejeter tout le lot et coûte plus qu’il ne rapporte. Certaines approches s’en passent en réutilisant les couches du modèle cible lui-même.
Référence : Accelerating Large Language Model Decoding with Speculative Sampling | arXiv (Chen et al., 2023)
Décodeur
Dans un modèle séquence-à-séquence, la partie qui produit la sortie (du texte) à partir de la représentation interne de l’encodeur. Chez Whisper, le décodeur génère le texte token par token, en s’appuyant sur l’audio encodé (cross-attention) et sur son propre historique (attention causale). C’est le pendant de l’encodeur.
Référence : Attention Is All You Need | arXiv
Embedding
Un vecteur de nombres qui représente un sens. Chaque token est converti en un vecteur de plusieurs centaines ou milliers de dimensions, positionné de telle façon que deux éléments proches par le sens sont proches dans l’espace. C’est le format d’entrée du Transformer, et c’est aussi ce qu’on stocke dans une base vectorielle pour faire de la recherche sémantique.
Référence : Embeddings | Google Machine Learning Crash Course
Encodeur
Dans un modèle séquence-à-séquence (Whisper, Voxtral…), la partie qui lit l’entrée et la transforme en représentation interne : une suite de vecteurs que le décodeur va utiliser. Ex. chez Whisper, l’encodeur traite le spectrogramme audio ; chez Voxtral, un encodeur causal à attention glissante traite l’audio en continu. Un encodeur peut voir tout le contexte (bidirectionnel) ou seulement le passé (causal).
Référence : Attention Is All You Need | arXiv
EOS
End Of Sequence. Le token spécial qui marque la fin de la génération. Quand le modèle le produit, il s’arrête : la réponse est terminée. C’est un point final codé dans le vocabulaire, pas un mot comme les autres.
Expert
Dans un MoE, un petit réseau FFN parmi des dizaines ou des centaines par couche. Chaque token n’en consulte que quelques-uns, choisis par le routeur. Les experts d’une couche pèsent ensemble l’essentiel du modèle : dans Qwen3.8-Flash-Next, 512 experts par couche sur 48 couches font 96 % des paramètres du modèle texte. C’est pour ça que retirer des experts fait maigrir un modèle bien plus qu’aucune autre intervention.
Référence : Switch Transformers | arXiv
Fenêtre de contexte
Le nombre maximum de tokens que le modèle peut avoir sous les yeux, prompt et réponse compris. 256K tokens, c’est de l’ordre de 800 pages. Elle se paie cher : le KV cache grandit avec elle, et c’est souvent lui, pas les poids, qui fait déborder la VRAM. Les attentions à fenêtre glissante existent précisément pour rendre les grands contextes tenables.
Référence : Lost in the Middle: How Language Models Use Long Contexts | arXiv (Liu et al., 2023 — une grande fenêtre ne garantit pas qu’elle soit exploitée)
FFN
Feed-Forward Network. Le bloc de chaque couche du Transformer appliqué après l’attention : une transformation non linéaire, token par token et sans interaction entre tokens. C’est là que vit l’essentiel des paramètres d’un LLM.
Référence : Attention Is All You Need | arXiv
Fine-tuning
Ré-entraîner un modèle déjà pré-entraîné sur un jeu de données spécifique, pour l’adapter à un domaine, un format de sortie ou une langue. Beaucoup moins coûteux que l’entraînement initial, mais pas gratuit : il faut des données propres, et un fine-tune raté dégrade les capacités générales du modèle.
Référence : Universal Language Model Fine-tuning for Text Classification | arXiv (Howard & Ruder, 2018)
GGUF
Le format de fichier de llama.cpp : un fichier unique qui contient les poids quantifiés, le tokenizer et les métadonnées du modèle. C’est ce qu’on télécharge depuis Hugging Face pour faire tourner un modèle en local, et ce que servent llama.cpp et Ollama. Successeur du format GGML.
Référence : GGUF | Hugging Face
GQA
Grouped Query Attention. Variante de l’attention multi-têtes qui groupe les têtes Key/Value et les fait partager par plusieurs têtes Query. Le nombre de têtes K/V diminue, donc la mémoire du cache diminue, pour une perte de qualité minime. C’est le choix de Gemma et de la plupart des LLM récents.
Référence : GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints | arXiv
Hallucination
Une sortie fluide et plausible, mais fausse. En transcription, c’est typiquement une phrase inventée sur un passage silencieux ou bruité, souvent une formule vue des milliers de fois à l’entraînement. En génération de texte, c’est un fait, une citation ou une fonction d’API qui n’existent pas. Le modèle ne sait pas qu’il ne sait pas : il produit toujours la suite la plus probable.
Référence : Survey of Hallucination in Natural Language Generation | arXiv (Ji et al., 2022)
Held-out
Un jeu de texte mis de côté, jamais utilisé pour entraîner ni pour calibrer, qui sert uniquement à mesurer. Comparer un modèle modifié à l’original sur un held-out garantit qu’on n’a pas noté l’élève sur les exercices qu’il a révisés. La mesure classique sur un held-out est la perplexité.
Hyper-connexions
Une généralisation des connexions résiduelles : au lieu d’un seul flux qui traverse le modèle en recevant l’apport de chaque couche, plusieurs flux parallèles circulent, et chaque couche apprend comment les lire et comment y écrire. Qwen3.8-Flash-Next en fait circuler plusieurs entre ses couches, ce qui multiplie d’autant la taille des activations stockées entre deux couches pendant une calibration.
Référence : Hyper-Connections | arXiv
imatrix
Importance matrix. Un fichier produit par llama-imatrix en faisant passer un corpus de calibration dans un modèle : pour chaque matrice de poids, il enregistre l’importance de chaque colonne, c’est-à-dire à quel point les activations y sont fortes. À la quantization, llama-quantize s’en sert pour préserver les colonnes qui comptent et sacrifier les autres. C’est ce qui rend un Q3 acceptable là où un Q3 « aveugle » serait dégradé.
Référence : imatrix | llama.cpp
Instruction-tuned
Se dit d’un modèle qui a reçu, après le pré-entraînement, une phase supplémentaire pour apprendre à suivre des instructions et tenir une conversation. C’est la différence entre la variante -it (ou -instruct) et le modèle “base”, qui se contente de continuer un texte. Les benchmarks publiés portent en général sur la version instruction-tuned : comparer un base et un -it n’a pas de sens.
Référence : Training language models to follow instructions with human feedback | arXiv (InstructGPT, Ouyang et al., 2022)
Isolation Forest
Un algorithme de détection d’anomalies qui construit des arbres en coupant les données au hasard. Un point aberrant se retrouve isolé en très peu de coupes ; un point normal, noyé dans la masse, en demande beaucoup. Le score d’anomalie est cette profondeur moyenne d’isolation. Il n’a pas besoin d’exemples d’anomalies pour être entraîné, ce qui le rend commode en supervision.
Référence : Isolation Forest | scikit-learn
Jitter
En traitement de la voix, l’instabilité de la hauteur d’un cycle vocal au suivant. Une voix saine varie peu d’une période à l’autre ; un jitter élevé s’entend comme une voix éraillée ou rugueuse. Se mesure sur un enregistrement, sans référence, ce qui en fait un indicateur utile pour comparer des sorties de TTS entre elles.
K-quants
La famille de formats de quantization de llama.cpp dont le nom contient _K : Q3_K_M, Q4_K_M, Q6_K. Les poids sont découpés en blocs, chaque bloc a sa propre échelle, et le suffixe S, M ou L dit quels tenseurs sensibles gardent plus de bits. Un Q3_K_M pèse environ 3,4 bits par poids en moyenne. Les variantes UD d’Unsloth choisissent le type tenseur par tenseur.
Référence : k-quants | llama.cpp PR #1684
KV Cache
Cache mémoire qui stocke les clés (K) et valeurs (V) des tokens déjà traités. À chaque nouveau token généré, le modèle ne recalcule que la colonne du nouveau token au lieu de refaire tout l’historique. C’est ce qui rend la génération auto-régressive viable en pratique, et c’est souvent ce qui limite la VRAM.
Référence : Transformer Inference Arithmetic | Kipp
Linéarisation des experts
Les checkpoints MoE récents rangent les experts d’une couche en deux tenseurs 3D, gate_up_proj et down_proj, une tranche par expert. Pour poser un hook sur chaque expert et mesurer sa sortie séparément, llm-compressor les déplie en autant de petites couches linéaires 2D, une par expert et par matrice : c’est la linéarisation. Elle se paie au chargement, 23 secondes par couche depuis un NVMe sur Flash-Next, et le modèle sauvegardé garde ce format déplié, que le convertisseur de llama.cpp sait réempiler.
llama.cpp
Un moteur d’inférence en C/C++ qui fait tourner des modèles quantifiés au format GGUF, sur GPU comme sur CPU. Léger, sans dépendance Python, il expose un serveur HTTP compatible avec l’API OpenAI. C’est l’option de référence en homelab quand on veut plusieurs modèles sur une machine, plutôt qu’un seul modèle servi à beaucoup d’utilisateurs.
Référence : ggml-org/llama.cpp | GitHub
Logit
Le score brut que le modèle attribue à chaque token du vocabulaire, avant toute normalisation. Un logit n’est pas une probabilité : c’est un nombre non borné, qui peut être négatif. C’est le softmax qui le convertit en probabilité.
Référence : Deep Learning, chap. 6.2.2 — Output Units (Goodfellow, Bengio, Courville)
LoRA
Low-Rank Adaptation. Une méthode de fine-tuning qui gèle les poids d’origine et n’entraîne que de petites matrices additionnelles insérées dans les couches. On passe de milliards de paramètres à entraîner à quelques millions : ça tient sur une carte grand public, et l’adaptateur produit ne pèse que quelques dizaines de Mo.
Référence : LoRA: Low-Rank Adaptation of Large Language Models | arXiv
Mamba
Une architecture de modèle séquentiel concurrente du Transformer, basée sur les state space models : au lieu de l’attention (coût quadratique), elle maintient un état interne récurrent et traite la séquence linéairement, ce qui la rend très économe en mémoire sur les longues séquences. Des modèles hybrides (ex. Jamba) mélangent couches Mamba et couches d’attention. Dans llama.cpp, le support de Mamba a longtemps reposé sur des opérations tensorielles dédiées.
Référence : Mamba: Linear-Time Sequence Modeling with Selective State Spaces | arXiv
MASK
Masked token. Le placeholder qui remplace un token masqué dans la diffusion discrète : le modèle doit le reconstruire. C’est le “bruit” de la diffusion textuelle, comme dans DiffusionGemma.
Référence : BERT: Pre-training of Deep Bidirectional Transformers | arXiv (Devlin et al., 2018 — le masked language modeling)
Masque de causalité
Dans un modèle autorégressif, une matrice qui interdit à un token de regarder les tokens futurs : la partie au-dessus de la diagonale de la matrice d’attention est mise à -∞, donc la softmax lui donne un poids nul. Chaque token ne voit que son passé, ce qui impose la génération de gauche à droite.
Référence : Attention Is All You Need | arXiv
MCP
Model Context Protocol. Un protocole ouvert qui standardise la façon dont un modèle accède à des outils et des données externes. Un serveur MCP expose des tools (des actions) et des resources (des lectures) ; n’importe quel client compatible peut s’y brancher, ce qui évite de réécrire une intégration par couple modèle/outil.
Référence : Model Context Protocol
Memory-bound / Compute-bound
Ce qui limite réellement une opération sur GPU. Memory-bound : le calcul attend que les données arrivent de la mémoire - c’est le cas de la génération token par token, où l’intégralité des poids est relue pour produire une seule prédiction, laissant les unités de calcul largement inoccupées. Compute-bound : les unités de calcul sont saturées, on exploite la carte. Beaucoup d’optimisations d’inférence consistent à convertir du memory-bound en compute-bound.
Référence : Transformer Inference Arithmetic | kipp.ly
MoE
Mixture of Experts. Architecture où un routeur active seulement un sous-ensemble d’experts (des FFN spécialisés) pour chaque token. Le modèle total peut être très gros (30B, 100B+) tout en n’activant qu’une fraction des paramètres par token, ce qui économise le calcul et la mémoire.
Référence : Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer | arXiv (Shazeer et al., 2017)
MTP
Multi-Token Prediction : une ou plusieurs têtes de prédiction entraînées en même temps que le modèle, capables de proposer les tokens suivants sans passer par un second modèle. C’est du speculative decoding sans draft model séparé : la tête est embarquée dans le fichier de poids, elle ne coûte presque rien en VRAM, mais elle est aussi moins fine qu’un draft dédié. Qwen3.5 et suivants, DeepSeek-V3 et suivants en embarquent une.
Multimodal
Se dit d’un modèle qui traite plusieurs types d’entrée dans le même réseau : texte, image, audio, vidéo. La difficulté n’est pas de lire chaque modalité séparément, mais de les ramener dans un espace de représentation commun - où une trame audio et un token de texte sont des vecteurs de même dimension, que le Transformer traite sans savoir d’où ils viennent.
Référence : Learning Transferable Visual Models From Natural Language Supervision | arXiv (CLIP, Radford et al., 2021)
Offload
Garder une partie des poids hors de la mémoire où ils s’exécutent : en RAM quand la VRAM est pleine, sur disque NVMe quand la RAM l’est aussi, et les rapatrier au moment où la couche en a besoin. Pendant une calibration couche par couche, une seule couche vit sur le GPU à la fois ; le reste attend ailleurs. C’est ce qui permet de pruner un modèle de 360 Go sur une carte de 80 Go, au prix de lectures disque.
PAD
Padding. Le token spécial qui complète une séquence jusqu’à une longueur fixe quand le contenu réel est plus court. Le modèle apprend à l’ignorer. Ex. chez Voxtral, 32 tokens PAD laissent l’encodeur accumuler du contexte audio avant la transcription.
Perplexité
La mesure standard de la qualité d’un modèle de langage sur un texte : à chaque token, le modèle donne une probabilité au token qui vient réellement ; la perplexité est l’inverse de la moyenne géométrique de ces probabilités. Plus elle est basse, moins le texte « surprend » le modèle. On ne compare que des perplexités calculées sur le même texte avec le même tokenizer ; l’écart en pourcentage entre un modèle modifié et l’original est un bon premier indicateur de dégradation.
Référence : Perplexity of fixed-length models | Hugging Face
PLE
Per-layer embedding, ou table n-gram. Dans Qwen3.8-Flash-Next, une table de 51 milliards de paramètres qui associe un vecteur à chaque bigramme et trigramme de tokens, injectée dans le flux à une couche donnée. C’est une mémoire lexicale géante, consultée par simple lecture de lignes, qui ne participe pas au calcul comme les experts. Elle est stockée en 128 morceaux dans le checkpoint mais reconstituée en un seul tenseur de 102 Go au chargement, ce qui en fait le principal obstacle pratique à toute manipulation du modèle.
Référence : Qwen3.8-Flash-Next | Hugging Face
Prefill / Decode
Les deux phases de l’inférence. Le prefill traite tout le prompt d’un coup, en parallèle : le GPU calcule à plein régime, et c’est cette phase qui détermine le délai avant le premier token. Le decode génère ensuite les tokens un par un, chacun exigeant de relire tous les poids : le GPU passe son temps à attendre la mémoire. Deux phases, deux goulots, deux jeux d’optimisations.
Référence : Splitwise: Efficient Generative LLM Inference Using Phase Splitting | arXiv (Patel et al., 2023 — la démonstration que les deux phases ont des profils opposés)
Prosodie
Tout ce que porte la parole en plus des mots : la mélodie (la hauteur qui monte et descend), le rythme (durée des syllabes, pauses) et l’accentuation. C’est ce qui distingue une question d’un ordre sans changer un seul mot. Une hauteur qui ne bouge pas donne la voix de robot ; une variation de hauteur à l’intérieur d’une phrase est donc normale, et la pénaliser dans une métrique de qualité revient à récompenser la platitude.
Pruning d’experts
Retirer une partie des experts d’un MoE pour réduire sa taille, sans ré-entraîner. On choisit lesquels retirer d’après une calibration, on tranche les tenseurs correspondants et les lignes du routeur, et on réécrit le nombre d’experts dans la configuration. Le modèle perd ce que savaient les experts retirés ; l’enjeu est de retirer ceux qui contribuent le moins. REAP est une méthode de choix ; compter les sollicitations en est une autre, plus simple.
Référence : REAP | arXiv
Quantization
Réduire la précision des poids du modèle pour qu’il tienne en mémoire. Au lieu de stocker chaque paramètre sur 16 bits, on le stocke sur 8, 5 ou 4 bits. Un modèle de 12 milliards de paramètres passe ainsi de ~24 Go à ~6,6 Go. Les formats llama.cpp se lisent comme Q4_K_M : 4 bits, variante K, taille moyenne. Le coût est une perte de qualité, négligeable en Q8, perceptible en dessous de Q4.
Référence : A Gentle Introduction to 8-bit Matrix Multiplication | Hugging Face
RAG
Retrieval-Augmented Generation. Aller chercher les passages pertinents dans une base documentaire, puis les injecter dans le prompt pour que le modèle réponde à partir d’eux. Ça évite de ré-entraîner à chaque changement de données, et ça permet de citer des sources. La qualité du système dépend presque entièrement de l’étape de recherche, pas du modèle.
Référence : Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks | arXiv
REAP
Router-weighted Expert Activation Pruning, Cerebras, octobre 2025. Une méthode de pruning d’experts qui classe chaque expert par sa saliency plutôt que par sa fréquence de sollicitation, puis retire les moins saillants couche par couche. Implémentée dans llm-compressor sous le nom REAPPruningModifier, avec un paramètre sparsity qui est la fraction d’experts retirés.
Référence : REAP the Experts | arXiv et blog Cerebras
Recherche hybride
Combiner la recherche lexicale (BM25, qui compte les mots exacts) et la recherche vectorielle (qui capte le sens). L’une trouve HttpError quand vous tapez HttpError, l’autre trouve la gestion d’erreurs quand vous tapez “comment les erreurs sont traitées”. La fusion se fait souvent par RRF (Reciprocal Rank Fusion), qui combine les rangs et non les scores - ce qui dispense de normaliser deux échelles incomparables.
Référence : Reciprocal Rank Fusion outperforms Condorcet and individual Rank Learning Methods | SIGIR ‘09 (Cormack et al., 2009)
Reranker
Un second modèle qui re-classe les résultats d’une première recherche. Là où l’embedding compare un vecteur de requête à des vecteurs de documents calculés séparément, le reranker lit la paire (requête, document) ensemble et note leur pertinence réelle. Beaucoup plus précis, beaucoup plus lent : on l’applique aux quelques dizaines de premiers résultats, jamais au corpus entier.
Référence : Passage Re-ranking with BERT | arXiv (Nogueira & Cho, 2019 — le cross-encoder de reranking)
RoPE
Rotary Position Embedding. Technique qui encode la position d’un token en appliquant des rotations aux paires de coordonnées des vecteurs Query et Key, en fonction de leur distance. Le modèle sait où se trouve chaque token sans ajouter un vecteur de position fixe.
Référence : RoFormer: Enhanced Transformer with Rotary Position Embedding | arXiv
Routeur
Dans un MoE, la petite couche qui, pour chaque token, choisit quels experts consulter et avec quel poids. Techniquement une matrice avec une ligne par expert : le produit avec le vecteur du token donne un score par expert, on garde les meilleurs. Après un pruning, le routeur conserve ses poids d’origine et choisit simplement parmi les experts restants.
RTF
Real-Time Factor. Le rapport entre le temps de calcul et la durée de l’audio. En STT, le temps de transcription ; en TTS, le temps de génération. RTF = 1 : la transcription prend autant de temps que l’audio. RTF < 1 : plus rapide que le temps réel (0,3 = ~3× plus rapide). C’est la mesure de vitesse standard d’un STT comme d’un TTS. Attention en TTS : le dénominateur est produit par le modèle testé, donc un modèle qui parle plus lentement améliore son RTF sans avoir accéléré. Comparer aussi le coût par unité de travail.
Référence : Open ASR Leaderboard | Hugging Face
RTFx
L’inverse du RTF, utilisé notamment par l’Open ASR Leaderboard : RTFx = durée de l’audio / temps de transcription. Plus c’est haut, mieux c’est - un RTFx de 100 signifie qu’une heure d’audio se transcrit en 36 secondes. Attention en comparant deux benchmarks : RTF et RTFx vont dans des sens opposés.
Référence : Open ASR Leaderboard | Hugging Face (RTFx y est la métrique de vitesse affichée)
safetensors
Le format de fichier des poids sur Hugging Face : un en-tête JSON qui décrit chaque tenseur (nom, type, forme, position) suivi des données brutes. Il se lit par projection en mémoire, donc on peut n’en charger qu’une partie, et il ne peut pas exécuter de code à l’ouverture, contrairement aux anciens fichiers pickle. Un gros modèle est découpé en dizaines de fichiers reliés par un index.
Référence : safetensors | Hugging Face
Saliency
Dans REAP, le score qui décide du sort d’un expert : la moyenne, sur les tokens qui lui ont été envoyés, du poids que lui donne le routeur multiplié par la norme de ce qu’il renvoie. Un expert rarement choisi mais dont la contribution est grande quand il l’est obtient une saliency élevée ; un expert souvent choisi avec un poids minuscule, une saliency faible. C’est ce qui distingue REAP d’un simple comptage des sollicitations.
Similarité cosinus
La mesure de proximité entre deux embeddings : le cosinus de l’angle qu’ils forment. 1 = même direction donc même sens, 0 = sans rapport. On regarde l’angle plutôt que la distance parce que seule l’orientation du vecteur porte le sens ; sa longueur, elle, reflète surtout la fréquence des termes.
Référence : Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks | arXiv (Reimers & Gurevych, 2019)
Softmax
La fonction qui transforme la liste des logits en distribution de probabilités : chaque valeur devient positive, et leur somme fait 1. C’est l’étape qui permet de dire “68 % de chances que le prochain token soit mange” plutôt que “score brut 4,2”.
Référence : Deep Learning, chap. 6.2.2.3 — Softmax Units (Goodfellow, Bengio, Courville)
Sparsity
Dans le pruning d’experts, la fraction d’experts retirés par couche : 0.375 fait passer 512 experts à 320, 0.4375 à 288. C’est le seul réglage de REAPPruningModifier avec la liste des couches à ignorer. Le nombre retiré est arrondi vers le bas, et l’outil refuse une sparsity qui laisserait moins d’experts que le routeur n’en choisit par token.
Spectrogramme mel
La représentation d’un signal audio en image temps-fréquence : on découpe le signal en courtes fenêtres, on calcule leur transformée de Fourier (FFT), puis on replie les fréquences sur l’échelle “mel” (la perception humaine de la hauteur, sensible aux basses fréquences). C’est l’entrée standard des modèles de transcription comme Whisper.
Référence : Robust Speech Recognition via Large-Scale Weak Supervision | arXiv (Whisper, §2.2 — le log-mel 80 canaux en entrée)
Speculative decoding
Faire prédire plusieurs tokens d’avance par un petit modèle rapide, puis les faire vérifier tous en une seule passe par le gros modèle, qui ne conserve que le plus long préfixe correct. Comme la génération est memory-bound, vérifier N tokens coûte à peu près autant qu’en générer un seul : le gain est réel. Et le résultat est identique à ce que le gros modèle aurait produit tout seul - on n’échange pas de la qualité contre de la vitesse.
Référence : Fast Inference from Transformers via Speculative Decoding | arXiv
Spéculation n-gram
Prédire les prochains tokens sans aucun modèle, en cherchant dans le texte déjà présent (prompt et sortie en cours) une suite identique à celle qu’on vient d’écrire, puis en proposant ce qui suivait. Coût mémoire négligeable, aucune inférence. Ne produit rien sur du texte inédit, mais propose des dizaines de tokens d’un coup dès que le modèle recopie un passage : réécriture de fichier, résumé qui cite, raisonnement qui reprend sa conclusion.
STT
Speech-to-Text, aussi appelé reconnaissance vocale ou transcription. La tâche qui transforme de l’audio en texte : le modèle écoute le signal sonore et produit la transcription. Ex. Whisper, Parakeet, Voxtral, VibeVoice-ASR. C’est l’inverse du TTS.
Référence : Robust Speech Recognition via Large-Scale Weak Supervision | arXiv (Whisper, Radford et al., 2022)
Température
Le paramètre qui divise les logits avant le softmax, et règle donc à quel point la distribution est piquée. Température basse (0,1) : le modèle prend presque toujours le token le plus probable, sortie déterministe et un peu plate. Température haute (1,2) : les tokens moins probables remontent, sortie plus variée et plus risquée. Elle s’applique avant le top-k et le top-p.
Référence : Distilling the Knowledge in a Neural Network | arXiv (Hinton et al., 2015 — §2, la température dans le softmax)
Tensor split
Répartir les poids d’un même modèle sur plusieurs GPU quand il ne tient pas sur une seule carte. Un tensor_split de "0.25,0.75" place un quart des couches sur la première carte et trois quarts sur la seconde. À distinguer de l’épinglage d’un modèle entier à une carte via CUDA_VISIBLE_DEVICES, qui isole les modèles mais ne partage rien.
Référence : Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism | arXiv (Shoeybi et al., 2019)
Tokenization
Le découpage du texte en tokens - des morceaux de mots - puis leur conversion en identifiants numériques. “Le chat mange” ne devient pas trois nombres mais une suite d’identifiants puisés dans un vocabulaire fixe (souvent 32k à 256k entrées), où un mot rare se casse en plusieurs morceaux. Le tokenizer est propre à chaque modèle : deux modèles ne découpent pas la même phrase pareil, et un texte français coûte généralement plus de tokens que le même texte en anglais.
Référence : Summary of the tokenizers | Hugging Face
Tool call
Function calling. Le mécanisme par lequel un modèle, au lieu de répondre en texte, émet un appel structuré vers une fonction externe : nom de l’outil et arguments en JSON. L’application exécute l’appel et renvoie le résultat au modèle, qui poursuit. C’est ce qui transforme un modèle de langage en agent - et la boucle où tout retransite par le modèle est aussi ce qui fait exploser la consommation de tokens.
Référence : Toolformer: Language Models Can Teach Themselves to Use Tools | arXiv (Schick et al., 2023)
Top K
Paramètre de génération : à chaque pas, on ne garde que les K tokens les plus probables et on tire le suivant parmi eux. Réduit les choix improbables, au prix d’un peu de diversité. Souvent combiné avec top-p.
Référence : How to generate text with transformers | Hugging Face
Top P
Nucleus sampling. Paramètre de génération : on garde le plus petit ensemble de tokens dont la probabilité cumulée dépasse P, puis on tire le suivant dans cet ensemble. Plus adaptatif que top-k, car la taille de l’ensemble s’ajuste à la confiance du modèle.
Référence : How to generate text with transformers | Hugging Face
Transformer
L’architecture de réseau de neurones à la base des LLM modernes (GPT, Llama, Gemma…). Contrairement aux anciens modèles qui lisaient le texte mot après mot, le Transformer traite toute la séquence en parallèle grâce au mécanisme d’attention, dans une pile de couches identiques (attention + FFN, entourées de connexions résiduelles et de normalisation). Introduit en 2017 dans le papier “Attention Is All You Need”.
Référence : Attention Is All You Need | arXiv
TTFT
Time To First Token. Le délai entre l’envoi du prompt et le premier token généré, déterminé par la phase de prefill. À ne pas confondre avec le débit de génération (tokens par seconde) qui, lui, dépend de la phase de decode.
Attention au premier token : sur un modèle qui raisonne, ce n’est pas le premier caractère de la réponse. Le modèle émet d’abord des centaines de tokens de raisonnement dans un champ séparé (reasoning_content), et un appel d’outil n’émet aucun texte du tout. Mesurer le TTFT sur l’apparition de la réponse visible revient alors à additionner le prefill et tout le raisonnement — mesuré sur Qwen3.8-27B : 473 ms de prefill rapportés comme 3 691 ms. On distingue donc le TTFT (premier token quel qu’il soit) du TTFC, time to first content, qui marque le début de la réponse visible ; l’écart entre les deux est le coût du raisonnement.
Référence : vLLM — Metrics (définitions de TTFT, TPOT et ITL telles que mesurées en production)
TTS
Text-to-Speech, la synthèse vocale. La tâche inverse du STT : à partir de texte, le modèle génère un signal audio, une voix qui parle. Ex. Microsoft VibeVoice. Fabriquer du son à partir de tokens n’a rien à voir avec transcrire de l’audio en tokens : les deux familles n’ont ni la même entrée, ni la même sortie, ni les mêmes architectures.
Référence : WaveNet: A Generative Model for Raw Audio | arXiv (van den Oord et al., 2016)
VAD
Voice Activity Detection. Un petit modèle placé en amont du STT, qui repère où quelqu’un parle et où il n’y a que du silence. Il sert à deux choses : ne pas dépenser de calcul sur les blancs, et éviter les hallucinations - un modèle comme Whisper, à qui on donne trois secondes de silence, invente volontiers une phrase.
Référence : Silero VAD | GitHub (le VAD le plus utilisé en amont des pipelines STT)
Vision Transformer
ViT. Un Transformer appliqué aux images : la photo est découpée en patchs carrés, chaque patch est projeté en vecteur, et la pile d’attention traite la séquence de patchs comme elle traiterait des mots. Longtemps l’encodeur de vision standard des modèles multimodaux, avec plusieurs centaines de millions de paramètres à sa charge - c’est précisément lui que les architectures encoder-free suppriment.
Référence : An Image is Worth 16x16 Words | arXiv
vLLM
Un serveur d’inférence orienté débit, conçu pour servir un modèle à de nombreux utilisateurs simultanés. Il doit ses performances au PagedAttention - une gestion du KV cache par pages, comme la mémoire virtuelle d’un OS - et au continuous batching. En contrepartie, il charge un modèle par instance et réserve la VRAM de façon bien plus rigide que llama.cpp.
Référence : vLLM | Documentation
VRAM
La mémoire embarquée sur la carte graphique. C’est la ressource qui décide quels modèles vous pouvez faire tourner : les poids, le KV cache et les activations doivent tous y tenir. Une RTX 3090 en a 24 Go. Quand ça déborde, une partie bascule en RAM système et le débit s’effondre.
WER
Word Error Rate. Le taux d’erreur de mots : la proportion de mots mal transcrits par rapport à une référence (0 % = parfait). Il se calcule en comptant les mots insérés, supprimés ou substitués, divisés par le nombre de mots de la référence. Plus c’est bas, meilleure est la transcription.
Référence : Open ASR Leaderboard | Hugging Face (protocole de calcul et classement de référence)
Z-score
De combien d’écarts-types une valeur s’éloigne de la moyenne. Un z-score de 3 signifie “trois écarts-types au-dessus de la normale”. Simple et lisible, mais il suppose une distribution à peu près normale et stable : sur une métrique à cycles jour/nuit ou à paliers, il déclenche à tort.
Référence : NIST/SEMATECH e-Handbook of Statistical Methods, §1.3.5.17
Échantillonnage
Sample rate. Le nombre de mesures de l’amplitude du son prises par seconde. Les modèles de parole travaillent quasiment tous en 16 kHz, soit 16 000 valeurs par seconde : c’est suffisant pour la voix, et bien plus léger que les 44,1 kHz de la musique. Un audio dans un autre taux doit être ré-échantillonné avant d’entrer dans le modèle.
Référence : Communication in the Presence of Noise | Proceedings of the IRE (Shannon, 1949 — le théorème d’échantillonnage)
YOLO
Famille de détecteurs d’objets en une seule passe (« You Only Look Once ») : l’image traverse le réseau une fois et ressort avec toutes ses boîtes et leurs classes. Chaque version existe en plusieurs tailles, du nano (quelques millions de paramètres, pour l’embarqué) au x (plusieurs dizaines de millions, pour un GPU). YOLO-World est une variante à vocabulaire ouvert : on lui donne les classes en texte.
Référence : You Only Look Once: Unified, Real-Time Object Detection | arXiv