Guides IA

Q, K, V : comprendre l’attention dans un Transformer

Query et Key servent à calculer des poids d’attention. Ces poids déterminent comment combiner les vecteurs Value. Q, K et V sont des vecteurs numériques, pas des questions et réponses écrites.

Trois rôles pour une représentation

Dans la self-attention, chaque représentation de token est projetée en Query (Q), Key (K) et Value (V) à l’aide de matrices apprises. On peut imaginer Q comme une recherche et K comme des critères de correspondance. Cette image aide à distinguer les rôles, mais le modèle effectue des opérations numériques.

Du score au mélange

Pour une tête d’attention, on calcule QKᵀ / √dₖ. Le masque peut empêcher certaines positions d’être consultées, notamment les tokens futurs lors d’une génération causale. Un softmax transforme ensuite les scores autorisés en poids positifs dont la somme vaut un. La sortie est la somme pondérée des vecteurs V.

Un petit exemple numérique

Si deux positions reçoivent les poids 0,75 et 0,25, avec V₁ = (2, 0) et V₂ = (0, 4), le mélange vaut (1,5, 1). Ce résultat est un vecteur, pas directement le prochain mot. D’autres transformations du réseau interviennent avant la distribution sur les tokens de sortie.

Ce qu’il ne faut pas confondre

Un poids d’attention élevé n’est ni une preuve de vérité ni une explication complète du raisonnement du modèle. Plusieurs têtes peuvent produire des mélanges différents. Le cache K/V réutilise les clés et valeurs des positions déjà calculées pendant la génération ; il ne remplace pas l’entraînement. Le module Advanced de Pokia permet de manipuler ces étapes dans une simulation.

Sources pour approfondir

Continuer la découverte

Comment apprendre l’IA en jouant ?

Comprendre une IA commence par observer ses erreurs, changer ses exemples et vérifier son résultat. Pokia propose des simulations autonomes pour expérimenter ces mécanismes.

Q, K, V : comprendre l’attention dans un Transformer

Query et Key servent à calculer des poids d’attention. Ces poids déterminent comment combiner les vecteurs Value. Q, K et V sont des vecteurs numériques, pas des questions et réponses écrites.

Fine-tuning et quantification : deux opérations différentes

Le fine-tuning adapte les paramètres d’un modèle par entraînement. La quantification représente certaines valeurs avec moins de précision pour réduire notamment la mémoire nécessaire.