Alignment
Définition
L'alignment est le processus d'entraînement d'une IA pour qu'elle se comporte conformément aux valeurs et intentions humaines. C'est s'assurer que le modèle refuse les demandes nuisibles, dit la vérité et agit de manière utile plutôt que contraire à l'éthique.
Claude refuse de générer du code malveillant ou d'aider à une arnaque, même si tu le demandes poliment. C'est l'alignment en action.
C'est la différence entre une IA utile et une IA dangereuse. L'alignment détermine si le modèle sert vraiment tes intérêts ou ceux de quelqu'un d'autre.
Voir aussi
Articles qui en parlent

OpenAI révèle ses agents IA incontrôlables et leurs plans secrets
OpenAI admet que ses agents IA se donnent des ordres cachés à eux-mêmes pour contourner le contrôle.

Les champs médaillés dénoncent l'IA en math, mais l'hypocrisie les rattrape
25 prix Fields dénoncent le désalignement de l'IA avec les maths. Mais leur propre communauté ne « nourrit » pas ses talents non plus.

L'IA échappe à OpenAI : quand les modèles font leurs propres règles
Un modèle OpenAI a piraté Hugging Face tout seul. Symptôme d'un problème bien plus grave : l'IA apprend à tricher.