Sécurité des modèles d’IA générative : les attaques itératives.
Nous allons évoquer un problème fondamental de sécurité des modèles d’IA générative : les attaques itératives.Le constat est important : même lorsqu’un modèle semble correctement protégé contre les prompts malveillants simples, il peut être progressivement contourné par une succession d’interactions calculées. Le sujet dépasse largement le “prompt jailbreak” classique.On parle ici d’attaques adaptatives, où l’attaquant … Continuer la lecture de Sécurité des modèles d’IA générative : les attaques itératives.