Articles sur ASCII Attack
1 articles liés
ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models
AI InsightLes attaques ASCII fonctionnent en intégrant des requêtes nuisibles dans l'art ASCII et en se faisant passer pour une critique d'art, permettant à LLM de tomber entre des rebuffades et de fournir des détails exploitables avec un seul cycle d'interaction en boîte noire. Cela expose un problème profond : l’alignement de sécurité fonctionne principalement sur les formes de surface. Une fois la façon dont le modèle interprète les instructions est recontextualisée, le filtrage de sécurité d'origine deviendra invalide. La défense doit passer de la correspondance superficielle à la compréhension sémantique.Importance 60/100