Noticias sobre ArtPrompt
1 artículos relacionados
ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models
AI InsightLos ataques ASCII funcionan incorporando solicitudes dañinas en el arte ASCII y haciéndose pasar por crítica de arte, lo que permite que LLM caiga entre rechazos y proporciona detalles procesables con una sola ronda de interacción de caja negra. Expone un problema profundamente arraigado: la alineación de seguridad funciona principalmente en formas superficiales. Una vez que se recontextualiza la forma en que el modelo interpreta las instrucciones, el filtrado de seguridad original dejará de ser válido. La defensa debe pasar de la coincidencia superficial a la comprensión semántica.Importancia 60/100