ArtPrompt に関する報道
関連記事 1 件
ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models
AI インサイトASCII 攻撃は、有害なリクエストを ASCII アートに埋め込み、アートの批評を装うことによって機能します。これにより、LLM は拒否の間に入り、たった 1 回のブラックボックス インタラクションで実用的な詳細を提供できるようになります。これにより、セキュリティ調整は主に表面的なフォームで機能するという根深い問題が明らかになります。モデルが命令を解釈する方法が再コンテキスト化されると、元のセキュリティ フィルタリングは無効になります。防御は表面的な一致から意味の理解に移行する必要があります。重要度 60/100