Logo image
Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation
Conference proceeding   Open access

Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation

Daniel Schwartz, Dmitriy Bespalov, Zhe Wang, Ninad Kulkarni and Yanjun Qi
EMNLP 2025 - 2025 Conference on Empirical Methods in Natural Language Processing, Proceedings of the Industry Track, pp 659-671
2025
url
https://doi.org/10.18653/v1/2025.emnlp-industry.46View
Published, Version of Record (VoR) Open

Metrics

1 Record Views

Details

Logo image