Most prompt-injection filters are a regex someone wrote once. This one scores against a real corpus of documented attacks, and the corpus is public domain so you can just take it.
Dataset: https://github.com/simalidudu-boop/adversarial-prompt-injection-dataset
Top comments (0)