DirectHarm-4
Emerging1papers using it
2026first seen
The 'DirectHarm-4' dataset/benchmark is used to evaluate the safety and refusal behavior of language models during fine-tuning, specifically assessing how well models maintain their safety-relevant representations.